单任务 token 与算力消耗高,部署能力不随消耗线性增长。
能力与部署的悖论
产品越来越惊艳,真实部署却似乎越来越困难,这是为什么呢?换句话说,技术与能力之间的差距不会随着模型能力升级而自动消失吗?
下面从算力、数据和路径三个维度展开,说明为什么物理智能的基建是必经之路,以及 microNature 的成立与设计初衷。
现象:三条不同步的曲线
前沿实验室的 demo 越来越惊艳,真实场地的部署成功率却没有同步上升。这个 gap 没有收窄,反而在扩大。
把同一条时间轴拆成三层看(FIG.A2),问题出在哪一层,一目了然:
硬件一端完全没有问题:中国制造业机器人密度 470 台 / 万名员工,全球第三;2023 年新增安装 27.6 万台,约占全球 51%(IFR)。产能、成本、可靠性都在按季度进步。慢的是大脑,而大脑慢的根源,不是参数规模不够,而是场景数据与领域原生的物理建模严重不足:机器最终要工作的真实世界,还没有被数字化、被物理准确地供给给模型。以下三节逐一拆解。
成因一:token 与算力消耗高,能力不线性增长
通用机器人主流路线走的是「像素 → 语义 → 推断 → 动作」:把连续的物理世界折叠成离散 token,再由大模型推断动作。这条路线的代价是,单任务的 token 与算力消耗极高,而部署能力并没有随消耗线性增长。
成因二:数据总量天量,数据效率极低
常有人以「视频数据是天量的」来论证物理智能不缺数据。这是一个口径错误:小时级视频蕴含的有效物理知识,可能不及千词文本。视频里是像素相关性,不是可执行的物理量,没有力、没有接触约束、没有与动作的因果对齐。数据总量天量,数据效率极低。
把口径对齐到「可用于训练的高质量具身数据」,缺口是这样的:
成因三:四条主流数据路径,物理保真度均不足
目前行业获取具身数据的路径主要有四条。逐条拆开看,每一条都在物理保真度上有硬伤:
| 路径 | 做法 | 物理保真度问题 |
|---|---|---|
| 遥操作 | 人类远程操控真机,采集动作轨迹 | 物理真实但采集效率极低、成本极高;力、热、接触等物理量难以同步完整记录 |
| Ego 视角 | 第一人称视角采集(头戴 / 机载相机) | 缺全局几何与环境参数;视角遮挡严重,物理状态大量不可观测 |
| 合成数据 | 通用仿真引擎批量生成 | 模板化场景,物理参数与真实部署场景不对齐,是 sim2real gap 的主要来源 |
| 视频学习 | 从人类 / 网络视频中学习行为先验 | 无动作标签、无物理量,只有像素相关性;学到的是「看起来像」,不是「物理上可行」 |
遥操作成本对比:暴力采集为什么走不通
四条路径(A4)里物理保真度最高的遥操作,成本是硬约束:约 2,000 元 / 小时(Gartner)。按 1,000 万小时的需求量测算,纯遥操作采集需要约 200 亿元,还要叠加无法规模化的人力组织。这条路在商业上不成立。
叠加结论:Scaling Law 至今未出现
数据总量天量,有效物理知识极低,小时级视频或不及千词文本。
遥操作、ego、合成、视频学习四条路径,物理保真度全部在门槛之下。
缺的不是更大的模型,是缺失的那一层基建
gap 的根源不在模型参数,而在供给侧:场景数据与领域原生的物理建模严重不足。硬件已经跑在前面,等它的不是更大的模型,而是一层真实物理世界的基建,把部署场景变成机器可训练、可验证、可打分的物理数字基座,把数据获取成本打下 20 至 200 倍。谁先把这一层做扎实,谁就把 gap 变成自己的 moat。这正是 microNature 架构所对应的解法。
查看 microNature 架构 →数据来源
- IFR《World Robotics》:中国制造业机器人密度 470 台 / 万名员工(2023),全球第三;全球平均 162 台;2023 年中国新增安装 27.6 万台,约占全球 51%。
- Gartner 及行业估算:遥操作数据成本约 2,000 元 / 小时;人形机器人高质量数据缺口达万倍量级。
- 盖世汽车研究院:具身高质量数据存量约 50 万小时,通用能力需求约 1,000 万小时,缺口超 99%;物理 AI 数据量约为 LLM 语料的 1/20,000;仿真可将单条数据成本降至 1/20 至 1/200。
- 弗若斯特沙利文:中国具身智能解决方案市场规模 2030 年预计约 1,426 亿元。
注:FIG.A3 与 FIG.A5 为结构性示意(趋势与相对关系),非测量值;具体口径以访谈与一手数据为准。