单个任务的 Token 与算力消耗高,部署能力没有跟着同比例增长。
能力与部署的悖论
技术和产品的迭代越来越快,实地部署却并没有越来越容易。这个差距会随着模型能力的提升而消失吗?
下面从算力、数据和数据获取路径三个方面展开,也说明 microNature 为什么这样设计。
现象:三条不同步的曲线
前沿实验室的演示越来越好看,真实场地里的部署成功率却没有跟着上去。两条曲线之间的距离这几年没有收窄,还在拉开。
把同一段时间拆成三层来看(FIG.A2),大致能看出问题卡在哪一层:
硬件这一端的进展很扎实:中国制造业机器人密度 470 台 / 万名员工,排在全球第三;2023 年新增安装 27.6 万台,约占全球的 51%(IFR)。产能、成本、可靠性都在按季度往前走。慢下来的是大脑。参数规模并不是主要原因,缺的是场景数据和按领域建立的物理模型:机器最终要干活的那片真实世界,还没有被完整数字化,也没有以物理上准确的形式交给模型。下面三节分别讲这三件事。
成因一:Token 与算力消耗高,能力不随之线性增长
通用机器人的主流路线是「像素 → 语义 → 推断 → 动作」,先把连续的物理世界压成离散的 Token,再交给大模型推断该做什么动作。代价是单个任务的 Token 与算力消耗都很高,而部署能力并没有跟着同比例上升。
成因二:数据总量很大,数据效率很低
常有人拿视频数据的体量来说明物理智能不缺数据。这里有个口径问题:一小时视频里含有的有效物理知识,可能还比不上一千字文本。视频记录的是像素之间的相关性,不是可以直接拿来执行的物理量,缺少力、接触约束以及动作与结果的对应关系。总量确实很大,能用上的部分很少。
换成「可用于训练的高质量具身数据」这个口径,缺口大致是这样:
成因三:四条数据路径,物理保真度都不够
目前获取具身数据主要有四条路径,逐条看下来,每条在物理保真度上都有各自的短板:
| 路径 | 做法 | 物理保真度问题 |
|---|---|---|
| 遥操作 | 人类远程操控真机,采集动作轨迹 | 物理上真实,但采集慢、成本高;力、热、接触这些量很难同步记全 |
| 第一人称视角 | 由头戴或机载相机采集 | 缺少全局几何与环境参数,遮挡多,大量物理状态观测不到 |
| 合成数据 | 通用仿真引擎批量生成 | 场景多为模板,物理参数和真实部署现场对不上,仿真到现实的落差主要由此而来 |
| 视频学习 | 从人类 / 网络视频中学习行为先验 | 没有动作标签,也没有物理量,学到的更接近「看起来像」,而不是「物理上做得到」 |
遥操作的成本账:靠人海采集为什么走不通
四条路径(A4)里物理保真度最高的是遥操作,但成本卡得很死:约 2,000 元 / 小时(Gartner)。按 1,000 万小时的需求量算,光采集这一项就要 200 亿元左右,还要配上一支很难规模化的操作团队。这笔账在商业上算不过来。
叠加起来:机器人的规模定律至今没有出现
总量很大,含有的有效物理知识很少,一小时视频可能不及一千字文本。
遥操作、第一人称视角、合成数据、视频学习四条路径,物理保真度都在门槛以下。
补上真实物理世界的那一层基建
差距的来源在供给一侧:场景数据和按领域建立的物理模型都还不够。硬件已经跑在前面,它等的是一层真实物理世界的基建,把部署现场变成机器可以训练、可以验证、可以打分的数字底座,同时把数据获取成本降到原来的 1/20 至 1/200。microNature 的架构就是照着这层基建设计的。
查看 microNature 架构 →数据来源
- IFR《World Robotics》:中国制造业机器人密度 470 台 / 万名员工(2023),全球第三;全球平均 162 台;2023 年中国新增安装 27.6 万台,约占全球 51%。
- Gartner 及行业估算:遥操作数据成本约 2,000 元 / 小时;人形机器人高质量数据缺口达万倍量级。
- 盖世汽车研究院:具身高质量数据存量约 50 万小时,通用能力需求约 1,000 万小时,缺口超 99%;物理 AI 数据量约为语言模型语料的 1/20,000;仿真可将单条数据成本降至 1/20 至 1/200。
- 弗若斯特沙利文:中国具身智能解决方案市场规模 2030 年预计约 1,426 亿元。
注:FIG.A3 与 FIG.A5 为结构性示意(趋势与相对关系),非测量值;具体口径以访谈与一手数据为准。