SheetMN-A1
Title能力与部署的悖论
Issue2026.08
Scope配套材料

能力与部署的悖论

技术和产品的迭代越来越快,实地部署却并没有越来越容易。这个差距会随着模型能力的提升而消失吗?

Insights 三维度拆解 · 算力 / 数据 / 路径 与 MN-00 配套使用
摘要 真实场景的数据和按领域建立的物理模型缺乏供给,这导致能力与落地之间出现结构性差距。这是 microNature 研究和带来改变的领域。

下面从算力、数据和数据获取路径三个方面展开,也说明 microNature 为什么这样设计。

← 返回主文件 · microNature — 物理智能基础设施
00Contents
A1Phenomenon

现象:三条不同步的曲线

前沿实验室的演示越来越好看,真实场地里的部署成功率却没有跟着上去。两条曲线之间的距离这几年没有收窄,还在拉开。

TIME → CAPABILITY LAB DEMO 能力 FIELD DEPLOY 能力 THE GAP 数据↑ · Token↑ · 部署≈ TODAY
FIG.A1实验室演示能力与现场部署能力,差距在扩大

把同一段时间拆成三层来看(FIG.A2),大致能看出问题卡在哪一层:

TIME → READY 程度 硬件产能与表现 季度级迭代 · 密度 470台/万人 大脑 · 基座模型 在进步 · 但没跟上硬件 场景数据 · 领域原生物理建模 接近于零 · 几乎未被供给 真正的瓶颈在这里
FIG.A2三层供给的进度差:硬件快,模型居中,场景基建近乎缺席

硬件这一端的进展很扎实:中国制造业机器人密度 470 台 / 万名员工,排在全球第三;2023 年新增安装 27.6 万台,约占全球的 51%(IFR)。产能、成本、可靠性都在按季度往前走。慢下来的是大脑。参数规模并不是主要原因,缺的是场景数据和按领域建立的物理模型:机器最终要干活的那片真实世界,还没有被完整数字化,也没有以物理上准确的形式交给模型。下面三节分别讲这三件事。

A2Compute

成因一:Token 与算力消耗高,能力不随之线性增长

通用机器人的主流路线是「像素 → 语义 → 推断 → 动作」,先把连续的物理世界压成离散的 Token,再交给大模型推断该做什么动作。代价是单个任务的 Token 与算力消耗都很高,而部署能力并没有跟着同比例上升。

TOKEN / 算力投入 → 部署能力 10× 100× 1000× 灰柱 = 投入规模(示意) 能力增长 ≈ 线性趋缓 投入 ↑1000× 能力 ↑有限
FIG.A3投入按数量级增长,部署能力趋缓,两者并不同步
含义 更大的模型加更多的 Token,不会自动换来部署能力。压缩过程中丢掉的多半是接触、力、摩擦、形变、材质这类信息,而它们恰恰决定一个动作做不做得成。算力大都花在了还原语义上,物理量反而没有被还原出来。
A3Data

成因二:数据总量很大,数据效率很低

常有人拿视频数据的体量来说明物理智能不缺数据。这里有个口径问题:一小时视频里含有的有效物理知识,可能还比不上一千字文本。视频记录的是像素之间的相关性,不是可以直接拿来执行的物理量,缺少力、接触约束以及动作与结果的对应关系。总量确实很大,能用上的部分很少。

换成「可用于训练的高质量具身数据」这个口径,缺口大致是这样:

≈ 50 万小时 高质量具身数据存量 行业估算 ≈ 1,000 万小时 通用能力所需数据 行业估算 缺口 > 99% 相差约 20 倍 对照:物理语料总量约为语言模型语料的 1/20,000,物理智能没有语言模型当年那份现成的数据底子
FIG.A4高质量具身数据的存量与需求,缺口超过 99%
对照:语言模型的起点 互联网用三十年攒下了一份现成的高质量文本,任何团队都能拿它起步训练一个大模型。物理智能手上没有这样一份存货。没有互联网,也就不会有 Transformer;缺少真实物理数据这层底子,物理智能同样很难谈规模化。
A4Paths

成因三:四条数据路径,物理保真度都不够

目前获取具身数据主要有四条路径,逐条看下来,每条在物理保真度上都有各自的短板:

路径做法物理保真度问题
遥操作人类远程操控真机,采集动作轨迹物理上真实,但采集慢、成本高;力、热、接触这些量很难同步记全
第一人称视角由头戴或机载相机采集缺少全局几何与环境参数,遮挡多,大量物理状态观测不到
合成数据通用仿真引擎批量生成场景多为模板,物理参数和真实部署现场对不上,仿真到现实的落差主要由此而来
视频学习从人类 / 网络视频中学习行为先验没有动作标签,也没有物理量,学到的更接近「看起来像」,而不是「物理上做得到」
物理保真度 部署所需的保真度门槛 遥操作 真实但贵 · 量上不去 Ego 视角 物理状态不可观测 合成数据 物理与实景不对齐 视频学习 只有像素相关性
FIG.A5四条路径的物理保真度都在门槛以下(相对示意,非测量值)
共性 四条路径缺的是同一样东西:与真实部署现场对齐的物理量。这更像供给端的空白,而非某一条路径的工程细节问题,真实场景的物理本身还没有被建模,也就无从供给。
A5Cost

遥操作的成本账:靠人海采集为什么走不通

四条路径(A4)里物理保真度最高的是遥操作,但成本卡得很死:约 2,000 元 / 小时(Gartner)。按 1,000 万小时的需求量算,光采集这一项就要 200 亿元左右,还要配上一支很难规模化的操作团队。这笔账在商业上算不过来。

单小时数据成本(元) ≈ 2,000 元 遥操作采集 Gartner · 人力密集 ≈ 10 – 100 元 领域原生仿真加速 单条数据成本降至 1/20 – 1/200 成本差 20 – 200 倍 前提:仿真要按领域的物理真实建模,通用模板省不下这笔成本
FIG.A6数据获取成本:遥操作与领域原生仿真的对比
前提 能把成本降下来的只有仿真,前提是它和部署现场在物理上对得上。对不上,生成的数据就用不了,省下来的成本也就无从谈起。领域原生说的正是这件事。
A6Conclusion

叠加起来:机器人的规模定律至今没有出现

前面三节(A2A3A4)说的三件事各自都成立,麻烦在于它们同时成立,而且互相叠加:

① Token 与算力

单个任务的 Token 与算力消耗高,部署能力没有跟着同比例增长。

② 数据效率

总量很大,含有的有效物理知识很少,一小时视频可能不及一千字文本。

③ 数据准度

遥操作、第一人称视角、合成数据、视频学习四条路径,物理保真度都在门槛以下。

④ 结果 三条叠在一起,机器人身上的规模定律到今天也没有出现,差距则以各种形式暴露在现场。
回应结论

补上真实物理世界的那一层基建

差距的来源在供给一侧:场景数据和按领域建立的物理模型都还不够。硬件已经跑在前面,它等的是一层真实物理世界的基建,把部署现场变成机器可以训练、可以验证、可以打分的数字底座,同时把数据获取成本降到原来的 1/20 至 1/200。microNature 的架构就是照着这层基建设计的。

查看 microNature 架构 →
Sources

数据来源

  1. IFR《World Robotics》:中国制造业机器人密度 470 台 / 万名员工(2023),全球第三;全球平均 162 台;2023 年中国新增安装 27.6 万台,约占全球 51%。
  2. Gartner 及行业估算:遥操作数据成本约 2,000 元 / 小时;人形机器人高质量数据缺口达万倍量级。
  3. 盖世汽车研究院:具身高质量数据存量约 50 万小时,通用能力需求约 1,000 万小时,缺口超 99%;物理 AI 数据量约为语言模型语料的 1/20,000;仿真可将单条数据成本降至 1/20 至 1/200。
  4. 弗若斯特沙利文:中国具身智能解决方案市场规模 2030 年预计约 1,426 亿元。

注:FIG.A3 与 FIG.A5 为结构性示意(趋势与相对关系),非测量值;具体口径以访谈与一手数据为准。