SheetMN-A1
Title能力与部署的悖论
Issue2026.08
Scope配套材料

能力与部署的悖论

产品越来越惊艳,真实部署却似乎越来越困难,这是为什么呢?换句话说,技术与能力之间的差距不会随着模型能力升级而自动消失吗?

Insights 三维度拆解 · 算力 / 数据 / 路径 与 MN-00 配套使用
TL;DR 技术与能力的鸿沟是结构性的,根源在供给侧:硬件在高速迭代,大脑基座模型在进步但没跟上,而真正的瓶颈在第三层,场景数据与领域原生物理建模几乎未被供给。

下面从算力、数据和路径三个维度展开,说明为什么物理智能的基建是必经之路,以及 microNature 的成立与设计初衷。

← 返回主文件 · microNature — 物理智能基础设施
00Contents
A1Phenomenon

现象:三条不同步的曲线

前沿实验室的 demo 越来越惊艳,真实场地的部署成功率却没有同步上升。这个 gap 没有收窄,反而在扩大。

TIME → CAPABILITY LAB DEMO 能力 FIELD DEPLOY 能力 THE GAP 数据↑ · token↑ · 部署≈ TODAY
FIG.A1demo capability vs deployment capability · gap 在扩大

把同一条时间轴拆成三层看(FIG.A2),问题出在哪一层,一目了然:

TIME → READY 程度 硬件产能与表现 季度级迭代 · 密度 470台/万人 大脑 · 基座模型 在进步 · 但没跟上硬件 场景数据 · 领域原生物理建模 接近于零 · 几乎未被供给 真正的瓶颈在这里
FIG.A2三层供给的不同步:硬件快 · 模型中 · 场景基建近乎缺席

硬件一端完全没有问题:中国制造业机器人密度 470 台 / 万名员工,全球第三;2023 年新增安装 27.6 万台,约占全球 51%(IFR)。产能、成本、可靠性都在按季度进步。慢的是大脑,而大脑慢的根源,不是参数规模不够,而是场景数据与领域原生的物理建模严重不足:机器最终要工作的真实世界,还没有被数字化、被物理准确地供给给模型。以下三节逐一拆解。

A2Compute

成因一:token 与算力消耗高,能力不线性增长

通用机器人主流路线走的是「像素 → 语义 → 推断 → 动作」:把连续的物理世界折叠成离散 token,再由大模型推断动作。这条路线的代价是,单任务的 token 与算力消耗极高,而部署能力并没有随消耗线性增长。

TOKEN / 算力投入 → 部署能力 10× 100× 1000× 灰柱 = 投入规模(示意) 能力增长 ≈ 线性趋缓 投入 ↑1000× 能力 ↑有限
FIG.A3投入按数量级增长 · 部署能力趋缓 · 二者不线性挂钩
含义 「更大的模型 + 更多的 token」不会自动兑换成部署能力。被折叠掉的,恰恰是物理世界中最关键的信息:接触、力、摩擦、形变、材质。token 花在了重建语义上,而不是重建物理上。
A3Data

成因二:数据总量天量,数据效率极低

常有人以「视频数据是天量的」来论证物理智能不缺数据。这是一个口径错误:小时级视频蕴含的有效物理知识,可能不及千词文本。视频里是像素相关性,不是可执行的物理量,没有力、没有接触约束、没有与动作的因果对齐。数据总量天量,数据效率极低。

把口径对齐到「可用于训练的高质量具身数据」,缺口是这样的:

≈ 50 万小时 高质量具身数据存量 行业估算 ≈ 1,000 万小时 通用能力所需数据 行业估算 缺口 > 99% 相差约 20 倍 对照:物理语料总量 ≈ LLM 语料的 1/20,000 —— 物理智能没有 LLM 当年赖以爆发的现成数据基建
FIG.A4高质量具身数据:存量 vs 需求 · 缺口超 99%
对照 LLM 的起点 互联网用三十年沉淀了一份现成的、高质量文本基建,任何团队都可以拿它 bootstrap 一个大模型。物理智能没有这份现成的东西。就像没有互联网就没有 Transformer,没有真实物理数据基建,就没有物理智能的规模化。
A4Paths

成因三:四条主流数据路径,物理保真度均不足

目前行业获取具身数据的路径主要有四条。逐条拆开看,每一条都在物理保真度上有硬伤:

路径做法物理保真度问题
遥操作人类远程操控真机,采集动作轨迹物理真实但采集效率极低、成本极高;力、热、接触等物理量难以同步完整记录
Ego 视角第一人称视角采集(头戴 / 机载相机)缺全局几何与环境参数;视角遮挡严重,物理状态大量不可观测
合成数据通用仿真引擎批量生成模板化场景,物理参数与真实部署场景不对齐,是 sim2real gap 的主要来源
视频学习从人类 / 网络视频中学习行为先验无动作标签、无物理量,只有像素相关性;学到的是「看起来像」,不是「物理上可行」
物理保真度 部署所需的保真度门槛 遥操作 真实但贵 · 量上不去 Ego 视角 物理状态不可观测 合成数据 物理与实景不对齐 视频学习 只有像素相关性
FIG.A5四条路径的物理保真度均在门槛之下(相对示意,非测量值)
共性 四条路径缺的都是同一样东西:与真实部署场景对齐的物理量。这不是某条路径的工程瑕疵,而是供给侧的结构性缺失,真实场景的物理本身还没有被建模、被供给。
A5Cost

遥操作成本对比:暴力采集为什么走不通

四条路径(A4)里物理保真度最高的遥操作,成本是硬约束:约 2,000 元 / 小时(Gartner)。按 1,000 万小时的需求量测算,纯遥操作采集需要约 200 亿元,还要叠加无法规模化的人力组织。这条路在商业上不成立。

单小时数据成本(元) ≈ 2,000 元 遥操作采集 Gartner · 人力密集 ≈ 10 – 100 元 领域原生仿真加速 单条数据成本降至 1/20 – 1/200 成本差 20 – 200 倍 前提:仿真必须按领域的物理真实建模——通用模板仿真省不了这笔账
FIG.A6数据获取成本:遥操作 vs 领域原生仿真
前提 能把成本打下来的,是与部署场景物理对齐的仿真。物理不对齐,仿真数据就不能用,成本账就不成立。这正是「领域原生」四个字值钱的地方。
A6Conclusion

叠加结论:Scaling Law 至今未出现

前面三节(A2A3A4)各自成立,真正的问题是它们同时成立、彼此叠加:

① Token / 算力

单任务 token 与算力消耗高,部署能力不随消耗线性增长。

② 数据效率

数据总量天量,有效物理知识极低,小时级视频或不及千词文本。

③ 数据准度

遥操作、ego、合成、视频学习四条路径,物理保真度全部在门槛之下。

④ 结果 三条叠加,机器人的规模定律(scaling law)至今未出现,gap 以各种形式暴露。
结论 · 回到 Sheet MN-00

缺的不是更大的模型,是缺失的那一层基建

gap 的根源不在模型参数,而在供给侧:场景数据与领域原生的物理建模严重不足。硬件已经跑在前面,等它的不是更大的模型,而是一层真实物理世界的基建,把部署场景变成机器可训练、可验证、可打分的物理数字基座,把数据获取成本打下 20 至 200 倍。谁先把这一层做扎实,谁就把 gap 变成自己的 moat。这正是 microNature 架构所对应的解法。

查看 microNature 架构 →
Sources

数据来源

  1. IFR《World Robotics》:中国制造业机器人密度 470 台 / 万名员工(2023),全球第三;全球平均 162 台;2023 年中国新增安装 27.6 万台,约占全球 51%。
  2. Gartner 及行业估算:遥操作数据成本约 2,000 元 / 小时;人形机器人高质量数据缺口达万倍量级。
  3. 盖世汽车研究院:具身高质量数据存量约 50 万小时,通用能力需求约 1,000 万小时,缺口超 99%;物理 AI 数据量约为 LLM 语料的 1/20,000;仿真可将单条数据成本降至 1/20 至 1/200。
  4. 弗若斯特沙利文:中国具身智能解决方案市场规模 2030 年预计约 1,426 亿元。

注:FIG.A3 与 FIG.A5 为结构性示意(趋势与相对关系),非测量值;具体口径以访谈与一手数据为准。