伯恩斯坦全球自动化团队 Jay Huang、Dien Wang、Elsa Fu 撰写最新专题报告,以 Figure AI 本周发布的 Helix 2.5 为切口,讨论机器人“大脑模型”的最新进展。伯恩斯坦给出了一个克制但明确的判断:Figure AI 的 Helix 2.5 证明人形机器人的“大脑”可以从人类数据中学会通用技能,但它跨越的只是“场景”,还不是“任务”——机器人仍要靠专门训练才能干活,而 56% 的成功率离商用还差得远。
30 个家庭共完成 420 次试验、237 次成功,整体成功率 56%,且采用全有全无判定——任务必须完整做完才算成功。分项看,伯恩斯坦引用 Figure 数据:叠毛巾 62%、铺床 67%、整理客厅 40%。整理客厅是最难的一项,成功率仅四成。伯恩斯坦在报告中还提到一项信号:机器人在陌生环境中展现出自我纠错——后退重新定位、改变站姿、或绕到床的另一侧继续铺床。这份全有全无口径也意味着另一面:接近一半的试验以失败告终。
报告把 Helix 2.5 的进步归因于数据范式的变化。Helix 2.5 从一开始就在 Index 上预训练——这是 Figure 自有的第一视角人类任务数据集。
伯恩斯坦强调,在任务专用数据、模型架构、训练与评测条件全部保持不变的前提下,仅“是否使用 Index 预训练”这一个变量,就把零样本成功率从 9% 提升到 56%。这意味着提升不是“多给了几个家务例子”的结果。Figure 还披露,没有任何一项被评测任务的数据占到 Index 预训练数据的 1.90% 以上。与此同时,Helix 2.5 只用了 Helix 02 某项行为一半的任务专用数据,就达到了相近表现,并把该行为泛化到 30 个陌生家庭。
更被看重的是规模化效应。报告写道,Figure 已获得初步证据:随着“人类到机器人”预训练数据扩张,动作预测损失持续下降——把 Index 预训练数据反复翻倍,下游机器人动作预测的改善平滑到可以在训练前把最大规模那一次运行的损失预测到小数点后四位。Figure 官网称这是首次在人形平台上测得的“人类到人形机器人”迁移规模化定律。不过报告也提醒,该实验衡量的是动作预测损失,并非真实场景的完成率。
数据引擎本身在复利式扩张。据伯恩斯坦报告,截至 2026 年 8 月,Index 含 2300 万条,每秒新增约 35 分钟人类经验;每 1000 小时采集数据对应 373 项任务、1146 个操作对象与 116 个环境;其中 100 万小时包含 37.3 万个独立任务、110 万个独立操作对象;数据贡献者的周活跃人数已达 4.4 万,较 5 月初的不足百人快速攀升。Index 于 8 月 25 日上线 万次;Figure 已向数据贡献者支付 1500 万美元,并承诺投入 35 亿美元算力资源训练 Helix 系列。
伯恩斯坦给这次进展的定性是“场景泛化”,而非“任务泛化”。报告指出,Figure 的机器人是针对这三项任务专门训练的,而且 30 个家庭中的物体及其摆放方式变化有限。因此报告认为,真正的零样本任务泛化“仍有很长的路要走”。
报告把 Helix 2.5 与公司此前一篇题为
报告向 Figure AI 提出了两项具体期待。第一是“可迁移技能”的证据:在一项任务上训练后,能不加额外训练就完成相似任务;第二是真正的“数据飞轮”——在训练后与部署环节出现性能自动提升。伯恩斯坦直言,56% 的整体成功率“远不足以商用”,“熟能生巧”在机器人领域尚未成立:预训练通常能把成功率带到 50%-60%,而从这一水平到 99% 的高效路径,将是下一个大考。
报告的结论落在行业节奏而非时点上:Figure、智元、Physical Intelligence、Dyna 等公司的进展传递出一致信息——通用任务与少数应用之外的大规模部署都还不会很快到来,但人形机器人技术、尤其是大脑模型,正以“每季度都有可感知进步”的速度推进。报告用一句话概括当下的位置:“最坏的时代,也是最好的时代。”
在这份全球自动化报告中,伯恩斯坦给出的评级为:基恩士、康耐视、发那科、哈默纳科与汇川技术均为跑赢大盘评级。
特别
大瓜!曝某95顶流小花两副面孔,人前傻白甜,人后刁蛮,控制欲强,男友无法忍受,出轨了经纪人
过犹不及很可怕!给女儿用“狼牙棒”训练坐姿,家长洋洋得意地晒到网上,上万人看不下去了,怒吼
Counterpoint:2025-2030年间,全球200美元以下智能手机年出货将减少超2.3亿部










