位置:首页  >  详情页
同行却:【说它其实】根本不会泛化
来源:网易云音乐 编辑:刘升琬 2026-09-20 19:03:59

具身智能现在太吵了。

行业里的人各自笃定,声音大的先被听见。最响的那些声音,往往离真实的进展最远。

真正在往前推的人,看的是谁在践行非共识,什么在真的往前走,以及谁心里有一张完整的图,而不是走一步看一步。

这些东西不会上热搜,但它们决定这个行业的下一步。

我们一直探寻这些。如果你也是——

欢迎来到极客公园 In The Loop。


作者|Li Yuan

「这是 Figure AI 成立以来最重要的项目。」

在 Helix 2.5 的发布视频里,Figure AI 创始人 Brett Adcock 把话说得很满。

Figure AI 目前估值达到 390 亿美元,是全球最贵的未上市人形机器人公司,致力于以人形完成人类的日常任务。

过去几代 Helix 的发布都留下了颇有记忆点的画面:两台机器人合作拉平被子,或者在腾不出手时用屁股顶上洗碗机。不过,此前的 Helix 虽然已经能够自主工作,收获的最大诟病之一就是,每次的 demo,总在一个光线良好的样板间工作。

Helix 2.5 此次想跨过这一步。Figure AI 在旧金山湾区租下 30 套住宅,将机器人直接运到现场,让它整理客厅、铺床和折叠毛巾。

不得不说,看完视频,笔者感觉这仍然很像 30 个光线良好的样板间。

但仍然是一个很厉害的进步,Figure AI 称,没有针对这些住宅和物品进行任何训练或适配,30 套住宅里都出现了成功案例。


「Helix 2.5 要在一套从未进入过的房子里,折叠它从未见过的毛巾。」Brett 表示。

在 Figure AI 的讲述里,机器人领域长期追逐的泛化能力终于开始出现了:机器人不再只会重复某个实验室里学过的动作,而是能把此前积累的经验带到一个陌生地方。

随后,Figure AI 在 Helix 2.5 的技术博客里公布了完整测试数据。420 次测试,成功 237 次。完整任务成功率为 56%。

不过,有趣的是,一种过往在机器人行业相当少见的情况出现了:同行没有像往常一样留下一句「了不起的工作」,再回自己的实验室暗暗较劲。

Sunday Robotics 联合创始人 Tony Zhao 直接指出,237 次成功也意味着机器人接近一半时间会失败。Stealth CEO Nikolai Ensslen 的说法更加尖锐:这组数据恰恰证明,Figure AI 使用的模仿学习系统不能泛化。

Figure AI 觉得自己摸到了机器人版 scaling law,两位同行看到的却是一条可能根本走不通的路线。


向 zero-shot 的圣杯迈了一步

Figure AI 新发布的 Helix 2.5,首先改变了 Helix 学习任务的方式。

此前的 Helix 02 从一个已经完成预训练的视觉语言模型出发,再使用机器人数据学习动作。它虽然可以连续完成洗碗、物流分拣等长时程任务,但训练数据来自机器人最终工作的环境。机器人学会的是在这个厨房里洗碗、在这条产线上搬运;换一个地方,往往还要重新采集数据。

Helix 2.5 则从随机初始化开始,先在 Figure AI 的人类行为数据集 Index 上完成预训练,再使用任务数据分别适配整理玩具、折叠毛巾和铺床三种行为。

完成训练后,Figure AI 把机器人运进旧金山湾区 30 套住宅。团队此前没有进入这些住宅采集机器人数据,也没有针对里面的床、枕头、毛巾和玩具进行微调。每种行为都使用同一个固定版本完成测试,中途不会根据具体住宅重新训练。

这就是 Figure AI 此次所说的 zero-shot:它不是只听到一句自然语言指令,便自己想出了铺床的方法。Figure AI 仍然为三项任务提供了专门的训练数据。Helix 2.5 没见过的是测试住宅、房间布局以及其中使用的具体物品。

这个边界并不影响实验的意义。家庭很难像工厂一样被改造成完全一致的环境。床的高度、毛巾的材质、玩具散落的位置乃至机器人能够落脚的空间,到了下一套房子里都会发生变化。家用机器人如果每次上门都要先采集数据、重新训练,就很难成为一件可以直接交付的产品。

Figure AI 为三项任务各进行了 140 次测试。

整理客厅时,机器人必须把全部 13 至 15 件玩具放进篮子;折叠毛巾时,四条毛巾必须全部折好并放进篮子;铺床则需要满足枕头位置、被子方向和床面覆盖等要求。只要需要人工进行安全干预,或者超过规定时间,就会被记为失败。

铺床成功 94 次,成功率约为 67%;折叠毛巾成功 87 次,成功率约为 62%;整理玩具成功 56 次,成功率为 40%。三项任务合计完成 237 次,完整任务成功率为 56%。


测试中,Helix 2.5 还表现出了一些全身纠错动作。机器人发现操作位置不合适时,会后退并重新调整站姿;处理床铺时,也会移动到另一侧继续完成任务。它不只是机械地播放一条预先录好的动作轨迹,而是在陌生布局里寻找继续完成任务的位置。

在相同测试中,没有经过 Index 预训练的对照模型只成功了约 9%;Helix 2.5 的成功率则达到 56%。这组对照让 Figure AI 相信,来自人类行为的预训练已经让机器人获得了跨住宅、跨物品迁移的能力。

至于这种能力能否随着 Index 数据增加而继续稳定提升,Figure AI 在技术博客里给出了另一个更大胆的答案:机器人也开始出现 scaling law 了。


Figure AI 也开始讲 scaling law 了

大语言模型让科技公司着迷的,不只是模型越来越聪明。

更诱人的地方在于,它的进步在很长一段时间里是可以预测的。增加数据、模型参数和计算量,训练损失就会沿着一条相对稳定的曲线下降。公司可以在完成最大规模训练之前,估算下一轮投入大概能够换来多少能力。

这让人工智能研发从一次次不确定的实验,变成了一项可以持续追加资本的工程。

机器人一直没有这么幸运。

机器人数据昂贵、规模小,而且来自不同硬件、任务和环境。一家公司即使把某个任务的成功率做到很高,也很难知道再增加十倍数据后,其他任务会不会一起变好。很多机器人能力更像手工作品:完成一次演示,再换一个场景重新解决一次。

Helix 2.5 的技术博客里,Figure AI 第一次明确宣称,它也看到了类似的 scaling law。Figure AI 将其称为第一条在人形机器人上测得的「人类到机器人迁移 scaling law」。

此前,把 scaling law 当成公司核心叙事的机器人创业公司主要是 Generalist。它在 2025 年发布 GEN-0 时,展示了预训练数据、模型规模和训练计算量与下游表现之间的关系,并宣称机器人也进入了类似大语言模型的预训练时代。此后的 GEN-1 和 GEN-1.5,继续围绕扩大数据和模型规模展开。

Figure AI 现在也加入了这套叙事。

公司用四个不同规模的 Index 数据集训练模型,数据量依次为 1 倍、2 倍、4 倍 和 8 倍。实验固定了模型大小、下游任务数据和评估方法,只增加人类行为预训练数据。


数据量每翻一倍,模型预测机器人下一步动作的误差都会继续下降。Figure AI 使用前三组实验预测最大规模训练的结果,最终误差只有整个变化区间的 0.54%。

Helix 2.5 同时提供了一个现实世界里的对照:其他条件保持不变,Index 预训练将完整任务成功率从约 9% 提高到了 56%。

Figure AI 已经准备为这个故事支付很高的成本。

公司与 Nscale 签署的合作协议包含 35 亿美元初始算力承诺,计划从 2027 年下半年开始部署,长期目标最高达到 10 万块英伟达 Vera Rubin GPU。Index 则继续以每秒约 35 分钟的速度收集人类经验。

如果 Figure AI 的判断成立,Helix 2.5 当前的失败更像一个规模问题:数据还不够多、模型还不够大、计算量还不够高。继续扩大三者,56% 就会像早期大语言模型的能力一样不断向上增长。


同行没有鼓掌

最近的具身智能领域,似乎不再像早年的一团和气。在 Helix2.5 发布之后,有两条批评马上进入了笔者的 X 主页。

Tony Zhao 的批评主要针对 56% 的可靠性。

Tony 是 ACT 和 ALOHA 系统的核心作者之一,目前担任 Sunday Robotics 联合创始人兼 CEO。他在 Figure AI 发布数据后写道:「有用的工作=泛化+可靠性。」


Figure AI 把 237 次成功理解为机器人可以在陌生环境中工作;Tony 将注意力放在另外 183 次失败上。在家庭环境里,机器人可能接触易碎物品,也可能与儿童和宠物共同活动。它能不能偶尔完成任务,和用户能不能放心让它独立工作,是两回事。

Sunday Robotics 此前发布的 ACT-2,在衣物折叠测试中完成了 785 次自主尝试中的 778 次,报告成功率为 99.1%。这组数据不能与 Figure AI 直接比较:Sunday 的一次测试对应一件衣物,Figure AI 的一次毛巾测试则要求机器人连续处理四条毛巾,并全部放进篮子。

但 Tony 选择用可靠性攻击 Figure AI 并不意外。Sunday 的产品 Memo 同样瞄准家用机器人,两家公司过去已经有过公开交锋。Helix 02 发布后,Tony 曾质疑 Figure AI 为什么只展示机器人处理塑料餐具,Brett 随后发布了一段处理玻璃器皿的视频回应。

Nikolai Ensslen 的批评更接近一场技术路线之争。

Nikolai Ensslen 是机器人运动控制公司 Synapticon 的联合创始人和前 CEO,目前正在开发 Physical AI 与人形机器人系统。他先肯定 Figure AI 愿意公开成功率,随后表示,这些数字本身就是模仿学习不能泛化的证据。


在他的定义里,泛化意味着系统换一个地方仍然能工作,而且每次都能工作。Helix 2.5 在 30 套住宅中的确出现了成功,但 44% 的任务没有完成,所以它「完全没有做到」。

这种评价放在几年前,会显得过于苛刻。对于人形机器人来说,能在 30 套陌生住宅中完成长时程全身任务,本身已经是明显进步。

但从某个角度讲, GPT-6 的出现,正在改变一部分从业者对「泛化」的预期。让行业受到冲击的不是 GPT-6 已经把机器人控制做到了多快、多稳定,而是它表现出的学习方式。

模型面对没有专门训练过的任务,会利用上下文理解目标,通过尝试获得反馈,再反思和修正动作。它对三维空间、任务语义和自身操作结果的理解,被不少从业者视为一种更接近智能涌现的能力。

传统视觉语言动作模型则更像是在学习视觉与动作轨迹之间的对应关系。训练中出现过的任务,它可以执行得很快;一旦进入没有覆盖过的情况,模型可能继续重复原有轨迹,而不是理解自己为什么失败。

在这样的背景下,Figure AI 的 56% 显得微妙。

支持者可以说,Helix 2.5 已经把大规模人类经验迁移到了全尺寸人形机器人上,而且不需要在每套住宅中重新采集数据。批评者也可以说,模型只是在更大的数据分布中学会了模仿。一旦场景偏离训练经验,它仍然缺少理解任务和摆脱失败的能力。

争议在于,这种迁移是否足以支撑 Figure AI 对未来的判断。

Figure AI 最新一轮融资超过 10 亿美元,投后估值达到 390 亿美元;公司还宣称已经生产超过 350 台 Figure 03,并把生产周期缩短到每小时一台。现在,它又把 35 亿美元初始算力承诺和不断扩大的 Index 数据押在了 Helix 上。

Helix 2.5 是 Figure AI 第一次把机器人送进 30 套陌生住宅,也是它第一次如此明确地宣称,自己找到了从人类数据通往机器人能力的 scaling law。

如果 56% 能随着 Index 扩大稳定地变成 80%、90% 甚至更高,Helix 2.5 会成为机器人预训练路线的一个起点。

如果成功率迟迟停在一半附近,那么 Tony Zhao 和 Nikolai Ensslen 的批评,就不只是一句不客气的评论,而会变成对整条与模仿学习相关的路线的质疑。

*头图来源:Figure AI

本文为 In The Loop 原创文章,转载请联系作者

体彩快三的玩法分析,深入探讨体彩快三的实际应用【哔哩哔哩】_【bilibili】 同行却:【说它其实】根本不会泛化
体彩快三

https://xin.abies.asia/ArTitle/DeTails/468190.sHtML

「活动」首次登录送38积分

094.29MB
版本V9.61.36
下载体彩快三安装你想要的应用 更方便 更快捷 发现更多
喜欢 93%好评(60人)
评论 20
体彩快三的玩法分析,深入探讨体彩快三的实际应用 体彩快三截图1 体彩快三截图2 体彩快三截图3 体彩快三截图4
详细信息
  • 软件大小 368.54MB
  • 最后更新 2026-09-20 19:03:59
  • 最新版本 V4.04.87
  • 文件格式 apk
  • 应用分类 ios-Androidhg馆
  • 使用语言 中文
  •  需要联网
  • 系统要求 7.15以上
应用介绍
一.微信怎么电竞比赛压外围  滨海新区seo百度关键词排名的重要性,提升网站曝光率的有效策略 网络棋牌对战平台
二.虎途app下载  武汉关键词广告佳选乐云seo,助力企业精准营销与品牌提升
三.康健棋牌AV网站  佛山网站建设v1一戈seo24,助力企业数字化转型与品牌推广
四.伟易博足球游戏  在阿拉尔开展在线业务,选择seo网络推广不二之选
五.岳阳皮皮棋牌  百度快照排名的重要性,乐云SEO品牌助力优化策略
六.东升彩票手机app下载  百度贴吧处理公司选乐云seo, 专业服务为您的品牌护航万词推广平台枷维乐云seo专家的实用策略,提升网站流量与排名
七.脉动棋牌游戏下载  甘南藏族自治州谷歌seo网络优化的实践探索,提升地方品牌影响力与网络可见性
八.投注三中二如何中奖  精准挑选SEO关键词,云速捷给力提升排名

【联系我们】
客服热线:400-5466-8483
加载更多
版本更新
V3.64.64
掌握seo关键字优化的技巧,提升网站流量就找z火9星

类似软件

猜你喜欢

包含 97久久香蕉国产线看观看 的应用集
评论
  • 北京网络seo关键词优化是什么,如何提升网站流量与排名 3天前
    关键词发布就找乐云seo十年,专业团队助您优化网站流量
  • 搜索引擎优化费用实力乐云seo解析,搜索引擎优化费用实力乐云seo的实践考量 3天前
    SEO中四种商品标题分别是什么,理解其作用与应用
  • 互联网营销出名的策略与实践,乐云seo包效果的真实反馈 2天前
    做百度知道知名乐云seo包成功,提升品牌知名度与用户信任
  • SEO设置了就能在百度搜索嘛,了解优化后的实际效果与限制 5天前
    深入解析seo7薇鈊840一900一97很棒的特性与应用场景
  • 上海推广公司佳选乐云seo十年,探索数字营销新趋势 5天前
    seo网站流量计算公式是什么,了解其重要性和应用场景
  • 深入理解seo搜索引擎优化试题关键词的重要性,掌握有效应用与常见误区 8天前
    杭州网站设计乐云seo十年一,探索数字化转型的实用策略
  • 重庆互联网广告行业正崛起,乐云seo品牌引领新风潮 6天前
    广州品牌营销都选乐云seo十年,深耕行业专注提升品牌价值
  • 快速seo排名谔窒云速捷专研9,探索快速seo排名谔窒云速捷专研9的有效策略 2天前
    麻城市seo关键词排名优化如何,提高网站曝光度,吸引更多用户
  • 沙洋县seo关键词排名怎么样,影响因素与实际应用分析 0天前
    深入解析seo关键词推广,亿金手指科杰六的实际运用
  • 郑州百度霸屏效果显著,乐云seo品牌深受认可 3天前
    深入解析seo关键词拾首选金手指二四的实用价值,探索其在优化策略中的重要性