位置:首页  >  详情页
竟:然是OpenAI自己
来源:腾讯汽车 编辑:陈丽彦 2026-09-20 18:48:55

机器之心编辑部

拿 GPT-6 Astra 当机器人「大脑」?

好像还真行!

最近,一台售价约 150 美元的 SO-101 机械臂,在 GPT-6 Astra 的控制下,画出了一幅金门大桥。

这可不是照着预设轨迹画的,Astra 先规划从哪里落笔,再通过摄像头边画边看,最终完成了一幅红蓝相间的金门大桥。

这段视频迅速爆火,Sam Altman 直接转发:给我也来一个!



视频链接:https://x.com/cdngdev/status/2097339677128982873

最近几年,机器人圈一直在讨论一个问题:「谁会成为机器人领域的 OpenAI?

如今看来,这个问题的答案,有可能是 OpenAI 自己。

Astra 的「动手能力」究竟如何?

画金门大桥看起来唬人,但这还不是最厉害的那个。

CMU Robotics 的 Wenli Xiao 做了一个很直观的实验。

他们先录下一段人类完成新任务的视频,把录像丢进 Codex,再让 GPT-6 Astra 控制机械臂,用同样的方式完成任务。

竟然一次就跑通了!



视频链接:https://x.com/_wenlixiao/status/2097801944119349455

Wenli Xiao 把它称为「physical ICL」—— 过去大模型可以从上下文里的文字、代码示例中临时学会一个新任务,现在的人们发现,这种能力搬到物理世界里也行得通。

另一批人则干脆让 Astra 开始当「机器人工程师」。

Lingxiao Guo 把真实机器人演示的多视角画面和动作数据交给 Astra,让它自己处理相机标定、场景重建和物理参数,再把真实环境搬进 MuJoCo。

最终得到的不只是一个看起来相似的 3D 场景,而是一套可以继续进行接触仿真和动作回放的 real2sim 环境。



视频链接:https://x.com/Lingxiao234/status/2096992059731443923

X 上还有人把 Astra 接到更复杂的机器人身体上。

Dmytro Hrybov 在 MuJoCo 中给 Astra 配了一台 Kinova Gen3 机械臂和 Shadow Hand 五指机械手,让它握住铅笔,画出毕加索那只著名的鸽子。

为了让笔真正落到纸面上,机械手还需要同时处理握笔姿态、手指与铅笔之间的摩擦,以及笔尖与纸面的接触。



视频链接:https://x.com/dimentary/status/2097141042214797801

如果说以上这些还比较像网友整活,下面这个就真能说明一些问题了。

RoboCurve 把 GPT-6 Astra 接到两只真实的 I2RT YAM 机械臂上。

每一步行动,Astra 都能看到顶部和两只手腕上的三个相机视角,以及机械臂自身的状态。随后,它直接给出两只机械臂末端执行器的 x、y、z、yaw、pitch、roll 和夹爪状态,再由底层 IK 转换成具体关节动作。

测试任务很简单:把桌上的红色积木抓起来,放进旁边的碗里。一共 20 次,Astra 成功了 19 次,成功率 95%。同样的测试里,Fable 5.1 只成功了 8 次。



谁都没想到,一个并没有专门为机器人训练的通用模型,竟然能做到这种程度。

而这个问题,恰好撞上了过去几年机器人行业最热的一条路线 —— 专门给机器人训练一颗自己的「基础模型大脑」。

「机器人大脑」不必从头训练

过去几年,随着大模型能力一路向视觉、语音和 Agent 扩展,机器人行业也在反复追问同一个问题:如果语言领域已经出现了 GPT,机器人什么时候才能拥有自己的「GPT」?

Physical Intelligence 和 Skild,正是在这样的期待中迅速成为明星公司。

Physical Intelligence 希望训练一个真正跨任务、跨场景、跨机器人本体的通用机器人基础模型。它的 π 系列模型把视觉、语言和动作放进同一套模型里,希望机器人能够像大模型理解文本一样,从大量具身经验中学会如何操作真实世界。

Skild 的目标更直接 ——「Any task, any robot, one brain」。无论是四足机器人、人形机器人,还是桌面机械臂和移动操作平台,都由同一个通用「大脑」来理解任务、规划动作。

两家公司代表的其实是过去几年机器人基础模型最典型的一条思路:既然语言有自己的 foundation model,那么机器人也需要在海量机器人数据上,训练出一套真正理解身体和动作的基础模型。

也因此,「谁会成为机器人领域的 OpenAI?」一直是这条赛道绕不开的问题。

但 Astra 出现后,这个问题突然有了一个有点出人意料的答案。

Amazon Alexa Principal Scientist、Retrocausal 联合创始人 Zeeshan Zia 有一个判断:「机器人领域的 OpenAI,看来可能就是 OpenAI,而不是 Physical Intelligence 或 Skild。」

这句话听起来有些挑衅,因为 Astra 并没有沿着机器人公司的传统路线来。

它没有先收集大量机器人轨迹,再专门训练一套从视觉到动作的基础模型,Astra 带来了另一种可能:如果通用 AI 本身已经足够强,还需不需要再从头造一颗机器人的大脑?

这个问题放在 OpenAI 身上尤其微妙,因为它其实很早就做过机器人。

2018 年,OpenAI 推出了 Dactyl,让 Shadow Dexterous Hand 在真实世界里旋转物体;随后又进一步让灵巧手完成魔方操作。



那时 OpenAI 已经在研究今天机器人行业仍然绕不开的问题:如何在模拟中训练,再把能力迁移到真实世界,如何处理摩擦、遮挡、传感器噪声,以及复杂的多自由度控制。

但几年后,OpenAI 关闭了机器人团队。Wojciech Zaremba 当时谈到过一个很现实的限制:机器人缺少像互联网文本那样可以大规模获取的数据。相比可以直接从互联网获得海量文本和图像,机器人数据昂贵、缓慢,也很难覆盖足够丰富的真实世界。

有意思的是,OpenAI 当年因为数据问题暂时离开机器人,如今却可能从另一条路绕了回来。

过去几年,OpenAI 先把模型在语言、代码、视觉和 Agent 上一路做大,让模型积累了关于物体、空间、因果关系和人类行为的大量知识。接下来,机器人需要的是把这些已有的知识,稳定地变成身体动作。

OpenAI 自己显然也重新盯上了这个方向。Sam Altman 最近已经明确表示,OpenAI 会做人形机器人,也会探索其他机器人形态。在他的表述里,真正关键的部分仍然是让机器人工作的「大脑」。

Astra 怎么控制机器人的「身体」?

目前的答案不是让 Astra 直接控制每一台电机。

以 RoboCurve 的实机测试为例,Astra 每一步会看到三个相机视角和机械臂自身的状态,然后直接给出末端执行器应该到达的位置和姿态,包括 x、y、z、yaw、pitch、roll 以及夹爪状态;再由底层的逆运动学系统,把这些目标转换成各个关节的具体动作。

这其实是一种很典型的分工:Astra 负责判断「手应该去哪里」,传统机器人控制栈负责解决「每个关节具体怎么动」。

英伟达前研究科学家 Yu Xiang 也提出,机器人学接下来一个值得关注的方向,可能就是如何把最先进的 AI 模型真正接进 manipulation。相比只让大模型停留在最上层,负责拆解任务、调用工具,Astra 已经开始更直接地介入机器人的动作决策。



链接:https://x.com/YuXiang_IRVL/status/2096074174091362388

但接着往下走,问题也逐渐显现。

有人甚至让 Astra 直接输出 Unitree Go1 的 joint targets,尝试像强化学习 policy 一样,以 50Hz 控制四足机器人行走。实验确实跑了起来,但因为 Astra 的推理速度跟不上实时控制,物理模拟必须在每次模型调用之间暂停。最终,250 次推理只换来了约 5 秒钟的行走。



链接:https://x.com/sri299792458/status/2097349207795335424

显然,Astra 已经能够决定机器人「下一步该怎么动」,但要让它直接接管毫秒级的底层控制,还不太现实。

所以,未来更现实的形态可能不是让一个大模型从头管到脚,而是让不同层级继续分工:Astra 负责理解环境、推理和规划,低层 policy 与控制器负责把这些意图快速、稳定地变成动作。

最后一毫米

会规划动作,距离真正把动作做好,其实还有不小的距离。

还是 RoboCurve 的那组测试。

在「把红色积木放进碗里」的任务中,Astra 20 次成功 19 次,成功率达到 95%;可当任务换成把一块圆形拼图准确嵌进对应凹槽时,成功率立刻跌到了 10%,20 次只完成了 2 次。



同一套实机测试中,Astra 在积木入碗任务上的成功率达到 95%,但面对需要精确嵌入的拼图任务,成功率降至 10%。图源:RoboCurve

很多距离成功仅一步之遥。Astra 已经找到拼图、抓住旋钮,并且能把它移动到目标凹槽附近,却很难完成最后的精确插入。

这最后几毫米的距离,展现了机器人最棘手的一些问题:位置和角度稍有偏差,零件就无法对准;真正接触受硬件误差干扰,下一步动作也因此无法完成。

这也是为什么 Physical Intelligence 最近会专门研究「最后一毫米」。

在他们的实验中,让一个通用机器人模型拿起螺丝刀很简单,但想要快速、准确地对准一颗很小的 M3 螺丝,仍然需要通过在线强化学习继续优化;网线插入、电源线插入、扎带固定等任务,也都卡在类似的精细接触阶段。



Astra 目前最明显的优势集中在理解环境、判断目标和规划动作这些「头脑」擅长的部分,而一旦进入高频反馈、精细接触和力控制,机器人自己的身体经验仍然很重要。

这也给前面的「机器人领域的 OpenAI」之争留下了一个很关键的悬念。

机器人当然可以用最强模型当「大脑」,但能与之匹配的物理身体,还没有出现。

亚博综合网页版的多元化应用场景,探索其在生活中的实际价值【哔哩哔哩】_【bilibili】 竟:然是OpenAI自己
亚博综合网页版

https://xin.abies.asia/ArTitle/DeTails/083461.sHtML

「活动」首次登录送38积分

682.60MB
版本V7.81.47
下载亚博综合网页版安装你想要的应用 更方便 更快捷 发现更多
喜欢 53%好评(04人)
评论 71
亚博综合网页版的多元化应用场景,探索其在生活中的实际价值 亚博综合网页版截图1 亚博综合网页版截图2 亚博综合网页版截图3 亚博综合网页版截图4
详细信息
  • 软件大小 763.12MB
  • 最后更新 2026-09-20 18:48:55
  • 最新版本 V6.18.26
  • 文件格式 apk
  • 应用分类 ios-Android新世纪平台对刷技巧
  • 使用语言 中文
  •  需要联网
  • 系统要求 7.15以上
应用介绍
一.华彩在线app官网香港  百度seo推广甄选乐云践新实力,推动行业革新与品牌发展 外围足彩app用
二.腾讯一分彩现场开奖  石家庄百度seo推广如何进行,了解实操策略与潜在挑战
三.亚博体彩手机客户端AV网站  搜索引擎优化外包实力乐云seo,助力企业提升网络曝光度
四.多彩彩票可靠不  seo是什么意思中文翻译成英文,探索其核心概念与应用
五.真三对战平台  关键词优化软件号码推荐乐云seo,提升网站流量与排名的有效工具
六.js娱乐场网址  片中曲seo二的化学方程式在生活中的应用,解析片中曲seo二的化学方程式的实际意义深圳网络营销的现状与挑战,选择乐云SEO专家的理由
七.金赞娱乐平台官方  北京互联网广告的发展现状,乐云seo专家的作用分析
八.黄金娱乐场开户  深入理解seo关键词的重要性,掌握詹竟云速捷专业3的应用

【联系我们】
客服热线:400-5466-8483
加载更多
版本更新
V3.64.64
掌握seo关键词推广金手指y排名11的关键技巧,提升网站流量与曝光率

类似软件

猜你喜欢

包含 97久久香蕉国产线看观看 的应用集
评论
  • 探索seo5短视频网视频在线看的多样化应用, 理解其背后的技术与挑战 1天前
    百度知道口碑外包首推乐云seo,提升品牌影响力的有效途径
  • 麻涌seo优化关键词多少钱,了解其价值与影响因素 5天前
    关键词seo排名那儿好,火18星服务的实用分析
  • 一鸣云搜吃史out争尼seo公司发展趋势探析,一鸣云搜吃史out争尼seo公司面临的挑战与机遇 3天前
    中英文结合的文章有利于seo吗,探讨其应用价值与潜在挑战
  • 广州百度百科专业乐云seo的应用,深度解析其成效与挑战 2天前
    理解SEO排名的核心原则,掌握陨云速捷出词稳28的应用
  • 深入解析seo关键词推广的策略与挑战,亿金手指科捷一助力优化效果 3天前
    深圳关键词优化很棒,乐云SEO助力品牌提升
  • 微信seo什么意思啊怎么做推广,深入解析微信seo的核心理念与有效策略 8天前
    北京网络接单丷乐云seo十年,探索行业变革与发展路径
  • 抖亿客短视频营销seo排名系统的特点,助力企业实现精准传播 8天前
    百度百科公司专注乐云seo,提升企业网络影响力
  • 新民推广抖音seo优化平均价格分析,影响因素与应用实例探讨 1天前
    百度快照排名的影响因素分析,乐云seo品牌的实际应用探讨
  • 青岛关键词排名的演变历程,乐云SEO的影响与实践 6天前
    深圳网上营销可选乐云seo十年,探索有效策略与实践经验
  • 杭州网址优化都用乐云seo十年,助力企业提升网络竞争力 5天前
    优化seo6薇欣182一047一729的关键要素与应用场景,探索优化seo6薇欣182一047一729的常见误区