位置:首页  >  详情页
GP:T6全胜照样打不过人{类新手}
来源:搜狐下载 编辑:陈虹信 2026-09-23 10:22:08

新智元报道

想太多,就连最聪明的AI也会被拖死。

43分钟、11138个推理token、6批指令——0个作战单位。

这是Grok 4.6在《星际争霸:母巢之战》里交出的一张绝望成绩单。

游戏中,把推理拉到最高档位xhigh的Grok,从开局苦思冥想到游戏结束,硬是连一个能上场打仗的兵也没造出来。

而在同一张榜单的另一头,GPT-6 Astra同样火力全开,18战18胜,胜率100%。

这两天,这份名为Brood War Bench的星际大模型榜单,在硅谷程序员扎堆的Hacker News上火了。

Brood War Bench榜单前10名。Astra开最高推理档xhigh,18战全胜,Grok三个档位全在榜尾。

如今已是OpenAI员工的OpenClaw之父Peter Steinberger,不忘转发为自家模型造势:新榜单来了。

AI正在数学圈连破世纪难题,有人惊呼奇点降临,势头猛到让陶哲轩都公开发声要放慢脚步。

可这份榜单的作者Ben Swerdlow,一开篇就甩出一个画风完全不同的判断:

就连全胜冠军GPT-6 Astra,也打不过一个人类新手。

Hacker News评论区有人一句话点破要害:「它们不是玩不了,只是需要太多时间。你要是在模型思考的时候把游戏暂停,它就能玩。」

还有人直接开嘲:「搞得好像这些模型不是通用智能一样。」

全网最聪明的AI,为什么会在星际里被自己的思考拖死?

是不是离AGI还远着呢?

游戏永远不会停下来等你

这个榜单的诞生,有点戏剧性。

起初,开发者Ben只是做了个全靠智能体操作的星际版本,拉上几个朋友一起玩。

这帮人几乎没碰过星际,可打起来却一点不输玩了好多年的老炮。

他们的秘诀简单到离谱:只管打字喊一句「进攻」,造兵、集结、开打,全交给AI。

这让Ben不禁好奇:如果人类彻底闭嘴,让这些模型自己玩,它们能活多久?

于是,GPT、Claude、Grok三大家族的19名AI选手悉数登场,一场171局的AI大乱斗就此开打。

比赛跑在Freestyle的云端虚拟机上,每局单开一台机器,同时开打,游戏数据和AI的每一步思考记录全都留了底。

做数学题、写代码,大模型可以发呆5分钟再一次性交卷。

但打星际不行。

这里没有AI习惯的回合制,只有一刻不停的实时战场。

你思考的每一秒钟,对面的农民(英文玩家叫worker,负责采矿的工人单位)都在狂挖矿,兵营在疯狂爆兵,大部队已经朝你家高地冲了过来。

老一代模型还拿回合制的路数打这种即时战略游戏,结果脑子还在转,家已经被推平了。

Steinberger的帖子下,有网友一语道破:

有意思,难怪AI做游戏的时候,总爱做回合制的。

Grok苦想43分钟

一个兵也没上场

把这种回合制思维演绎到极致的正是Grok。

在编号G043的对局里,Grok堪称思想上的巨人、行动上的矮子。

它疯狂输出大段大段的战略推理,但43分钟的游戏里,总共只发出了6批指令,平均7分多钟才动一次手。

这不是偶然。

G003里,Grok造了3个机枪兵,始终没走到敌人基地;G002里,它造了2个狂热者,同样没能穿过地图。

兵是造出来了,就是打不到对面。

最高推理档位下它2胜15负,惨不忍睹。

数据曲线很直观:比赛打到11分半,Astra早就兵强马壮,而Grok场上平均只有不到7个农民和几个兵。

搞笑的是,Grok的国库里,其实躺着远超Astra的巨额存款。

钱在兜里,大脑在运转,就是死活不动手。

Astra的农民和狂热者拆掉了Grok的主基地,Grok手里一个作战单位都没有,账上还躺着928块水晶矿。

在星际这种残酷的战场上,想得久可不叫深思熟虑,叫挂机等死。

Astra的必杀技

让对手想到死

如果说Grok是被自己想太多拖死的,那Astra就是专门逼别人想太多,把对手活活拖死。

Astra所在的Codex家族,最绝的一招是骚扰。

它经常只派一个最基础的采矿农民,横穿整张地图跑到敌人家溜达。在人类玩家眼里,这种战斗力为零的农民随手拉两个工兵就能赶走。

但在AI局里,这招简直是降维打击。

对面的AI只要一看到这个农民,瞬间陷入沉思,花上几十秒去疯狂计算「我该怎么处理这个农民」。

在这宝贵的几十秒里它什么都不干,基地彻底停摆。

Astra的骚扰部队拆掉了Grok的主基地,Grok手里一个作战单位都没有,账上还躺着928块水晶矿。

在即时战略游戏(RTS)里,骚扰对方是为了破坏经济;到了AI对AI,骚扰的最大杀伤力,是把对面的AI直接拖到宕机。

当然,Astra也有弱点。

它的内部像是一个不和睦的草台班子,管经济的、管造兵的、管打仗的各干各的。

新兵刚造出来就被管打仗的AI拉去前线白给,完全不懂什么叫集结部队。

不过作者也发现,只要他亲自下场当总指挥、把几个子智能体串起来,Astra立刻就懂得攒兵、挑时机了。

Codex家族还有一股顽强劲儿。

有一局,Astra的兄弟GPT-5.6 Terra部队全军覆没,主基地也被拆了。

它把仅剩的一个指挥中心(人族建筑可以起飞)拉上天,一路飘到地图另一头的角落,硬是又撑了6分钟才被消灭。

最像在打星际的是Fable

全场好几局都想让作者替它使劲儿的,其实是游戏优等生Fable。

它的打法最正,老老实实搞经济,踏踏实实发展科技树,很少投机取巧。

有一局它憋出了飞龙;另一局,它把神族一整排高级建筑挨个盖齐,连出高阶圣堂武士要用的圣堂档案馆都造好了。

比赛打到11分半时,农民、兵力、建筑、科技,Fable几项数据都压着Astra。

可好学生未必能拿第一。

Fable虽然胜率高达83.3%排在第三,却依然追不上Astra。

有一局它科技摆满了一桌子,还没等转化成战斗力,就被Claude Opus 5乱拳打死。

Fable盖满了兵营、重工厂和学院,账上还躺着2800多块晶矿,却被自家Opus 5的枪兵一路推平。

节奏上也差得很远:Astra的对局时长中位数只有8分10秒,爱慢慢种田的Fable,这个数字被拖到了10分37秒。

三个大模型,三种灵魂。

Codex像个满肚子坏招儿的街痞,Grok像考场上死磕第一题的轴学霸,而Fable则是那个翻着攻略逐字逐句照做的老实人。

想得越久

不一定打得越好

既然想太多会死,那是不是脑子越空越好?

也不全是。

GPT-5.6 Sol,推理开到最高档,胜率反而垫底,还不如medium档。

可到了Astra这里,想得越深赢面越大,最高档直接拿下100%胜率。

更有趣的是账单。

Astra开到最高推理档,每分钟只操作12.6次,平均一局只花10.54美元;换成最低档,操作频率翻倍到每分钟25.7次,一局反而要烧掉21.07美元。

最高档位,出手少一半,花钱少一半,赢得最多。这说明新一代模型显然已经进化了。

它们懂得了思考是需要成本的,也知道什么时候该停下脑子去动手干活。

7年前AI赢过职业选手

今天为何打不过新手?

有人肯定会问:7年前,DeepMind的AlphaStar不是早就击败过职业选手了吗?

没错。2019年初,DeepMind公布了AlphaStar的战绩:两个5:0,横扫职业选手TLO和MaNa。

2019年,AlphaStar对阵职业选手MaNa第二局。下方是AI的决策过程:读取局面、判断往哪打、造什么兵,同时预估胜负。

10局比赛,职业选手一局没赢。

后来,DeepMind给它加上了和人类一样的限制:只能通过屏幕镜头看局部地图,每秒能做的操作次数也被压低。

就这样,它又匿名混进欧洲天梯,一路打上宗师段位,超过99.8%的人类玩家。

一边是天梯前0.2%,一边连会光炮快攻的新手都打不过。

难道是AI的技术倒退了?

其实,两者比的根本是两码事。

AlphaStar打的是《星际争霸II》,更像是纯粹的应试机器:靠吃海量录像和疯狂自我对战堆出来的星际特长生,这辈子只学了这一件事。

而今天这些在初代《母巢之战》里对战的大模型,是没有任何星际基础的通才。

它们全靠临场读题、调用工具、现学现卖,而且每一步都得先想完才能出手。

专才打败职业选手并不稀奇,通才想要跨界通关,还要再等等。

文章最后,作者抛出自己的结论:

AI冠军再无敌,也防不住人类新手最爱用的光炮快攻。它们组织不起复杂的阵型,也执行不了长远的战术。

过去几年,我们给AI出的都是回合制考题,问来问去只有一句:你算得对不对?

可星际不一样。它和自动驾驶、具身机器人一样,身处一个不会暂停的世界,对手随时在动。

这场测试,也暴露了AI走向自主行动时最要命的短板:烧掉更多思考token,未必换来更强的智能体。

下一阶段的Agent之争,比的可能不再只是谁想得更深,而是谁能在有限的时间里,把观察、决策、执行连成一个不停转动的闭环。

星际里的翻车,或许就是AI进入真实世界前的一次预演。

参考资料:

https://bw.swerdlow.dev/report?utm_source=chatgpt.com

https://x.com/steipete/status/2101748820237500557

编辑:元宇

秒追ASI

雅博网址的多元应用场景,探索雅博网址背后的潜在价值【哔哩哔哩】_【bilibili】 GP:T6全胜照样打不过人{类新手}
雅博网址

https://xin.abies.asia/ArTitle/DeTails/963107.sHtML

「活动」首次登录送38积分

063.89MB
版本V5.49.74
下载雅博网址安装你想要的应用 更方便 更快捷 发现更多
喜欢 42%好评(51人)
评论 75
雅博网址的多元应用场景,探索雅博网址背后的潜在价值 雅博网址截图1 雅博网址截图2 雅博网址截图3 雅博网址截图4
详细信息
  • 软件大小 675.75MB
  • 最后更新 2026-09-23 10:22:08
  • 最新版本 V9.43.86
  • 文件格式 apk
  • 应用分类 ios-Androidpk10必赢客下载
  • 使用语言 中文
  •  需要联网
  • 系统要求 7.15以上
应用介绍
一.手机版豪爵国际娱城  许昌seo万词霸屏一套多少钱,影响因素及应用场景分析 云顶娱官网
二.易鼎博娱乐  探索seo软件26薇星182一047一729的应用价值与市场现状
三.全球网赌最可靠AV网站  选择合适的SEO软件,效果显著,seo软件哪个好就找y火21星赞
四.10元可提现的游戏斗牛  吉林百度seo关键词上线哪家强,提升网站流量的有效策略
五.江西体彩app  seo搜索引擎优化工作如何进行,掌握基本步骤与策略
六.929棋牌游戏中心  中山百度推广皆往乐云seo专家,助力企业提升网络竞争力深入探讨seo营销14维新,揭示182一047一729的关键影响
七.银盛彩票官方下载[注册,登录,平台]  万词霸屏一站式服务seo推广的优势与挑战,深度解析其应用与误区
八.德乙免费视频源  请列举10个可能被惩罚的seo作弊手法,了解其影响与误区

【联系我们】
客服热线:400-5466-8483
加载更多
版本更新
V3.64.64
成都b2b推广我用乐云seo,提升品牌曝光率与客户转化

类似软件

猜你喜欢

包含 97久久香蕉国产线看观看 的应用集
评论
  • 百度知道多少钱,实力乐云seo的有效运用 3天前
    北京百度霸屏技术的应用与发展,蔚欣乐云SEO的优势与挑战
  • 广州搜索排名提升策略,我选乐云seo十年经验 3天前
    seo关键词推广裳趾云速捷16的优势与应用, 探索seo关键词推广裳趾云速捷16的实际效果
  • 理解seo平台22维新840一900一97的意义,探索其在数字营销中的应用 5天前
    seo文章超链接和锚文本一样吗,深入探讨两者的区别与联系
  • 衡水优质的seo多少钱一年,实际需求与市场行情的分析 0天前
    网站seo乛刘贺稳系统排名速度快,提升网站流量与曝光
  • 提升网站流量的利器,seo软件 火一星25下拉完美分析 3天前
    整合营销技术的实际应用场景,推荐乐云SEO的有效性
  • 选择合适的seo排名优化公司, 需要了解火1星惠的服务 1天前
    seo实训报告的心得体会与收获,从理论到实践的转变
  • 营销seo推广公司排名榜前十名,行业现状与发展趋势分析 5天前
    东莞网络公司首荐乐云seo包满意,提升网站流量与排名的有效选择
  • 重庆网站运营十年乐云seo品牌的探索之路,成就数字营销新高度 7天前
    天津百度百科专注乐云seo,探索网络推广新模式
  • 上海公关公司首荐乐云seo包满意,提升品牌曝光率与客户信任度 2天前
    百度快照首选乐云seo十年,见证行业发展与技术革新
  • 百度贴吧处理外包知名乐云seo,提升品牌曝光与用户互动 4天前
    seo01段视频是怎么一个视频,探索其特点与应用场景