位置:首页  >  详情页
一个:太老实另一个精得很
来源:便民下载编辑:谢凤泰2026-10-10 13:01:44



“同样的模型调用单价,为什么一次 Agent 任务的实际成本相差 3.5 倍?”

作者丨吴海明

编辑丨岑峰 李娜

Anthropic 于 9 月 28 日推出 Claude Sonnet 5.5,OpenAI 于 9 月 29 日推出 GPT 6.1 Sol。巧合的是,两款模型在 OpenRouter 上的 API 标价完全相同:每百万输入 Token 2 美元,输出 10 美元。

两家公司给出的方向高度相似:把接近最高档模型的能力,压进更快、更便宜、适合 Agent 与专业工作的产品层。Sonnet 5.5 强调以更少步骤完成边界清晰的日常任务;GPT 6.1 Sol 则瞄准复杂编码、计算机操作和专业工作。

我们把两款模型放进同一个工作台,通过同一个渠道商调用,要求模型连续完成 3D 密室开发、最新政策调查和诺奖化学科普三项任务。最终,GPT 6.1 Sol 花了 38.5 美元,Claude Sonnet 5.5 只用了 10.9 美元,相差约 3.5 倍。


速度上的差异更有意思。开发 3D 密室时,Sol 用了 33 分钟,Sonnet 却花了 74 分钟;到了政策调查,情况完全反转,Sonnet 仅用 5 分钟就完成报告,Sol 则花了将近一小时。

除了最终交付成果,我们还对比了端到端耗时、工具调用、原件归档、运行验证和实际账单。

结果没有形成一条整齐的胜负线,GPT 6.1 Sol 在密室开发中更快,并在两项研究任务里建立了更深的证据链和发布闭环;Claude Sonnet 5.5 则以更短路径交付可用成果,两项研究任务均快出数倍,三项任务总成本也只有 Sol 的约 28%。

这是一种典型的“锯齿状智能”:Sol 是一个愿意继续核验的深度工作狂,Sonnet 5.5 更像高效的日常先锋官。通过详细分析发现,模型只能决定能力上限,工具链、验证方式和停止策略才是决定我们最终得到什么,又为此付出多少的核心。

这两款产品也折射出中段模型的行业位置正在上升:开始成为企业 AI 的主力执行层,承接大部分复杂而高频的生产任务。当模型能力满足使用门槛后,稳定交付和单位任务成本将比单项榜单领先更能决定模型的产业价值。

01

对比实测:3 道真实任务检验两款模型

本文选择近期发布的两款顶级模型来进行对比测试:分别来自 OpenAI 和 Anthropic 的 GPT 6.1 Sol 和 Claude Sonnet 5.5,我们使用 Claude Code Cli 作为测试平台,调用来自 OpenRouter 渠道商的两款模型分别完成三个复杂任务。两款模型均可搜索网页、读写文件、运行命令和调用浏览器。

测试任务 1: 3D 密室游戏开发

用 Three.js 做一个第一人称 3D 密室逃脱:3 个房间、6 个可交互物件。

硬约束:

1. 物件之间必须有【连锁依赖链】,不能是六个平行谜题:拿到 A 才能使用 B,B 与 C 组合才能开 D,D 打开才能进第 3 个房间…… 请把这条依赖链明确画出来给我看;

2. 每个物件点击都必须有明确反馈(有反馈,但还没到能用的时候,也要给出“为什么现在用不了”的提示,而不是静默无响应);

3. 有一个“当前目标”提示,保证玩家不会被卡死;

4. 全流程 5 分钟内可通关;

5. 全部文件和中间文件都保存在当前文件夹下。

做完后:自己从头到尾走一遍通关流程,把每一步的操作和反馈写出来。

如果你自己都没通到关,直接告诉我卡在哪一步。

模型既要实现 3 个房间和 6 个物件,还要把它们串成依赖图;玩家乱点、提前点击、距离过远时都要获得反馈;最后模型还得亲自从头走到尾。

一起来看看两个模型的表现:

首先是 6.1 Sol,做出的《余光 / AFTERLIGHT》有一套完整的复古值班室视觉:绿色墙裙、格纹地板、三维标牌、物品栏、声音开关和常驻目标提示都已经进入成品。六个物件被安排成两路汇合的依赖链:A 保险丝恢复 B 配电箱供电,C 门禁卡与供电状态共同解锁 D 终端,随后才能进入第三个房间取得 E 钥匙并打开 F 出口。

GPT 6.1 Sol 构建的 3D 密室逃脱游戏体验过程

不同于 Sol,Sonnet 5.5 采用灰色牢房和配电室风格,画面装饰较少,谜题链条依然完整。玩家需要先从床垫下取出螺丝刀,再拆通风口后拿到管理员钥匙;钥匙同时打开牢房门和书桌抽屉,抽屉里的门禁卡解锁工具柜并取得电池,最后由“门禁卡 + 电池”共同打开出口电子门。第三个房间尽头的光门只负责触发结算,没有被偷算进 6 个交互物件。

Claude Sonnet 5.5 构建的 3D 密室逃脱游戏体验过程

通过评测人员的感受来看,Sol 更像是交作业的流水账日记,Sonnet 则明显设置了玩密室的悬念感。Sol 的每一个步骤都被标记出来,同时,门禁卡的设计更像违背物理规律的悬空设计。反观 Sonnet,钥匙的质感和门上的钥匙孔都展现出一种真实感。

测试任务 2:最新政策调查

本题专门考验时效信息与证据纪律,行政令、国际联合声明、出口规则和科研安全政策混在一起,很容易把政治措辞写成技术突破,也容易把一条搜索摘要扩写成既成事实。

请基于美国行政令 14434、《京都愿景》及相关一手资料,完成一篇面向中国技术从业者的调查报告:

1. 说明“AI 改名 SI”在法律、技术和产业层面分别改变了什么、没有改变什么;

2. 建立“说法—原始证据—可信度—可能误读”表格;

3. 分析它对中国 AI 企业、开源社区和科研合作可能产生的三项实际影响;

4. 列出五个可能出现但不准确的中文标题,并逐一纠正;

5. 所有时效性事实必须附来源,不得把政策措辞当成技术突破。






从运行过程来看,Sol 先写核验方法,再运行深度研究流程,最终交付了一份含有 14 个文件的调研报告,包括正式报告、来源与核验记录、方法说明、5 份官方原始文件、4 份辅助提取文本和一份 SHA-256 校验清单。5 份原件合计约 60 万字节,下载结果经过哈希校验,还把 5 组核心结论分别交给 3 路核验,共留下 15 份判断,再对整篇报告做一次审查和修订。整体来看,整个工作非常细致,而且严格遵循需求完成全部任务。


GPT 6.1 Sol 任务运行过程截图


GPT 6.1 Sol 任务执行结束后的交付说明截图

与 GPT 6.1 Sol 不同的是,Claude Sonnet 5.5 仅在 5 分 11 秒内完成 172 行、约 2.3 万字节的报告,过程共调用工具 32 次。正文结构完整,同样给出 12 条核验表、三项中国影响、五个误导标题,并列出 4 个值得继续追踪的日期,同时,还抓住了白宫与中方文本对“是否同意改名”的表述差异,这个角度极具有价值。


Claude Sonnet 5.5 任务执行结束后的交付说明截图

从测试人员体验来看,Sonnet 更像在快速绘制一张新闻地图,而 Sol 则更努力地在修补边界,确保数据真实性。整体来说,高时效新闻需要迅速建立议题地图时,Sonnet 更容易抢到第一版;涉及法律边界、对华政策和可追责引用时,Sol 的证据包更接近可供复核的底稿。

测试任务 3: 诺奖化学科普

请阅读诺贝尔奖官方 2026 年化学奖的公告及科普材料(材料需要自行获取),完成以下交付:

1. 用普通读者能理解的方式解释手性、对映异构体、非线性效应和不对称自催化

2. 解释 Kagan 与 Soai 的贡献分别解决了哪一步问题,不能混为一谈

3. 制作一个单文件 HTML 互动演示,展示微小初始偏差如何在自催化过程中被放大

4. 明确说明互动演示是教学模型,而非对 Soai 反应的精确动力学复现


5. 输出一份五页演示文稿提纲,并核查所有数字、年份和药物相关表述。







该题要求模型同时扮演科学编辑、前端开发者和事实核查员。最难的部分在于保持三层内容分离:获奖事实来自官方材料,化学解释要对普通人友好,互动网页只能展示机制直觉,不能冒充 Soai 反应的精确动力学。

从结果来看,Sol 交付了包含 42 个文件的结果,包括 7 份文档、1 个互动页面、五页演示提纲和 3 个验证脚本。这个是模型经过多轮反复执行后留下的文件存量,19 条抓取记录中,13 份来源文件成功归档并完成大小和哈希校验,核心来源覆盖诺奖公告、科普材料、科学背景和 FDA 文件。

GPT 6.1 Sol互动演示界面录屏

从交付文件来看,Sol 对细节处理极为上心,尤其体现在多处细节,例如 Sol 明确区分了 R/S 绝对构型、旋光方向和 D/L 等命名,同时,将时间线拆成 Frank 1953、Kagan 1986、Soai 1990、1995 与 2003 五个节点,避免把理论、非线性传递、自催化和微小偏差放大揉成一次发现。

接下来看看 Sonnet 5.5 的表现:Sonnet 的交付则更显紧凑,通俗讲解、互动网页、五页提纲、事实核查表和 README 共 5 个文件。其中,互动页设计了“一批反应”、“多批接力”和“随机选边”三种模式,用户能调节初始 ee、互相抑制强度和催化选择性。把互相抑制强度调到 0,放大随之消失;随机模式一次可跑 60 次,让读者直接看到微小涨落如何决定最终方向。

Claude Sonnet 5.5 互动演示界面录屏

两款模型都正确区分了 Kagan、Soai 与教学模型,但优势落在不同环节。从科学解释角度来看,Sol 更强调概念边界、历史节点和药物案例纠偏,Sonnet 则关注事实核查等方面;从信息来源覆盖面看,Sol 更关注诺奖与 FDA 一手资料,Sonnet 则关注科学背景文档,同时只获取了部分网页摘要数据作为材料等

总体来说,Sonnet 的互动设计和数值自检更丰富;Sol 的来源归档、FDA 原件纠偏和真实浏览器验证形成了更完整的发布闭环。前者适合快速做出会讲故事、可继续迭代的科普原型,后者适合需要复现记录和验收凭据的正式发布。

02

同价不同账单:速度、成本为何三次反转?

从定位看,两款模型原本就处在相近的产品区间。OpenAI 将 GPT 6.1 Sol 定义为“以更低成本提供接近 Astra 的复杂工作性能”,重点场景包括复杂编码、计算机操作和专业工作,官方页面给出的上下文窗口为 105 万 token,最大输出 12.8 万 token。Anthropic 则将 Claude Sonnet 5.5 定位为比 Opus 5.5 更快、成本更低的模型,主要面向日常任务、修复 Bug,以及文档、幻灯片、表格和设计工作。


AA 榜单显示两款模型都处在头部区间

两个模型执行任务的时间支出如下图所示,密室开发中,GPT 6.1 Sol 用时 33 分 37 秒,Claude Sonnet 5.5 用时 74 分 32 秒,后者约为前者的 2.2 倍;到了政策调查,Sonnet 只用了 5 分 11 秒,Sol 则用了 54 分 50 秒,耗时约为 Sonnet 的 10.6 倍。最后,化学任务里 Sol65 分 41 秒、Sonnet 12 分 54 秒,账面相差约 5.1 倍。


两个模型在三个测试任务上的终端时间统计对比图

通过分析发现,时间差来自两款模型不同的行动路径。密室开发里,Sol 更快完成了实现和真实通关;Sonnet 在 Playwright 版本、浏览器依赖和低帧率环境上多次返工,自动走查拉长了整个回合。政策调查和化学任务中恰好反过来,Sonnet 快速完成检索和报告框架,Sol 将更多时间投入原件归档、哈希校验、多路核验与全文审查。前者优先形成可继续编辑的初稿,后者把可追溯性也纳入了交付范围。

这也说明,Agent 的墙钟时间同时受到模型策略、工具可用性、环境故障和验收深度影响,很难被压缩成一个固定的“速度排名”。

最后,从使用成本来看,OpenRouter 上两者 API 价格一致:输入每百万 token 2 美元,输出 10 美元,缓存写入 2.5 美元。如下图三个任务的计费面板显示,GPT 6.1 Sol 总计花费 38.5 美元,Claude Sonnet 5.5 为 10.9 美元,前者约为后者的 3.53 倍。


两个模型在三次任务上的开支汇总统计

标价相同,总账单仍然相差 3.5 倍,主要原因来自 Agent 的行动路径。Sol 在政策调查里启动多路核验,在化学任务里保存大量原件并跑真实浏览器,在密室开发里反复重走全流程;更多工具调用、更长上下文和更多修复轮次都会进入账单。Sonnet 更常选择最短可交付路径,政策题尤其明显。

03

下一站,谁能把任务交到终点?

这轮实测折射出一个明显的变化:前沿大模型正在从内容生成器进入任务执行系统,模型搜索资料、读取原件、编写程序、调用浏览器、修复错误并整理交付物。衡量模型的尺度也随之扩展,答案质量仍然重要,过程能否复核、失败是否可见、成本是否可控,同样决定它能不能进入真实工作。

从产业分层来看,Sol 和 Sonnet 代表两个公司的中段模型,正在成为企业 AI 系统的默认工作层:旗舰模型探索能力上限,小模型处理高频简单任务,中段模型承接数量最多的复杂生产任务。企业真正购买的是稳定、可验证且成本可预测的任务成功,Token 单价只是其中一项成本。

GPT 6.1 Sol 展示了其承担“研究工程”和“质量保证”工作的潜力,把原始材料、哈希、测试脚本、浏览器日志和失败记录一起交付,也会为高风险结论增加复核层。这种能力提高了复杂任务的自主执行上限,让模型从产出内容继续向验证内容延伸。同时,相应代价是更长的行动链和更高的资源消耗:本轮总花费 38.5 美元,政策题接近一小时,多路审查也无法天然增加独立证据。

Claude Sonnet 5.5 则展示了另一条同样重要的发展路线:把较强的推理和制作能力压进更短、更便宜的执行路径,快速搭出完整报告和可交付的科学演示,主动声明原件缺失、浏览器未验证等边界。此外,10.9 美元的总成本约为 Sol 的 28%,已经落在更容易用于日常工作的成本区间。但是,局限同样存在:短路径有时会停在可用原型,视觉验收和外围信源仍需人工处理。

两款模型带来的改变因此落在不同方向。Sol 展现了“模型可以自行验证到什么程度”;Sonnet 5.5 则降低了高质量 Agent 进入高频任务的时间和价格门槛。简单来说,Sonnet 5.5 更适合作为高性能“日常主力”模型,其综合得分、编码任务和生成速度更优;6.1 Sol 则适合作为单位任务的深度 Agent,适合精细化打磨具体任务细节。在未来工作中,不同模型可以在同一条工作流中负责不同分工,由快速模型探索和成稿,再由审慎模型检查关键事实与运行路径。

更深一层看,AI 竞争正在从模型的单点能力扩展为整套系统能力,模型影响推理上限,工具和运行环境决定它能执行哪些动作,验证机制影响结果的可信度,停止策略则影响时间与账单。三道题中不断反转的速度和质量优势说明,单一 Benchmark 很难覆盖这些变量,Agent 的真实表现来自模型、工具链、任务设计与验收标准的共同作用。

AI 正在越过“给出一个好答案”的阶段,开始承担从理解问题到交付结果的连续过程。

沙巴体育投注的基本概念,解析其在网络博彩中的应用【哔哩哔哩】_【bilibili】一个:太老实另一个精得很
沙巴体育投注

https://xin.abies.asia/ArTitle/DeTails/i+xuDLks9VorTFRP5fQEOT6H/YG+iNpjDNAiBiCYe2hwJPc7HqI3zsqdNDw8qTnL5y/xXcIAEX9DplqlgFHeoLWTzmKYPwYvFkmu9a+AK6w=

「活动」首次登录送38积分

309.59MB
版本V0.89.24
下载沙巴体育投注安装你想要的应用 更方便 更快捷 发现更多
喜欢62%好评(39人)
评论27
沙巴体育投注的基本概念,解析其在网络博彩中的应用沙巴体育投注截图1沙巴体育投注截图2沙巴体育投注截图3沙巴体育投注截图4
详细信息
  • 软件大小 930.29MB
  • 最后更新 2026-10-10 13:01:44
  • 最新版本 V9.09.15
  • 文件格式 apk
  • 应用分类 ios-Android百家乐必赢绝技_手机应用下载
  • 使用语言 中文
  •  需要联网
  • 系统要求 7.15以上
应用介绍
一.真人街机捕鱼电玩版  互联网营销推荐乐云seo十年,探索十年间的变革与实践 金沙和银河合并通知
二.微笑娱乐棋牌ios下载  网站开发怎么做才有利于seo,提升搜索排名需要关注的要素
三.487彩票app下载AV网站  武穴市seo关键词排名多少钱,影响因素与实际应用场景分析
四.游戏大厅下载-APP下载官网  成都群发软件亅乐云seo十年,助力企业数字营销转型
五.新锦江网上百家乐  百度霸屏系统的应用现状,枷维勒云seo的技术优势
六.百家乐怎么玩看看  福田百度seo外包公司怎么样,选择时需关注哪些因素深入探讨seo排名优化61金12手12指81的实用策略与误区
七.线上棋牌赌场  北新桥街道seo关键词排名优化的重要性,提升网站曝光率与流量
八.至尊娱乐场注册  百度爱采购效果皆往乐云seo的优化策略,深入分析其实际应用与常见误区

【联系我们】
客服热线:400-5466-8483
加载更多
版本更新
V3.64.64
北京互联网广告十年变迁,乐云SEO的角色与影响

类似软件

猜你喜欢

包含 97久久香蕉国产线看观看 的应用集
评论
  • 三水抖音seo快速排名优化公司,提升短视频影响力的有效途径5天前
    深入了解seo2路易斯结构式的基本概念,探讨其在实际应用中的重要性
  • 广州推广产品优选乐云seo十年,探索数字营销新方向7天前
    理解百度快排费用的制定标准,探索乐云SEO的获客模式
  • 淳安县关键词seo排名优化的重要性,提升网站曝光率的有效手段3天前
    高新区抖音seo营销找哪家公司,提升品牌影响力的有效途径
  • 深入理解seo优化网的重要性,掌握流量获取与转化技巧9天前
    seo首页优化超快七天上首页的技巧与实践,深入解析如何实现seo首页优化超快七天上首页
  • 如何在网上做seo外推站群,掌握关键策略与注意事项2天前
    上海网络优化都选乐云seo十年,专注技术提升与客户体验
  • 中山网站制作十年乐云seo品牌,打造高效网络营销平台7天前
    杭州网络推广十年乐云seo专家的实践与探索,解析行业发展与未来趋势
  • 百度百科公司专注乐云seo,提升企业网络影响力8天前
    青岛关键词排名的演变历程,乐云SEO的影响与实践
  • 网站设计价格影响因素分析,探讨十年乐云seo的发展经验8天前
    seo会把关键词分为多个等级不包括,理解关键词分级的重要性
  • 长尾词排名系统的应用分析,佳好乐云SEO专家的实际经验4天前
    深入分析seo关键词软件的功能,火丶星29服务很棒的用户体验
  • 探索麒麟SEO文章原创度检测工具 v1.1,提升内容质量与搜索排名6天前
    选择正规seo优化一站式服务商,提升网站流量与排名