榜单前两名,只差 0.4 分。这已经不是谁更聪明的问题
8 月 21 号一份 Terminal-Bench 2.1 的独立跑分出来了。代码智能体这个赛道,第一和第二的差距小到可以忽略:GPT-5.6 Sol 拿了 89.5%,Claude Opus 5 拿了 89.1%。
你花大价钱追的"最强模型",跟第二名之间,可能就差你喝杯咖啡的时间。
真实数字长这样
- GPT-5.6 Sol(xhigh 档):89.5%,第一
- Claude Opus 5(max 档):89.1%,第二
- Grok 4.6(high 档):88.4%,第三
- Claude Code + Fable 5(厂商自报):83.8%
- Codex CLI + GPT-5.5:83.1%
- Claude Code + Opus 4.8:78.9%
注意一个坑:前三个是第三方 Artificial Analysis 用同一套 Terminus 2 测试架、89 个真实终端任务跑出来的,可比;后面几个是厂商自己报的,不能直接比。所以别拿着厂商海报上的分数当真理。
开源这边,星星数才是真战场
拼编程智能体,开源阵营的活跃度很说明问题。opencode 拿下了 19.9 万颗星,把 Claude Code 的 14.2 万、Codex 的 10.9 万、Gemini CLI 的 10.6 万全压在下面。它走 MIT、模型随便换、免费。
价格梯队也清楚:Cursor Pro 20 美元/月,GitHub Copilot Pro 10 美元/月就能用。贵的不再是"能不能写代码",而是"写得好不好、贵不贵"。
真正的分水岭在成本和工作流
GPT-5.6 Sol 报价每百万 token 输入 5 美元、输出 30 美元;Opus 5 是输入 5 美元、输出 25 美元。两者分数差半个百分点,价钱差出一大截。
Anthropic 把 Opus 5 定位成"实用默认款",Fable 5 留给那些分数差值得多掏一倍的场景。OpenAI 则是三档家族(Sol/Terra/Luna)通吃。
说白了,榜单走到今天,比的是"你愿为哪半个点付多少",不是"谁绝对最强"。同一个模型,塞进不同智能体里分数都不一样——所以评的是"智能体+模型"这个组合,不是光看模型。你换了个前端工具,跑分可能就变了。
一个被忽视的事实
这些分数测的是"在终端里把开发任务从头干到尾":改文件、跑命令、修报错。它不代表"写业务代码顺不顺手"。日常你写功能、改 bug,体感跟榜单往往对不上。榜单告诉你谁的上限高,不告诉你谁跟你鼠标更合拍。
榜单贴身肉搏,反而把价格打下来了
前两名咬得这么紧,直接后果是价格战。Grok 4.6 当初定价 2/6 美元就是冲着"比 GPT 和 Claude 便宜一大截"去的。当模型能力趋同,厂商只能拼性价比——这对咱们用户是好事。一年前写代码还是 GPT-4 级别按字收费,现在同等水平便宜了数倍。
跟你有啥关系
你选编程工具,别再死磕榜单第一名。前两名差 0.4 分,体感上分不出来。真要算的是:你常用的工作流它顺不顺、长上下文够不够、账单扛不扛得住。小团队直接 Copilot Pro 10 美元起步,重度玩家再上 Opus 5 或 GPT-5.6 Sol。开源控就上 opencode,模型自己挑。分数接近的时候,价格和手感才是你该纠结的。
