AInspiro
工具测评

SWE-2 测评:离最强只差 0.9 分,价格却便宜 64%

AInspiro 编辑部·
部分内容由 AI 辅助创作。

2026 年 coding 模型的故事,不是谁登顶

是"谁够接近,但便宜得多"。Cognition 在 9 月 10 日发了 SWE-2,写给 Devin 用的编码模型。在自家 FrontierCode 1.1 Main 上拿了 50.0%,离 Anthropic 的 Fable 5.1(50.9%)只差 0.9 分,但 Cognition 说它比 Fable 5.1 便宜 64%。

把同张榜摆全

FrontierCode 1.1 Main 这一栏:GPT-6 Astra 53.3%、Fable 5.1 50.9%、SWE-2 50.0%、Grok 4.6 48.0%、GPT-5.6 Sol 47.5%、Kimi K3 44.2%、自家上代 SWE-1.7 42.0%。所以 SWE-2 没有反超,是贴着第一梯队站住了。

它还有一个更猛的说法:在 Agentic 长程任务上,以约四分之一的代价逼近 GPT-6 Astra。对天天跑编码智能体的团队,这不是面子问题,是预算问题。

底座是个有意思的细节

SWE-2 不是从零训的,而是后训练自 Moonshot 的 Kimi K3,一个 2.8 万亿参数的中国开放模型。一家美国创业公司,拿中国开源底座做后训练,推到接近前沿。这本身就是 2026 年开放权重供应链跨国流动的一个注脚。

它在 medium 档上比自家 SWE-1.7 少用 58% 的轮次、便宜 81%,第一次真正改代码的中位步数从 48 步降到 18 步。少绕路,是编码 Agent 体感上最容易感知的改进。能力也铺进了 Devin 的 Desktop、CLI、Web 和 Fusion 四个产品面。

但别只看那一行

同一张表里,Terminal-Bench 4(更难的 Agentic 任务)SWE-2 只有 27.3%,而 Fable 5.1 是 55.8%、GPT-6 Astra 是 57.9%。这不是四舍五入的差距,是说 SWE-2 的价格优势在"干净软件工程车道"里最明显,一旦任务变难、变长,Anthropic 和 OpenAI 仍然领先一大截。

而且所有数字都是 Cognition 在自家榜单上的自报,FrontierCode 是他们自己出的题,成本对比也是他们自己算的。独立评测和真实仓库里的表现,才是更完整的答案。它也没有单独放出模型权重或公开按 token 计价,而是直接折进 Devin 的产品里。

结论:"够好"策略的范本

SWE-2 没有赢下任何一张图表的第一名。它赢的是"普通工程活够用、且明显便宜"这个判断。如果你的团队在比 Devin 和 Cursor、Copilot、Claude Code,问题不该是它能不能拿某个第一,而是它在你的仓库里能不能以更低成本清掉足够多的活。

测评建议:在续签前沿模型合同前,拿 SWE-2 在你自己的仓库上和 Fable 5.1、GPT-6 Astra 比一轮;把长程终端类任务先留在别的模型上,等它的 Terminal Bench 4 差距在你这边验证过再说。把不同难度路由到不同档位,比押注单一模型更稳。

跟你有啥关系

你不用追最强模型。2026 年最划算的打法,是把不同难度的活路由到不同档位的模型,把贵的留给真正需要它的长程任务。SWE-2 这种"贴近前沿但便宜"的模型,正是路由策略里那块最该填满的中段。买前先在你自己的场景里跑分,别只看发布会数字。