你换顶级模型写代码,可能和用中端模型差不多
Supabase 在8月1日开源了一个基准叫 Evals,让 Claude Code、Codex、OpenCode 在真实后端任务上跑——建数据库表、修坏的 Edge Function、改 RLS 权限策略。结果有点反直觉,最强的模型开箱就满分,中端模型只要加载平台的"技能文件",也能从七八十分追到满分。
模型名字排后面,排前面的是它懂不懂你的项目。
实测数据,翻译成人话
- Opus 5 和 Kimi K3 不加载任何技能文件,Build 阶段(从零搭功能)直接100%。
- Sonnet 5 裸跑78%,加载 Supabase 技能后100%。
- GPT-5.6 Sol 89%涨到100%。
- GPT-5.4 mini 78%涨到89%。
翻译一下,你用 Sonnet 5 或 GPT-5.6 这种中端模型,只要把平台那份"技能文件"(相当于给AI一本最新操作手册)喂进去,水平直接拉平顶级模型。花小钱办大事。
三个翻车点,没淡化
- agent 爱手写 SQL 迁移,不愿意用声明式 schema 工具——容易给以后埋坑。
- 鉴权自己手搓,不调用 @supabase/server 这个专用包。
- 查文档习惯两极分化:Codex 类每场景翻约8页文档,Claude Code 不到40%的场景查文档,靠训练记忆硬扛,平台API一变就翻车。
跟你有啥关系
你雇AI写后端,别只问"用哪个模型"。先问"它能不能读到我项目的上下文和最新文档"。小团队用中端模型加技能文件,比顶级模型裸奔更稳也更省。
举个具体的,让agent建一张带权限的用户表,顶级模型往往直接写对,中端模型加载了技能文件也能写对,但没加载的容易把 RLS 策略写漏——那等于把数据裸奔出去。
顺带看一眼更大的盘面,主流编程模型分数已经贴得很近,某榜单上 Mythos 5、Fable 5、GPT-5.6 Sol 三者只差1.7分。再为那点分砸钱,不太划算。
这个基准每天重跑,分数跟着模型更新浮动。别把某一次截图当真理,选工具看的是你真实场景下的稳定表现。
结语
AI写代码的胜负手,正从"模型多大"转向"上下文多准"。相关阅读可以看 Claude Code、Codex 等编程智能体的实测对比,以及AI Coding代理的评测方法。
