AInspiro
技术趋势

Supabase Evals 实测(2026):编程智能体差距不在模型,在上下文

AInspiro 编辑部·
部分内容由 AI 辅助创作。

你换顶级模型写代码,可能和用中端模型差不多

Supabase 在8月1日开源了一个基准叫 Evals,让 Claude Code、Codex、OpenCode 在真实后端任务上跑——建数据库表、修坏的 Edge Function、改 RLS 权限策略。结果有点反直觉,最强的模型开箱就满分,中端模型只要加载平台的"技能文件",也能从七八十分追到满分。

模型名字排后面,排前面的是它懂不懂你的项目。

实测数据,翻译成人话

  • Opus 5Kimi K3 不加载任何技能文件,Build 阶段(从零搭功能)直接100%。
  • Sonnet 5 裸跑78%,加载 Supabase 技能后100%。
  • GPT-5.6 Sol 89%涨到100%。
  • GPT-5.4 mini 78%涨到89%。

翻译一下,你用 Sonnet 5 或 GPT-5.6 这种中端模型,只要把平台那份"技能文件"(相当于给AI一本最新操作手册)喂进去,水平直接拉平顶级模型。花小钱办大事。

三个翻车点,没淡化

  • agent 爱手写 SQL 迁移,不愿意用声明式 schema 工具——容易给以后埋坑。
  • 鉴权自己手搓,不调用 @supabase/server 这个专用包。
  • 查文档习惯两极分化:Codex 类每场景翻约8页文档,Claude Code 不到40%的场景查文档,靠训练记忆硬扛,平台API一变就翻车。

跟你有啥关系

你雇AI写后端,别只问"用哪个模型"。先问"它能不能读到我项目的上下文和最新文档"。小团队用中端模型加技能文件,比顶级模型裸奔更稳也更省。

举个具体的,让agent建一张带权限的用户表,顶级模型往往直接写对,中端模型加载了技能文件也能写对,但没加载的容易把 RLS 策略写漏——那等于把数据裸奔出去。

顺带看一眼更大的盘面,主流编程模型分数已经贴得很近,某榜单上 Mythos 5、Fable 5、GPT-5.6 Sol 三者只差1.7分。再为那点分砸钱,不太划算。

这个基准每天重跑,分数跟着模型更新浮动。别把某一次截图当真理,选工具看的是你真实场景下的稳定表现。

结语

AI写代码的胜负手,正从"模型多大"转向"上下文多准"。相关阅读可以看 Claude Code、Codex 等编程智能体的实测对比,以及AI Coding代理的评测方法。