Supabase 开源 Evals:首个面向 AI 编程 Agent 的真实任务基准测试框架
当所有人都在用 SWE-bench 衡量"模型能不能修 GitHub issue"的时候,Supabase 换了个问法:AI 编程 Agent 能不能真正帮人完成一个完整平台的开发任务? 7 月 31 日,Supabase 正式开源了 supabase/evals——一个用真实 Supabase 任务测试 Agent 表现的基准框架,Apache-2.0 协议,本地即可运行。
测什么:不是答题,是干活
supabase/evals 的核心思路很简单:让 Agent 面对真实的 Supabase 开发场景——建一个数据库 schema、调试一个挂掉的 Edge Function、修一条有安全漏洞的 RLS 策略——然后看它能不能搞定。
这和传统 benchmark 的区别在于:不是给模型一道选择题或一段代码让它补全,而是让 Agent 在一个真实的、容器化的 Supabase 环境里,调用真实的 CLI 和 MCP server,完成端到端的开发任务。评分也不靠人工,而是确定性检查(比如用户能不能访问到该访问的数据、Edge Function 返回结果对不对)加上 LLM-as-a-judge 做语义判断,Agent 还有一次重试机会。
怎么覆盖:三维矩阵 + 两套场景
Supabase 定义了三个维度来确保覆盖面:
- 产品维度:Database、Auth、Storage、Edge Functions、Realtime、Cron、Queues、Vectors、Data API——几乎覆盖 Supabase 全部产品线
- 主题维度:RLS、安全、迁移、SQL、SDK、可观测性、自托管、测试、声明式 Schema 等
- 阶段维度:Build(从零搭建)、Deploy(部署上线)、Investigate(排查问题)、Resolve(修复问题)
场景分两套:Benchmark 场景追求广度,覆盖真实用户旅程,结果公开在 supabase.com/evals;Regression 场景追求深度,覆盖已知失败模式,每天刷新,不影响公开分数。
每个场景目录包含 PROMPT.md(任务描述+元数据)、EVAL.ts(评分器)、以及可选的起始状态文件。想加新场景?写一个目录就行。
测出了什么:顶级模型裸跑就够,技能主要帮中小模型
结果有些出乎意料:
- Opus 5 和 Kimi K3 在 Build 阶段裸跑就拿了 100%,不需要任何技能辅助
- 技能的价值主要体现在中小模型上:Sonnet 5 从 78% 提升到 100%,GPT-5.6 Sol 从 89% 到 100%,GPT-5.4 mini 从 78% 到 89%
三个系统性弱点浮出水面:
- Agent 倾向手写迁移,而不是用 Supabase 的声明式 Schema——这已经促成了 agent-skills 的更新
- Agent 手动验证 Auth,而不是用 @supabase/server 包——Supabase 因此发布了包选择指南
- 文档使用差异巨大:Codex / GPT-5.6 每个场景大约读 8 页文档,而 Claude Code 即使加载了技能,也只有不到 40% 的场景会查文档
这些发现不只是分数,而是直接推动了 Supabase 产品和文档的改进。
谁该关注、怎么上手
如果你是 Supabase 用户,这个框架能帮你判断哪个 Agent 最适合你的技术栈;如果你是 Agent 框架开发者,它提供了一个可复现的、面向真实平台能力的评测方案;如果你是平台方,它示范了如何系统化地追踪 Agent 在自己平台上的表现。
本地运行只需要 Docker、pnpm 和对应模型的 API Key:
```
git clone --recurse-submodules https://github.com/supabase/evals.git
cd evals && pnpm install && cp .env.example .env
pnpm eval -- --experiment claude-code-sonnet-5 --eval resolve-dataapi-001-empty-results
```
公开排行榜在 supabase.com/evals,实时更新。
为什么这件事重要
AI 编程 Agent 的评测正在从"模型能不能答对题"转向"Agent 能不能干完活"。SWE-bench 测的是修 issue,但真实开发远不止修 bug——还有从零搭建、部署上线、排查问题。supabase/evals 是目前少见的、面向"Agent 完成真实开发任务"的开源评测方案,而且它测的不是模拟环境,是真实的容器化 Supabase 栈。
开源意味着任何人可以复现、贡献新场景、或者 fork 出来测自己的平台。对于正在选择 Agent 工具的团队来说,这类基于真实任务的基准测试,比任何营销页面上的 benchmark 分数都更有参考价值。