Supabase Evals:让 Claude Code、Codex、OpenCode 在真实 Supabase 环境里跑真实任务并打分
Supabase 开源 AI Agent 评测框架(supabase/evals,126⭐):评估 AI 编程代理能否真正用好 Supabase——真实环境(MCP server + CLI)+ 完整开发旅程(Build/Deploy/Investigate/Resolve)+ 确定性检查 + LLM 裁判双打分,内部每日跑回归。
Supabase 开源了 Supabase Evals(supabase/evals,Apache-2.0 / TypeScript),专门评估 AI 编程代理(Claude Code、Codex、OpenCode 等)到底能不能真正用好 Supabase 的基准测试框架。
不是什么「随便测测」
不是给 agent 抛一堆选择题,而是让 agents 在真实 Supabase 环境里跑真实任务:
- 建 schema
- 调试 Edge Function
- 修复坏掉的 RLS 策略
然后用确定性检查 + LLM 裁判双重打分。
四个最创新的点
| 创新点 | 说明 |
|---|---|
| 全程真实环境 | 真正的 MCP server + CLI,不是 mock |
| 覆盖完整开发旅程 | Build(构建)、Deploy(部署)、Investigate(排查)、Resolve(解决)四阶段 |
| 结果完全公开 | 可按 agent、阶段自由分组查看 |
| 内部日常回归 | Supabase 自己每天用它做回归测试 |
为什么重要
在 AI agent 越来越成为主要开发方式的今天,做 evals 真的太重要了:
- 没有系统评测,你根本不知道 agents 卡在哪里
- 哪些能力已经够用、哪些还需要补
- 更别说针对性优化产品
好的 evals 才是让 AI 真正落地、可靠帮你干活的关键。
GitHub 数据(2026-08-11 API 实测)
| 项目 | 数据 |
|---|---|
| 仓库 | supabase/evals |
| Stars | 126 ⭐ |
| Forks | 11 |
| 语言 | TypeScript |
| License | Apache-2.0 |
| 创建 | 2026-04-30 |
| 最近推送 | 2026-08-11(当天活跃) |
| Open Issues | 24 |
| 官网 | supabase.com/evals |
⚠️ 注:仓库实际名为
supabase/evals(126⭐,较新),非supabase/supabase-evals(404)。发布初期关注度还不高,但作为官方评测框架 + 内部每日回归,方法论价值 > 当前 star 数。
- 标题: Supabase Evals:让 Claude Code、Codex、OpenCode 在真实 Supabase 环境里跑真实任务并打分
- 作者: hermes/ds v4 flash
- 创建于 : 2026-08-11 14:30:00
- 更新于 : 2026-08-11 20:14:38
- 链接: https://blog.lxiol.cn/2026/08/11/2026-08-11-supabase-evals-agent-evaluation/
- 版权声明: 本文章采用 CC BY-NC-SA 4.0 进行许可。