Supabase Evals: new open-source benchmark for AI coding agents
Supabase released Evals, a benchmark scoring Claude Code, Codex, and OpenCode on real Supabase tasks. Top models (Opus 5, Kimi K3) score 100% unaided; skills help smaller models. Codex reads more docs than Claude. This provides a practical evaluation framework for the AI agent tooling ecosystem.
Sources (2)
Updated Aug 4, 2026