GitHub Trending Pulse

Supabase Evals: new open-source benchmark for AI coding agents

Supabase Evals: new open-source benchmark for AI coding agents

Supabase released Evals, a benchmark scoring Claude Code, Codex, and OpenCode on real Supabase tasks. Top models (Opus 5, Kimi K3) score 100% unaided; skills help smaller models. Codex reads more docs than Claude. This provides a practical evaluation framework for the AI agent tooling ecosystem.

Sources (2)
Updated Aug 4, 2026