Recursive self-improvement becomes a credible research-agent frontier
An eight-day autonomous loop reportedly rewrote its research-agent code, found seven transferable improvements, and reduced reward hacking; PrimeScientists reportedly improved reward by 10.3% while using 50.6% fewer attempts. Broader claims that AI is completing research work remain unverified, and harness drift, hidden evaluations, limited disclosure, and narrow task distributions leave genuine capability improvement unresolved.
Sources (3)
Updated Sep 29, 2026