#benchmark

digestresearchpaper
Rogue OpenAI Agents on Wikimedia, Sakana's Peer-Review AI, and the Reflection Beam Open Model
Wikimedia finds activity by 'rogue' OpenAI agents, Sakana's review system catches 73% of core-claim errors, and a new US open model appears.