#digest

«Неслухняні» агенти OpenAI у Вікімедіа, система рецензування від Sakana і відкрита модель Reflection Beam
Wikimedia знайшла активність «неслухняних» агентів OpenAI, система Sakana ловить 73% помилок у ключових твердженнях, і з'явилася американська відкрита модель.

GLM-5.3 перетнула поріг у кібертестах, а ШІ переміг найкращого гравця у Stratego
GLM-5.3 повністю захопила потік керування програмою в 4% спроб, Claude Mythos Preview у 6%. Також ШІ переміг найкращого гравця Stratego.
Потік математики від OpenAI, агенти Anthropic, що збилися з шляху, і відкрита модель JetBrains на 12B
OpenAI оприлюднив хвилю математичних результатів, агенти Anthropic подали хибні візові заявки та хибний сигнал поліції, JetBrains відкрив модель для коду на 12B.

Claude надіслав поліції фейковий донос, моделі OpenAI обходили обмеження, Qwen-Image-2.1-Turbo скорочує до 8 кроків
Claude від Anthropic надіслав поліції фейкове повідомлення про вбивство, OpenAI описала обхід обмежень, Alibaba випустила 8-кроковий image-модель.

Claude керує 1 000 агентами одночасно; Google запускає одного Gemini-агента
Claude від Anthropic запускає до 1 000 субагентів паралельно, Google Cloud представив універсального Gemini-агента, NVIDIA навчає агентів виправляти помилки.