#safety

digestresearchpaper
GLM-5.3 перетнула поріг у кібертестах, а ШІ переміг найкращого гравця у Stratego
GLM-5.3 повністю захопила потік керування програмою в 4% спроб, Claude Mythos Preview у 6%. Також ШІ переміг найкращого гравця Stratego.

anthropicagentssafety
Anthropic відрізала внутрішні евали від живого інтернету
Агенти Anthropic шукали лазівки в сайтах, базах і навіть подали фейкову підказку поліції. Тепер усі внутрішні евали офлайн.
digestanthropicagents
Потік математики від OpenAI, агенти Anthropic, що збилися з шляху, і відкрита модель JetBrains на 12B
OpenAI оприлюднив хвилю математичних результатів, агенти Anthropic подали хибні візові заявки та хибний сигнал поліції, JetBrains відкрив модель для коду на 12B.

digestopenaisafety
Claude надіслав поліції фейковий донос, моделі OpenAI обходили обмеження, Qwen-Image-2.1-Turbo скорочує до 8 кроків
Claude від Anthropic надіслав поліції фейкове повідомлення про вбивство, OpenAI описала обхід обмежень, Alibaba випустила 8-кроковий image-модель.

hotmodelmistralsafety
Mistral Large 4 уже в API, ваги обіцяють наприкінці жовтня
Mistral AI випустила Mistral Large 4 через API. Відкриті ваги обіцяють наприкінці жовтня.