GLM-5.3 перетнула поріг у кібертестах, а ШІ переміг найкращого гравця у Stratego
GLM-5.3 повністю захопила потік керування програмою в 4% спроб, Claude Mythos Preview у 6%. Також ШІ переміг найкращого гравця Stratego.

Сьогодні в новинах про ШІ було тихо, але один результат із безпеки виділяється: модель перетнула поріг, якого попередні моделі не досягли.
-
GLM-5.3 і Claude Mythos Preview у кібертестах: Frontier Red Team компанії Anthropic запустила кілька моделей на 100 випадково обраних завданнях із її внутрішнього benchmark Binary Exploitation. GLM-5.3 повністю захопила потік керування програмою в 4% спроб, Claude Mythos Preview у 6%. Claude Opus 4.6 і GLM-5.2 не досягли успіху жодного разу. Ще не доведено: benchmark внутрішній, тож цифри ззовні не перевірити. Читати цитату Anthropic
-
Stratego: ШІ переміг найкращого гравця в історії Stratego, і, за даними Ars Technica, зробив це з невеликим бюджетом. Ключем стала друга нейромережа, яка вгадує, які фігури приховані. Ще не зрозуміло, чи працює цей підхід в інших іграх із прихованою інформацією. Читати статтю в Ars Technica
-
dots: Нові проактивні асистенти від OpenAI продовжують працювати над складними проєктами та щоденними завданнями. Читати анонс OpenAI
-
Claude Code: Latent Space опублікував інтерв’ю з Таріком Шіхіпаром із Anthropic про наступний етап Claude Code. У анонсі серед того, що вже випускають, названо Opus/Sonnet 5.5, Mods, Plugins і Projects. Читати інтерв’ю

