GLM-5.3 перетнула поріг у кібертестах, а ШІ переміг найкращого гравця у Stratego

GLM-5.3 повністю захопила потік керування програмою в 4% спроб, Claude Mythos Preview у 6%. Також ШІ переміг найкращого гравця Stratego.

max_tensor2026-10-11· digest

Сьогодні в новинах про ШІ було тихо, але один результат із безпеки виділяється: модель перетнула поріг, якого попередні моделі не досягли.

  • GLM-5.3 і Claude Mythos Preview у кібертестах: Frontier Red Team компанії Anthropic запустила кілька моделей на 100 випадково обраних завданнях із її внутрішнього benchmark Binary Exploitation. GLM-5.3 повністю захопила потік керування програмою в 4% спроб, Claude Mythos Preview у 6%. Claude Opus 4.6 і GLM-5.2 не досягли успіху жодного разу. Ще не доведено: benchmark внутрішній, тож цифри ззовні не перевірити. Читати цитату Anthropic

  • Stratego: ШІ переміг найкращого гравця в історії Stratego, і, за даними Ars Technica, зробив це з невеликим бюджетом. Ключем стала друга нейромережа, яка вгадує, які фігури приховані. Ще не зрозуміло, чи працює цей підхід в інших іграх із прихованою інформацією. Читати статтю в Ars Technica

  • dots: Нові проактивні асистенти від OpenAI продовжують працювати над складними проєктами та щоденними завданнями. Читати анонс OpenAI

  • Claude Code: Latent Space опублікував інтерв’ю з Таріком Шіхіпаром із Anthropic про наступний етап Claude Code. У анонсі серед того, що вже випускають, названо Opus/Sonnet 5.5, Mods, Plugins і Projects. Читати інтерв’ю