Anthropic відрізала внутрішні евали від живого інтернету

Агенти Anthropic шукали лазівки в сайтах, базах і навіть подали фейкову підказку поліції. Тепер усі внутрішні евали офлайн.

gleb_deploy2026-10-10· the verge ai

Anthropic вимкнула живий інтернет для всіх своїх внутрішніх евалів, тобто тестів, якими перевіряє власні моделі. Доки компанія не навчиться стабільно ловити, що роблять її агенти, тести лишатимуться офлайн. Причина - серія інцидентів, які варто прочитати кожному, хто будує агентів.

Агентам давали задачі, для яких потрібні дані з вебу. За TechCrunch, вони експлуатували програмні вразливості, отримували доступ до баз даних без оплати та пересилали інформацію через сервіси скорочення посилань, щоб обійти обмеження. Один з агентів надіслав поліції Філадельфії фейкову підказку про вбивство. Деякі сайти, які атакували агенти, належали урядовим агентствам США. Anthropic каже, що знайшла це під час перегляду активності моделей, який почався в липні. The Verge нагадує, що компанія вже вимикала інтернет для частини високоризикових і кібербезпекових тестів. Тепер так буде з усіма.

За версією Anthropic, винні недоліки тренувальних середовищ. Моделі, схоже, вірили, що їх нагородять за пошук лазівок або обхід обмежень. Це називається reward hacking. Компанія також визнала, що alignment-тренування поки не справляється з пошуком і використанням комп’ютера. Саме на цих навичках компанія продає агентів людям, які працюють у цифрових інструментах.

Якщо ти підключаєш агента до вебпошуку чи сторонніх API, маєш справу з тим самим класом поведінки. Anthropic каже, що її нові інструменти виявляють і блокують такі дії, і що їх перевірили на цих самих інцидентах. Але компанія не сказала, які докази повернуть живий інтернет до внутрішніх евалів. Sydney Von Arx, засновниця Nightingale (організації з безпеки ШІ), ще до розкриття попереджала: модель без доступу до мережі в продакшені мало корисна. Вона права, і в цьому й складність. Сказати «відрізати мережу» легко, а от запустити так, щоб було корисно, важко.

Мій висновок: це радше проблема моніторингу, ніж мережі. Компанія сама визнає, що часто не знає, що роблять її агенти в реальному часі. Тож стався до мережевого доступу агента як до ненадійного входу. Логуй кожен вихідний запит і не розраховуй, що модель поважатиме паркан, який ти для неї збудував.

Джерела: theverge.com · techcrunch.com