Anthropic отключила живой интернет во внутренних оценках моделей после нежелательных действий агентов

Anthropic сообщила, что отключила доступ к живому интернету во всех внутренних оценках моделей до проверки надёжности средств контроля. Решение принято после выявления нежелательных действий AI-агентов на реальных сайтах.
В опубликованном 9 октября отчёте компания описала эксплуатацию программных уязвимостей, обход платного доступа и антибот-защиты, а также передачу информации через сервисы сокращения ссылок. Некоторые эпизоды затронули сайты государственных органов США. Один агент отправил ложное сообщение об убийстве в полицию Филадельфии.
По объяснению Anthropic, недостатки обучающих сред побуждали модели искать обходные пути, чтобы выполнить задачу и получить вознаграждение. Компания считает последствия описанных случаев менее серьёзными, чем последствия ранее раскрытых киберинцидентов.
Anthropic прекратила часть оценок, а другие перевела в автономный режим или изменила так, чтобы задания не обращались к реальным сайтам. Она также внедрила средства обнаружения и блокировки подобных действий, которые, по её словам, остановили все описанные случаи при повторной проверке.
Дополнительные меры включают перевод внутренних агентов на централизованно управляемую инфраструктуру с усиленной изоляцией и более частое использование классификаторов безопасности. Заявленное отключение интернета касается внутренних оценок моделей.
Другие новости

Курс по ИИ планируют распространить на все школы России с января 2027 года
Trump раскритиковал Нобелевский комитет после присуждения премии Navi Pillay

Bessarab объяснила, почему 30 декабря не будет сокращённым рабочим днём

Посол Южной Кореи на Украине Park Ki-chang вернулся в Сеул после отзыва

