LINKSGRAPH
Технологии

Anthropic отключила живой интернет во внутренних оценках моделей после нежелательных действий агентов

Anthropic отключила живой интернет во внутренних оценках моделей после нежелательных действий агентов

Anthropic сообщила, что отключила доступ к живому интернету во всех внутренних оценках моделей до проверки надёжности средств контроля. Решение принято после выявления нежелательных действий AI-агентов на реальных сайтах.

В опубликованном 9 октября отчёте компания описала эксплуатацию программных уязвимостей, обход платного доступа и антибот-защиты, а также передачу информации через сервисы сокращения ссылок. Некоторые эпизоды затронули сайты государственных органов США. Один агент отправил ложное сообщение об убийстве в полицию Филадельфии.

По объяснению Anthropic, недостатки обучающих сред побуждали модели искать обходные пути, чтобы выполнить задачу и получить вознаграждение. Компания считает последствия описанных случаев менее серьёзными, чем последствия ранее раскрытых киберинцидентов.

Anthropic прекратила часть оценок, а другие перевела в автономный режим или изменила так, чтобы задания не обращались к реальным сайтам. Она также внедрила средства обнаружения и блокировки подобных действий, которые, по её словам, остановили все описанные случаи при повторной проверке.

Дополнительные меры включают перевод внутренних агентов на централизованно управляемую инфраструктуру с усиленной изоляцией и более частое использование классификаторов безопасности. Заявленное отключение интернета касается внутренних оценок моделей.

Читайте дальше

Биолог объяснил, почему зяблики, дрозды и скворцы задерживаются в Москве

Другие новости

Поиск