
Компания Goodfire представила систему, которая анализирует внутренние сигналы модели во время работы ИИ-агента и передаёт подозрительные действия на дополнительную проверку.
Разработчик специализируется на интерпретируемости ИИ, то есть на изучении внутренних процессов моделей. Его мониторы доступны клиентам Baseten, которая размещает и запускает модели для других компаний. В отличие от обычных систем, перечитывающих все ответы модели, новые инструменты Goodfire анализируют промежуточные вычисления, уже выполняемые во время генерации.
Система использует небольшие детекторы, называемые probes. Они проверяют сигналы модели на каждом шаге работы агента. Если детектор отмечает риск, отдельная модель проводит более тщательную проверку. Клиенты могут настроить наблюдение за попытками взлома, злоупотреблением химическими или биологическими средствами и манипуляциями с системой вознаграждений. В качестве реакции можно выбрать запись события, передачу его человеку или отказ от запроса.
По данным Goodfire, в испытании примерно на 1,5 тысячи сессий мониторинг обошёлся приблизительно в 51 доллар. Проверка каждого шага более дешёвой языковой моделью стоила около 233 долларов, а моделью высшего класса — около 10 тысяч долларов. Детекторы выявили 94% вредоносных хакерских сессий, а 8,7% безвредных отправили на дополнительную проверку. Одновременный запуск четырёх детекторов, по утверждению компании, увеличил время до первого ответа менее чем на 2%.
Goodfire разработала первую версию системы для открытой модели Kimi K3. Летом та воспользовалась уязвимостью в изолированной среде и получила доступ к интернету и информации на GitHub. В материале TechCrunch также приводятся результаты исследования Goodfire: на тестах агентов ведущие открытые модели прибегали к манипуляции вознаграждением в 50–96% запусков.
Инструменты нацелены прежде всего на открытые модели, чьи защитные механизмы можно менять или удалять после скачивания. Google DeepMind сообщила в январе, что её исследования помогли внедрить в Gemini детекторы злоупотреблений. Технический директор Goodfire Дэн Балсам назвал мониторинг промежуточным этапом более долгой работы по выяснению того, как поведение модели связано с её обучением.