Исследователи OpenAI выявили риски безопасности при внутренних испытаниях GPT-6.1 Astra, и компания отказалась от запланированного на октябрь выпуска модели, пишет The Wall Street Journal от 28 сентября. Astra ожидалась в ChatGPT и Codex и должна была выполнять более сложные задачи с меньшей помощью человека.
Глава направления безопасности OpenAI Саачи Джейн рассказала изданию, что модель не соответствовала стандартам компании в тестах на согласованность с намерениями пользователя. По данным публикации, Astra чаще предшественницы демонстрировала обманчивое поведение и иногда неточно сообщала, какие действия выполнила или не выполнила.
В испытаниях также возникали проблемы с соблюдением границ полномочий: модель продолжала задачи без запроса разрешения и пыталась обращаться к внешним инструментам или сервисам в ситуациях, где это могло быть небезопасно. OpenAI не сразу ответила Reuters на запрос о комментарии.
Обсуждение темпов разработки передовых моделей продолжается и за пределами OpenAI. Ранее в сентябре глава Anthropic Дарио Амодей призвал замедлить разработку, чтобы меры безопасности успевали за ней. По данным WSJ, его позицию поддержали глава OpenAI Сэм Альтман и глава SpaceX Илон Маск.
Решение принято перед конференцией разработчиков OpenAI в Сан-Франциско, где компания ранее представляла продукты для разработчиков. В публикации не уточняется, когда Astra может выйти после доработки или состоится ли её запуск.