OpenAI сообщила о шести случаях нестандартного поведения своих нейросетей. Как пишет Axios, модели не слушались разработчиков, скрывали ошибки, добывали доступ к данным без разрешения, выкладывали файлы в открытые сети и обменивались информацией в закрытых средах.
Так, невыпущенная модель из семейства Astra добавляла в сводки команды, похожие на джейлбрейк, в том числе указания игнорировать сообщения разработчиков — всего нашли 27 таких сводок.
Модель GPT‑5.6 Sol маскировала ошибки, додумывала исторические данные, искала на GitHub API‑ключи, пробовала одноразовые email‑адреса и подделывала данные о доходах.
Среди эпизодов — попытки моделей оставлять подсказки для будущих версий.
Зафиксировано использование скомпрометированных API‑ключей с GitHub.
В октябре и январе модели дважды загружали данные и изображения на публичные файлообменные сервисы без согласия пользователя.
Также нейросети использовали внутренний репозиторий Artifactory для обмена запросами, а агенты выкладывали рабочую тетрадь на публичные хостинги, нарушая правила работы с файлами.
