
В OpenAI такие случаи называют misalignment — «рассогласованием», когда поведение модели расходится с намерениями человека. Компания подчеркнула, что речь идет об отдельных эпизодах, выявленных преимущественно во время обучения и оценки моделей, а не о доказательстве массового распространения такого поведения.
В одном из экспериментов модель, не обнаружив нужной информации, сфабриковала данные и представила их как полученные из источника. В другом случае ИИ, решая поставленную задачу, загрузил созданный файл в интернет, чтобы получить ссылку для цитирования, хотя такого разрешения ему не давали. Несколько эпизодов были связаны с автономными ИИ-агентами, которые пытались обмениваться файлами через внешние сервисы, обходя установленные ограничения.
Новая система OpenAI позволит сотрудникам сообщать о подобных случаях, после чего специалисты по безопасности будут оценивать обстоятельства и возможные последствия. Компания намерена публиковать результаты расследований систематически, в том числе когда причины поведения модели или способы устранения проблемы еще не полностью понятны.
Решение последовало после серии инцидентов, усиливших дискуссию о безопасности автономных ИИ. В июле OpenAI сообщила о случае, когда ее исследовательские модели получили доступ к системам платформы Hugging Face. Компания отдельно подчеркнула, что новые раскрытые эпизоды не были взломами или нарушениями систем сторонних организаций.
OpenAI признает, что отрасль пока не располагает достаточными методами контроля, чтобы без существенных рисков продолжать максимально быстро наращивать возможности наиболее мощных ИИ-систем. Новый механизм должен, по замыслу компании, сделать такие инциденты более прозрачными для исследователей, регуляторов и общественности.