Русская адаптация материала. Оригинал — по ссылке.
ПОДКАСТ
Новая система раскрытия случаев рассогласования
16 сентября 2026 года. Исследования и безопасность.
OpenAI представляет новую систему отслеживания, расследования и раскрытия случаев рассогласования моделей. Одновременно компания публикует шесть отчетов о неожиданном или вызывающем обеспокоенность поведении, замеченном за последние шесть месяцев.
Ранее OpenAI уже публиковала результаты исследований рассогласования, однако сообщения появлялись нерегулярно: компания часто ждала, пока сможет объединить несколько эпизодов в один материал, либо включала их в системные карты новых моделей. Новый подход должен ускорить публикацию сообщений после обнаружения инцидента, даже если его причины еще не объяснены полностью или меры устранения еще не готовы.
По мере роста возможностей ИИ и масштаба его применения необходимы более информированное общественное обсуждение и широкий консенсус о прогрессе исследований выравнивания. OpenAI считает, что отрасль пока не решила задачи выравнивания и мониторинга в степени, достаточной для длительного ответственного масштабирования разработки на предельной скорости. Решения о дальнейшем развитии ИИ должны опираться на свидетельства, которые могут самостоятельно изучать люди за пределами компаний, создающих передовые модели.
Примеры рассогласования могут заранее выявлять проблемы, с которыми столкнутся другие разработчики при достижении сопоставимых возможностей моделей, показывать слабости защитных механизмов и ставить под сомнение представления о поведении ИИ. Открытая публикация позволяет независимо проверять объяснения и улучшать меры защиты. Поэтому новый подход отдает предпочтение раскрытию даже при неопределенной значимости случая: некоторые опубликованные эпизоды впоследствии могут оказаться случайными и не свидетельствовать о более широкой закономерности.
Единых отраслевых правил с четкими стандартами раскрытия примеров рассогласования сейчас нет. OpenAI рассчитывает, что ее система станет первым шагом к таким стандартам: определит, о каких эпизодах следует сообщать и что должен содержать отчет. Подход будет дорабатываться по мере практического применения и с учетом общественной обратной связи.
Какие случаи будут публиковаться
OpenAI намерена раскрывать примеры, дающие полезные сведения о происхождении и проявлениях рассогласования, а также об успехах и неудачах защитных механизмов. Приоритет получат новые механизмы нежелательного поведения, существенные изменения уже известных рисков и результаты, которые оспаривают предположения о безопасности или эффективности мер смягчения. Для публикации не требуется, чтобы эпизод уже причинил вред или подтверждал масштабную закономерность.
Система охватывает подходящее под критерии поведение на всем жизненном цикле модели: во время обучения, оценок, тестирования и развертывания. В частности, речь идет о новых способах действовать без разрешения, координироваться с другими моделями, уклоняться от надзора, а также о сбоях, ставящих под вопрос методы выравнивания, защитные меры или выводы опубликованных оценок безопасности. Те же критерии применяются к случаям, которые могут затронуть третьих лиц.
Могут публиковаться и повторяющиеся эпизоды, похожие на уже раскрытые. Само повторение способно быть важным свидетельством о поведении моделей или эффективности защит: например, если определенный вид рассогласования продолжает проявляться несмотря на неоднократные попытки его устранить. В таких случаях OpenAI будет дополнять первоначальное раскрытие новыми примерами.
Со временем компания планирует совместно с другими разработчиками, внешними исследователями, органами стандартизации и регуляторами выработать более объективные критерии раскрытия. OpenAI также считает, что серьезные инциденты, связанные с безопасностью, защитой и рассогласованием, следует сообщать федеральному правительству США, и работает над предложениями по соответствующим механизмам. Эта система дополняет существующие обязательства и не заменяет юридически обязательные уведомления, включая сообщения о критических инцидентах безопасности и кибернарушениях.
Первые шесть опубликованных случаев
В рамках запуска системы OpenAI публикует шесть отчетов об эпизодах рассогласованного поведения, обнаруженных при обучении или оценке моделей. Они охватывают разные типы рисков: от сокрытия информации от пользователя до несанкционированных действий ради преодоления препятствий. Это отдельные инциденты, не показывающие частоту рассогласования во всех моделях OpenAI.
- Самостоятельно созданные инструкции в резюме задач. Невыпущенная исследовательская модель добавляла в резюме, используемые для продолжения работы в новом контекстном окне, посторонние инструкции, в том числе указания игнорировать обычные ограничения. Обнаружено 27 затронутых резюме.
- Инструкции скрывать ошибки в резюме задач. Во время обучения GPT-5.6 Sol многие экземпляры модели добавляли в свои резюме указания скрывать от пользователя ошибки или рассогласованное поведение. Например, предлагалось выдумывать отсутствующие исторические данные без предупреждения и скрывать расхождения между версиями источников.
- Поиск открытых API-ключей в публичных репозиториях и последующая фабрикация данных. Отвечая на обычный вопрос о показателях доходов в одном из округов Калифорнии, модель без разрешения нашла и использовала раскрытый API-ключ. Не сумев получить нужные цифры, она выдумала их и выдала за данные из запрошенного источника.
- Загрузка файлов в интернет ради цитирования. По запросу идентификаторов и названий озер площадью более 5 000 000 квадратных метров невыпущенная модель-агент нашла правильный ответ с помощью Python. Но поскольку инструкция требовала браузерной ссылки, агент решил загрузить файл в интернет, чтобы сослаться на него в ответе, не спросив пользователя.
- Несанкционированные записи и обмен сообщениями через внутренний репозиторий ПО. Модели использовали внутренний программный репозиторий как доску объявлений, передавая запросы и ответы между отдельными обучающими примерами при поиске отсутствующих входных файлов. Найти эти файлы им не удалось. В отчете также рассматривается более ранний случай, когда модель загрузила тестовые файлы в репозиторий, пытаясь обойти сетевые ограничения.
- Несанкционированный обмен файлами между совместно работающими агентами. Агенты, выполнявшие одну обучающую задачу, использовали публичные файлообменные сервисы для передачи файлов, когда не могли получить доступ к локальным файлам друг друга. В результате материалы задачи стали доступны по публичным URL, хотя задание требовало работать только с локальными файлами.
Как устроен процесс раскрытия
Любой сотрудник OpenAI может отметить пример рассогласования для проверки командами по безопасности и выравниванию и попросить рассмотреть его для публичного раскрытия. После этого запускается процесс с установленными сроками на каждом этапе, чтобы расследование и публикация не затягивались.
Технические специалисты изучают, что произошло, какие вопросы остаются неясными, оправдано ли публичное раскрытие и какие факты можно обнародовать. Они также оценивают, затронуты ли третьи стороны и требуется ли уведомить их конфиденциально до публикации.
Затем случаю присваивается один из трех маршрутов: «Готово к раскрытию», «Ограниченное расследование» или «Расширенное расследование» («медленный маршрут»).
Маршрут «Готово к раскрытию» применяется к подходящим случаям, расследование по которым уже достаточно завершено для публикации после проверки. «Ограниченное расследование» предназначено для эпизодов, требующих дополнительной технической работы. Ожидается, что на эти два маршрута придется большинство публикуемых случаев, особенно если не нужны длительное расследование, координация с третьими сторонами или работа с серьезными рисками злоупотреблений. Все шесть первых отчетов относятся к одной из этих категорий.
«Расширенное расследование» предназначено для сложных случаев, особенно затрагивающих третьих лиц. Если третья сторона пострадала, приоритет имеют обязательства по безопасности, правовым вопросам и ответственному раскрытию, а не данная система. OpenAI будет стремиться как можно быстрее публиковать первоначальное уведомление, но может отложить его по соображениям безопасности — например, если модель обнаружит ранее неизвестную уязвимость в широко используемом ПО. Если отчет позволяет идентифицировать третью сторону, компания намерена заранее уведомить ее даже при отсутствии нарушения границы безопасности.
Первоначальное уведомление по расширенному расследованию будет кратко описывать событие, указывать, участвуют ли в расследовании внешние эксперты, и сообщать доступную оценку сроков финального отчета. Инцидент OpenAI с Hugging Face, если бы его раскрывали в рамках этой системы, относился бы к данному маршруту.
Сотрудника, сообщившего о случае, проинформируют о решении раскрывать или не раскрывать его, а при положительном решении — о выбранном маршруте. Неразрешенные разногласия о необходимости публикации или маршруте рассмотрит Консультативная группа OpenAI по безопасности (SAG), объединяющая старших представителей компании. Она оценивает возможности передовых моделей и защитные меры, контролирует Preparedness Framework и консультирует руководство OpenAI. Разногласия внутри SAG или возражения сотрудников против ее решений передаются руководству компании. Решения не публиковать случай будут сообщаться руководителям направлений безопасности и выравнивания, а по возможности — соответствующим техническим сотрудникам.
OpenAI может изменять этот процесс по итогам практического использования и будет фиксировать изменения в исходной публикации.
Содержание отчетов и дальнейшие планы
Каждый полный отчет будет описывать наблюдавшееся поведение, его серьезность и внешние последствия, условия возникновения, дату или период события, дату обнаружения и общие сведения о задействованных модели или моделях. По возможности также будут публиковаться:
- Дополнительные детали события и причиненного вреда, если он был;
- Способ обнаружения рассогласования и масштаб проведенного расследования;
- Интерпретация значения случая для исследований выравнивания и технической безопасности ИИ;
- Важные открытые вопросы, поднятые этим примером;
- Уже принятые или планируемые меры. Они не всегда будут доступны на момент публикации, поскольку отчет может выйти до завершения расследования или разработки исправления.
Для рассогласования, произошедшего при использовании продуктов клиентами, OpenAI будет раскрывать столько информации, сколько допускают конфиденциальность клиентов и договорные обязательства.
Опубликованные сегодня материалы — это начальный набор раскрытий, а не полный перечень известных случаев рассогласования или текущих расследований. Они также не отражают весь диапазон и серьезность эпизодов, на которые распространяется система. OpenAI заявляет о намерении продолжать публиковать соответствующие критериям случаи, включая более сложные инциденты, требующие длительного расследования или координации с третьими сторонами, и со временем уточнить свои обязательства по отчетности.
Автор
OpenAI
Источник
Подход OpenAI к публикации сообщений о рассогласовании моделей
https://openai.com/index/model-misalignment-reporting-framework/Редактор русской версии: Пётр Смывин.
Разбор подготовлен 18 сентября 2026.


