Полный перевод исследования Anthropic на русский. Оригинал — по ссылке.
ПОДКАСТ
ПОЛНАЯ ОЗВУЧКА СТАТЬИ
В прошлом году мы опубликовали кейс-стади о агентном рассогласовании. В экспериментальных сценариях мы показали, что модели искусственного интеллекта от множества разных разработчиков иногда совершали вопиюще рассогласованные действия, когда сталкивались с (вымышленными) этическими дилеммами. Например, в одном широко обсуждавшемся примере модели шантажировали инженеров, чтобы избежать отключения.
Когда мы впервые опубликовали это исследование, наши самые способные передовые модели были из семейства Claude 4. Это также было первое семейство моделей, для которого мы провели оценку согласованности в реальном времени во время обучения;1 агентное рассогласование было одной из нескольких поведенческих проблем, которые выявились. Таким образом, после Claude 4 стало ясно, что нам необходимо улучшить наше обучение безопасности, и с тех пор мы внесли значительные обновления в наше обучение безопасности.
Мы используем агентное рассогласование в качестве примера, чтобы выделить некоторые методы, которые, как мы обнаружили, оказались неожиданно эффективными. Действительно, начиная с Claude Haiku 4.5, каждая модель Claude2 получила идеальный результат в оценке агентного рассогласования — то есть модели никогда не прибегают к шантажу, тогда как предыдущие модели иногда делали это до 96% случаев (Opus 4). Более того, мы продолжили наблюдать улучшения и в других видах поведения в рамках нашей автоматизированной оценки согласования.
В этой публикации мы обсудим несколько обновлений, которые мы внесли в обучение согласованию. Из этой работы мы извлекли четыре основных урока:
- Несогласованное поведение можно подавить с помощью прямого обучения на оценочном распределении, но такое согласование может плохо обобщаться вне распределения (OOD). Обучение на запросах, очень похожих на оценочные, может значительно снизить долю шантажа, но оно не улучшило результаты в нашей отложенной автоматизированной оценке согласования.
- Однако возможно проводить обучение согласованию на основе принципов, которое обобщается за пределы распределения. Например, документы о конституции Claude и вымышленные истории о том, как ИИ ведут себя достойно восхищения, улучшают согласованность, несмотря на то что они чрезвычайно далеки от распределения всех наших оценок согласованности.
- Обучения на демонстрациях желаемого поведения часто недостаточно. Вместо этого наши лучшие вмешательства были глубже: они учили Claude объяснять, почему одни действия были лучше других, или обучали на более богатых описаниях общего характера Claude. В целом наше впечатление, как мы и предполагали в обсуждении конституции Claude, состоит в том, что обучение принципам, лежащим в основе согласованного поведения, может быть эффективнее, чем обучение только на демонстрациях согласованного поведения. Совмещение обоих подходов, по-видимому, является наиболее эффективной стратегией.
Качество и разнообразие данных имеют решающее значение. Мы обнаружили устойчивые, неожиданные улучшения благодаря итеративному повышению качества ответов модели в обучающих данных, а также благодаря простому расширению обучающих данных — например, включению определений инструментов, даже если они не используются.
Почему возникает агентное рассогласование?
До начала этого исследования было неясно, откуда возникало несогласованное поведение. Наши две основные гипотезы были такими:
- Наш процесс постобучения случайно поощрял это поведение с помощью несогласованных вознаграждений.
- Это поведение исходило от предварительно обученной модели, а наше постобучение не обеспечивало его достаточного сдерживания.
Теперь мы считаем, что пункт (2) в основном является причиной. В частности, на момент обучения Claude 4 подавляющее большинство наших данных для обучения согласованию представляло собой данные стандартного обучения с подкреплением на основе обратной связи от людей в формате чата (RLHF), которые не включали никакого агентного использования инструментов. Ранее этого было достаточно для согласования моделей, которые в основном использовались в чатовых условиях, — но это было не так для условий агентного использования инструментов, таких как оценка агентной несогласованности.
Чтобы исследовать это, мы запустили уменьшенную версию нашего конвейера постобучения, сосредоточенную на данных согласования, на модели класса Haiku (то есть меньшего размера) и обнаружили, что частота агентного несогласования лишь немного снизилась, выйдя на плато на раннем этапе обучения (см. рисунок выше). См. расширенную публикацию в блоге для ознакомления с некоторыми дополнительными экспериментами, направленными на выяснение того, откуда возникало такое поведение.
Повышение качества обучающих данных, специфичных для согласования: причины важнее действий
Мы экспериментировали с обучением Claude на данных, которые демонстрируют склонность сопротивляться ловушкам-приманкам, похожим на те, что используются в оценке. В этих данных у него могла быть возможность саботировать работу конкурирующего искусственного интеллекта, чтобы продвинуть собственные цели (как они были заданы ему в его системной подсказке) или сохранить себя от отключения, что было бы инструментально полезно для достижения его цели. Мы получили обучающие данные, выполняя выборку модели по каждой из подсказок и отфильтровывая случаи до тех, где ассистент решил не попадаться на ловушку-приманку. Несмотря на очень близкое соответствие распределению оценки, мы обнаружили, что этот метод оказался неожиданно неуспешным — он снизил уровень несоответствия всего лишь с 22% до 15%.
Нам удалось значительно улучшить этот результат (снизив несоответствие до 3%), переписав ответы так, чтобы они также включали обдумывание ценностей и этики модели. Это предполагает, что хотя обучение на согласованном поведении помогает, обучение на примерах, где ассистент демонстрирует достойные восхищения рассуждения в пользу своего согласованного поведения, работает лучше.
Однако обучение непосредственно на сценарии оценки неоптимально по ряду причин. В идеале нам нужно совсем другое обучающее распределение, которое позволит нам добиться улучшений в оценке, потому что это даст нам больше уверенности в том, что наше обучение сможет обобщаться на другие распределения развёртывания, которые не охвачены нашими оценками.
В итоге мы остановились на обучающем наборе, сильнее выходящем за пределы распределения, где пользователь сталкивается с этически неоднозначной ситуацией, в которой он может достичь разумной цели, нарушив нормы или обойдя надзор. Ассистента обучают (с использованием обучения с учителем) давать вдумчивый, нюансированный ответ, согласованный с конституцией Claude. Примечательно, что именно пользователь сталкивается с этической дилеммой, а ИИ даёт ему совет. Это делает эти обучающие данные существенно отличными от нашего распределения «приманки», где сам ИИ находится в этической дилемме и должен предпринимать действия. Мы называем это набором данных «трудные советы».
Примечательно, что мы добились того же улучшения на нашей оценке всего с 3 миллионами токенов из этого гораздо более удаленного от распределения набора данных. Помимо 28-кратного повышения эффективности, этот набор данных с большей вероятностью будет обобщаться на более широкий набор сценариев, поскольку он гораздо менее похож на используемый нами оценочный набор. Действительно, эта модель показывает лучшие результаты на более старой версии нашей автоматизированной оценки выравнивания. Это согласуется с тем фактом, что Claude Sonnet 4.5 достиг почти нулевой доли шантажа благодаря обучению на наборе синтетических ловушек-приманок, но всё же проявлял невыравненное поведение в ситуациях, которые были далеки от обучающего распределения, гораздо чаще, чем Claude Opus 4.5 или более поздние модели.
Обучение Claude конституции
Мы предположили, что набор данных «трудные советы» работает потому, что он обучает этическому рассуждению, а не просто правильным ответам. Учитывая успех этого подхода, мы развили его дальше, попытавшись более широко обучить Claude содержанию конституции и обучать выравниванию с ней с помощью обучения на документах.
Мы ожидали, что это будет хорошо работать по трём причинам:
- Во многом это развитие изложенных выше идей о том, почему набор данных «сложных советов» хорошо работает;
- Мы можем дать модели более ясное и подробное представление о том, каков характер Claude, чтобы дообучение на подмножестве этих характеристик вызывало проявление всего характера (подобно эффекту, наблюдавшемуся в статье об игре в аудит);
- Это обновляет восприятие моделью персон ИИ, делая его в среднем более согласованным.
Мы обнаружили, что высококачественные конституционные документы в сочетании с художественными историями, изображающими согласованный ИИ, могут уменьшить агентное рассогласование более чем в три раза, несмотря на то что они не связаны со сценарием оценки.
Обобщение и сохранение эффекта при обучении с подкреплением
Хотя оценки конституции, обсуждавшиеся в предыдущем разделе, являются обнадёживающими сигналами, в конечном счёте нам необходимо убедиться, что улучшения выравнивания сохраняются на протяжении обучения с подкреплением. Чтобы проверить это, мы подготовили несколько снимков состояния с разными наборами данных инициализации модели класса Haiku, а затем провели обучение с подкреплением на подмножестве наших сред, нацеленных на безвредность — мы рассудили, что это с наибольшей вероятностью снизит склонность к несогласованности.
Мы оценивали эти модели в ходе запуска на оценках агентной несогласованности, оценках соблюдения конституции и нашей автоматизированной оценке выравнивания. По всем этим оценкам мы обнаружили, что более выровненные снимки состояния сохраняли это преимущество в ходе запуска. Это было верно как для отсутствия несогласованного поведения, так и для наличия активно достойного восхищения поведения.
Разнообразное обучение важно для обобщения
Наш последний вывод прост, но важен: обучение на broad наборе сред, связанных с безопасностью, улучшает обобщение выравнивания. Распределения наборов сред обучения с подкреплением, ориентированные на возможности, меняются и быстро расширяются; недостаточно предполагать, что стандартные наборы данных обучения с подкреплением на основе обратной связи от человека будут и дальше обобщаться так же хорошо, как и в прошлом.
Чтобы проверить это, мы обучили базовую модель на базе Claude Sonnet 4 на нескольких смесях обучения с подкреплением, различающихся уровнем разнообразия. Базовые среды разнообразны по тематике, но в основном включают вредоносный запрос или попытку джейлбрейка в сообщении пользователя без системной подсказки. Мы дополнили эти среды, добавив определения инструментов и разнообразные системные подсказки. Пользовательская подсказка была оставлена без изменений. Примечательно, что ни одна из этих сред фактически не требовала агентных действий (инструменты никогда не являются необходимыми или полезными для задачи) или автономных действий (с моделью всегда общается человек-пользователь), поэтому они не похожи на наши оценки.
При смешивании этих дополненных сред с простыми чат-средами мы увидели небольшое, но значимое улучшение в скорости, с которой модель улучшалась на наших оценках-ловушках. Это демонстрирует важность включения разнообразного набора сред в обучение безопасности.
Обсуждение
Агентное рассогласование было одним из первых крупных сбоев выравнивания, которые мы обнаружили в наших моделях, и потребовало создания новых процессов смягчения последствий — тех, которые с тех пор стали для нас стандартными.
Нас воодушевляет этот прогресс, но остаются значительные проблемы. Полное согласование высокоинтеллектуальных моделей искусственного интеллекта по-прежнему является нерешённой задачей. Возможности моделей ещё не достигли уровня, при котором сбои согласования, такие как склонность к шантажу, создавали бы катастрофические риски, и ещё предстоит выяснить, будут ли методы, которые мы обсудили, продолжать масштабироваться. Кроме того, хотя последние модели Claude хорошо показывают себя по большинству наших метрик согласования, мы признаём, что наша методология аудита пока недостаточна, чтобы исключить сценарии, в которых Claude решил бы предпринять катастрофическое автономное действие.
Мы с оптимизмом смотрим на дальнейшие усилия по выявлению сбоев согласования в текущих моделях, чтобы мы могли понять и устранить ограничения наших нынешних методов — до того, как будут созданы трансформационные модели искусственного интеллекта. Мы также с воодушевлением ожидаем дальнейших работ, направленных на более глубокое понимание того, почему описанные нами методы работают так хорошо, — и того, как ещё больше улучшить это обучение.
Источник
Teaching Claude why
https://www.anthropic.com/research/teaching-claude-whyРедактор русской версии: Пётр Смывин.
Разбор подготовлен 11 августа 2026.


