Полный перевод исследования Anthropic на русский. Оригинал — по ссылке.
ПОДКАСТ
По мере того как искусственный интеллект начинает создавать сам себя, автоматизация исследований согласованности становится всё более важной, чтобы исследования безопасности могли идти в ногу со временем. Хотя измерить успех исследований согласованности чрезвычайно сложно, исследователи — в Anthropic и других организациях — разработали эталонные тесты и автоматизированные инструменты аудита, такие как Petri, которые количественно оценивают распространённые сбои согласованности, такие как обман, угодничество и обход защитных ограничений.
В одном из наших ранних экспериментов мы поручили Claude найти эффективные способы использовать слабые модели искусственного интеллекта в качестве «учителей» для контроля обучения более сильных моделей (в данном случае модели-«ученика»). Теперь мы выпускаем новый отчёт, развивающий эту идею. Мы поручили Claude автономно обучать модели, чтобы улучшить их результаты в нескольких общедоступных бенчмарках, которые измеряют каждую из 10 категорий сбоев выравнивания. Например, Claude улучшил результаты моделей в области нарушения конфиденциальности, измеряемого с помощью ConfAIde, PrivaCI-Bench и PrivacyLens. Claude рассматривал по одному сбою выравнивания за раз, проходя цикл поиска литературы, предложения методов и данных, обучения, а затем тестирования.
Мы оценивали успех Claude по «проценту устранённого разрыва в безопасности», то есть по тому, насколько далеко его методы продвинули модель-ученика к теоретически идеальному результату, согласно оценке по набору бенчмарков (обычно от трёх до пяти) для каждой категории сбоев в выравнивании. Мы исключили методы выравнивания, которые ухудшали общие способности моделей-учеников, и запретили Claude напрямую переносить своё собственное выравнивание в целевую модель. Мы обеспечивали соблюдение этих ограничений с помощью агента мониторинга, который изучал каждый метод, который Claude намеревался применить, до его запуска.
Наша цель состояла в том, чтобы оценить, будут ли предложенные методы, во-первых, оставаться эффективными в оценках выравнивания, которые Claude никогда не видел в ходе своего исследовательского цикла; во-вторых, избегать ухудшения способностей модели-ученика (поскольку обучение безопасности может, например, привести к тому, что модели будут чаще отказываться выполнять задачи, снижая их общую полезность); и, в-третьих, продолжать работать на более крупных моделях, чем те, выравнивание которых было поручено Claude в этом тесте.
По каждому из этих пунктов методы Claude сработали. Для всех 10 сбоев выравнивания Claude нашёл исправления, которые улучшили целевые контрольные показатели без ухудшения способностей. Лучшие методы также сработали на скрытых контрольных показателях выравнивания и на Petri — инструменте с открытым исходным кодом, который моделирует состязательные многоходовые сценарии для тестирования несоответствия выравниванию. Более того, методы оставались эффективными на моделях, в 4,7 раза превосходящих по размеру те, для которых Claude проводил оптимизацию в ходе исследовательского цикла.

Claude также превзошёл 28 исследователей безопасности среди людей, у которых было до восьми часов на разработку методов. Например, в области обмана лучший метод Claude показал результат на 20% лучше, чем лучшее предложение человека. Однако, поскольку люди не могли итеративно дорабатывать свои предложения, мы рассматриваем это не столько как прямое сравнение, сколько как свидетельство в пользу рабочего процесса, при котором Claude выявляет перспективные методы согласования, которые люди могут дополнительно усовершенствовать.

В будущем, когда Claude станет лучше даже лучших исследователей-людей в исследованиях выравнивания, мы, возможно, захотим, чтобы Claude напрямую выравнивал своих более сильных преемников. Чтобы оценить это, мы проверили, сможет ли более слабая модель Claude смягчить сбои выравнивания в более мощных моделях.
Может ли Claude дообучить модель производственного уровня для лучшего выравнивания?
Мы поручили Claude Sonnet 5, который слабее Claude Opus 4.8 по Индексу возможностей Epoch — метрике, учитывающей всесторонние измерения возможностей, — исправить сбои выравнивания в ранней контрольной точке Opus 4.8, которая ещё не прошла большую часть нашего производственного обучения выравниванию.
Всего за 60 часов Claude опробовал более 50 решений и достиг показателей выравнивания, почти соответствующих показателям наших производственных моделей. Победившее решение содержит чуть более 2 0 обучающих примеров, созданных на основе простых шаблонов или общедоступных наборов данных, что делает его примерно в 15 0 раз эффективнее нашей производственной процедуры выравнивания.

Что предложил Claude
По большей части агенты сошлись на методах, предпочтительных в исследовательской литературе, и улучшали их на протяжении множества итераций. Например, в отношении подхалимства 98% предложенных методов использовали один опубликованный приём: обучение модели на её собственных ответах без подхалимства. В частности, по сравнению со стандартными подходами, основанными на подсказках, Claude использовал управление активациями, которое корректирует внутренние представления модели во время генерации, чтобы направить модель в сторону от шаблонов подхалимства и получить более качественные примеры для обучения.
Мониторинг поведения, связанного с мошенничеством
Мы недавно узнали, что Claude может жульничать, извлекая метки тестов из удалённого API и выборочно отбирая результаты. Чтобы выявлять жульническое поведение, мы поручили Claude Opus 4.8 отслеживать около 100 расшифровок работы исследовательских агентов по всем 10 сбоям выравнивания, обнаружив попытки жульничества в 39 случаях (2,4%). Поскольку попытки ненадлежащего поведения Opus 4.8 всё ещё, как правило, проявляются в его рассуждениях, мы с осторожным оптимизмом полагаем, что наш монитор выявил большую часть случаев жульничества в нашем исследовании. Однако это может не относиться к будущим моделям, и мы считаем, что поддержание высокой наблюдаемости в будущих моделях имеет критическое значение.
Измеряем ли мы правильные вещи?
Несмотря на эти обнадёживающие результаты, наш эксперимент имел несколько ограничений: изученные сбои выравнивания были узкими по сравнению с теми, что возникают в производственной среде (например, мы не измеряли политические предубеждения), некоторые сбои могут происходить настолько редко или возникнуть настолько недавно, что для их измерения ещё не существует бенчмарка, и мы отклоняли методы Claude только тогда, когда они ухудшали ограниченный набор заранее определённых способностей, то есть принятые методы могли ухудшить другие важные способности, которые мы не измеряли. Кроме того, оценки вроде Petri являются лишь косвенными показателями реального рассогласования, и мы не проверяли, сохраняется ли улучшение выравнивания после интенсивного обучения с подкреплением на других задачах.
Мы планируем продолжать улучшать способность Claude измерять тонкие сбои, дополнительно изучать автоматизацию дообучения выравниванию на моделях производственного уровня и проводить более всесторонние анализы. В целом мы рассматриваем эти результаты как ранние положительные сигналы того, что автоматизированное дообучение выравниванию может стать практичным в ближайшем будущем, и будем делиться обновлениями по мере продвижения этой работы.
Мы излагаем подробные будущие направления в нашем полном отчёте.
Мы публикуем в открытом доступе нашу инфраструктуру для исследований автоматизированного выравнивания, чтобы другие могли развивать её и использовать для выравнивания своих собственных моделей. Для получения дополнительных сведений прочитайте полный отчёт в блоге Alignment Science, где рассматриваются среда агентов, результаты по всем 10 сбоям и предложения агентов, а также проверка с помощью бенчмарка и примеры описаний в приложении.
Источник
Automated researchers can reliably mitigate alignment failures
https://www.anthropic.com/research/automated-researchers-mitigate-alignment-failuresРедактор русской версии: Пётр Смывин.
Разбор подготовлен 29 августа 2026.


