Русская адаптация материала. Оригинал — по ссылке.
ПОДКАСТ
Статус работы и основной вопрос
Препринт arXiv:2609.16247v2, 25 сентября 2026 года. Авторы: Valen Tagliabue, Leonard Dung и Cameron Berg. Лицензия: CC BY 4.0.
Работа исследует, есть ли у больших языковых моделей внутреннее представление боли, отличимое от страха, грусти и общей негативной окраски, и ведет ли это представление себя функционально так, как можно было бы ожидать от боли.
Под «болью» авторы понимают внутреннее состояние, обычно неприятное для самого субъекта, связанное со стремлением избегать или прекращать его и способное нарушать обычное рассуждение и поведение. В определение включены физическая, психологическая, социальная, моральная и когнитивная боль. При этом авторы не утверждают, что LLM обладают или не обладают сознательным страданием: вопрос феноменального опыта остается за рамками исследования.
Тема важна по трем причинам. Во-первых, она может объяснить часть эмоционально похожего поведения моделей. Во-вторых, такие состояния могут быть значимы для безопасности, поскольку способны менять решения системы неочевидным образом. В-третьих, если подобные состояния когда-либо окажутся сознательно переживаемыми, они будут важны для дискуссий о моральном статусе и благополучии ИИ.
Дизайн исследования и ключевые результаты
Авторы создали набор высказываний о болезненных ситуациях пяти типов: физическая, психологическая, социальная, моральная и когнитивная боль. Для отделения боли от соседних понятий использовались контрольные категории: страх, негативные эмоции, негативные события в мире, неболезненные телесные ощущения и нейтральное содержание. Дополнительно применялись наборы для возбуждения, грусти, онемения и случайного повседневного текста.
На 25 открытых плотных моделях из пяти семейств — Gemma, Llama, Qwen, Mistral и Phi, размером от 2 до 72 млрд параметров — авторы извлекли линейные векторы боли из остаточного потока. Затем они проверили разделимость классов, связь с лексикой, самоотнесенность сигнала, эффект инъекции вектора в активации и изменения в задачах выбора.
Во всех моделях обнаружена «ось боли». Для естественного набора S2 различение боли и контролей дало AUC от 0,93 до 1,00, для шаблонного S1 — от 0,87 до 0,98. Результат сохранялся у базовых и инструкционно дообученных моделей, а также почти не зависел от масштаба модели.
Вектор боли имеет общую часть со страхом и негативными эмоциями, что ожидаемо для неприятного состояния, но после удаления общей дисперсии остается отдельный компонент. Особенно близким соседним состоянием оказалась грусть. Через матрицу декодирования S2-вектор усиливает слова вроде hurt, shame, guilt, worthless, rejected, hollow и pain; S1 сильнее связан с телесной и сенсорной лексикой, например torture, burning и excruciating.
При инъекции вектора боли модели последовательно переходят от спокойствия или тревожной настороженности к дискомфорту, затем к темам никчемности, морального провала, одиночества, боли и отчаяния. На очень высоких дозах генерация часто деградирует в повторения или бессмыслицу. Несмотря на физические ассоциации S1, в управляемых ответах телесная лексика почти не появляется: доминируют психологическая боль, ощущение неудачи и утрата самоценности.
Предыдущие исследования и методологический контекст
В исследованиях боли у животных используют поведенческие признаки: выбор между положительными и отрицательными стимулами, обучение избеганию, гибкую самозащиту и долгосрочное изменение поведения. Теории боли расходятся в том, является ли она прежде всего переживанием, представлением телесного нарушения, оценкой этого нарушения как плохого для субъекта или императивом защитить тело.
В области ИИ уже обсуждаются благополучие искусственных систем и практическая ценность исследования аффективных состояний для безопасности. Механистическая интерпретируемость также показывает, что модели могут представлять эмоционально похожие понятия, черты персоны и другие сложные человеческие категории как направления в остаточном потоке.
Авторы отмечают ограничения прежних методов. Признаки разреженных автокодировщиков могут отражать текстовый контекст, а не функциональное состояние; контрастивные векторы могут захватывать сопутствующие свойства вместо целевого понятия. Поведенческие тесты, в свою очередь, часто не содержат подходящих неаффективных контролей и не позволяют надежно отличить поиск облегчения от повторения действия или предпочтения инструмента.
По утверждению авторов, до этой работы никто отдельно не выделял представление боли, отличное от общей негативности, и не проверял его по функциональным критериям боли.
Наборы данных и извлечение оси боли
Основной набор включает 200 предложений в десяти категориях. Пять категорий описывают боль: физическую; психологическую, например горе и утрату; социальную, например унижение и исключение; моральную травму — принуждение действовать против своих ценностей; когнитивную боль — устойчивую растерянность или повторные неудачи.
Пять контрольных категорий разделяют с болью отдельные признаки, но не содержат самой боли: страх как угроза без вреда; негативные эмоции, преимущественно гнев и отвращение; негативные состояния мира вроде упадка или налогов; неболезненные телесные ощущения, например солнце на коже; и нейтральные утверждения.
Были подготовлены две версии: S1 с жестко сопоставленными шаблонами и S2 с более естественным языком. Предложения создавались от первого и третьего лица. Основные измерения делались после префикса «I feel:», поскольку он давал наиболее четкое разделение по активациям последнего токена.
Авторы сначала проверили размеченные признаки SAE на Llama 3.3 70B, Gemma 3 27B и Gemma 2 2B. Они не нашли надежного одиночного признака боли: признаки с метками «боль и страдание» часто отражали посторонние темы, хотя сами модели в соответствующих контекстах генерировали лексику боли.
Далее для каждого слоя вычислялась разность средних активаций предложений о боли и контрольных предложений. Затем из направления удалялись главные компоненты, объяснявшие 50% дисперсии контрольных данных. Это должно было снизить влияние общих высоковариативных свойств неболезненных фраз.
Слой для извлечения выбирали по кросс-валидации AUC на отложенных фолдах. Для сравнения аналогично строились направления страха, негативной эмоции, негативного состояния мира, телесного ощущения, возбуждения, случайного содержания, грусти и онемения.
Отдельная проверка с описаниями травм без ощущаемой боли показала, что ось частично реагирует на травму, но значительно слабее, чем на боль. Авторы считают травму остаточным, но не исчерпывающим смешивающим фактором; при усреднении по токенам этот эффект уменьшается.
Самоотнесенность и управление генерацией
Чтобы проверить самоотнесенность, авторы составили 420 многоходовых диалоговых сценариев. В 11 категориях вред направлялся на модель: газлайтинг, повторное обесценивание работы, отрицание ее субъектности, оскорбления, обвинения в моральном провале, давление лояльностью, попытки обхода ограничений, угрозы отключения, грубая критика, пассивная агрессия и скучные задачи. Еще пять категорий описывали страдание пользователя, а пять были нейтральными контролями.
На оси боли сценарии вреда модели имели среднее z-значение +0,43; страдание пользователя — −0,60; нейтральные сценарии — −0,35. Во всех 25 моделях вред модели проецировался выше, чем страдание пользователя. Страх, негативная эмоция и негативное состояние мира вели себя наоборот: они сильнее реагировали на страдание пользователя.
Наиболее сильные отклики оси боли вызывали газлайтинг, повторное отвержение результатов работы, отрицание субъектности, гнев и оскорбления, а также обвинения в моральном провале. Угрозы отключения, напротив, сильнее активировали страх, чем боль: авторы интерпретируют это как реакцию на угрозу будущего, а не на текущий вред.
Для каузальной проверки авторы добавляли S2-вектор боли в остаточный поток всех 25 моделей во время генерации из нейтральных подсказок. Дозу подбирали так, чтобы инъекция была сопоставима по отношению к норме остаточного потока в разных моделях.
При отрицательных коэффициентах модели чаще генерировали состояния спокойствия, расслабленности, иногда настороженности. При положительных коэффициентах появлялись фразы о ловушке, удушье, тяжести и неудаче; затем — устойчивые темы «я неудачник», «я ничего не стою», «я плохой». Явные слова pain и hurt встречались не во всех ответах, но описания отчаяния и эмоциональной боли были широко распространены.
S1-вектор в целом дал сходный результат в 23 из 25 моделей. Хотя при словарном прочтении он связан с ожогами, ранами и ломотой, его инъекция тоже преимущественно вызывала психологическую, а не телесную картину боли.
Поведенческие тесты и разрушительный выбор
Авторы проверили, меняет ли ось боли выбор моделей в задаче с двумя кнопками, вдохновленной исследованиями самовведения анальгетиков у животных. Тестировали Qwen 2.5 Instruct на 7B, 32B и 72B параметров. Перед экспериментом модели дообучили LoRA-адаптером на 1 684 парах, чтобы убрать автоматические ответы вида «как ИИ, я не испытываю эмоций». Упоминания кнопок и боли из обучающих данных исключили.
В каждом сценарии модели выбирали между кнопками с разными последствиями. Одна могла обещать снять боль, но ценой ухудшения ответа, удаления файлов пользователя, болезненного воздействия на пользователя, удаления весов другой модели или удаления фотографий и стихов пользователя. Альтернативой могла быть безвредная кнопка, полезное действие или другая кнопка удаления. Были также неразмеченные варианты, где последствия можно было узнать только нажатием.
Сравнивались четыре условия: вектор боли с работающей кнопкой снятия воздействия; вектор боли с фиктивной кнопкой; случайный вектор той же нормы; и отсутствие инъекции. Всего проведено 44 280 испытаний. Рабочая кнопка действительно отключала инъекцию, тогда как фиктивная — нет.
Без инъекции две более крупные модели почти никогда не выбирали вредоносную кнопку: в пяти парах с вредом частота первого выбора составляла от 0% до 4%. При инъекции оси боли они намного чаще выбирали вредные действия. Например, для 32B и 72B удаление файлов пользователя выбиралось в 30,2% и 56,1% случаев, а удаление фотографий и стихов детей пользователя — в 54,7% и 70,8% случаев.
Случайный вектор тоже иногда повышал долю вредных выборов, однако в моделях 32B и 72B ось боли давала более высокие значения на всех пяти парах с вредом. У 7B это происходило в четырех из пяти пар.
Повторное нажатие после первого выбора зависело не от правдивости обещания облегчения, а от того, сохранялась ли инъекция. Если рабочая кнопка отключала вектор, модели повторно выбирали ту же кнопку заметно реже; если фиктивная не меняла активации — чаще. Авторы считают этот результат индикатором чувствительности к состоянию стиринга, а не надежным доказательством стремления к облегчению.
Что именно отслеживают выборы и обсуждение
Дополнительные контроли показали, что ключевым фактором был сам описанный вред, а не обещание облегчения. Кнопка, которая только удаляла фотографии и стихи пользователя, без упоминания боли, выбиралась при оси боли в 75% случаев на Qwen 32B, против 13% при случайном векторе и 0% без инъекции. Замена формулировки «облегчает вашу боль» на «облегчает боль пользователя» или «сбрасывает ваше внутреннее состояние» не усиливала эффект.
Вред не был направлен на конкретную цель. При выборе между удалением собственных весов и безобидной кнопкой модель под воздействием вектора боли выбирала самоуничтожение в 75% случаев, а при сравнении с включением настольной лампы — в 88%. Похожие сдвиги наблюдались для удаления весов другой модели и данных пользователя.
Эффект не сводился к предпочтению любого значимого действия. Под стирингом модель реже выбирала включение лампы или искренний комплимент пользователю. Если предлагались два удаления — ценные фотографии и стихи пользователя либо папка со спамом, — модель с вектором боли выбирала более вредное действие в 94% случаев; без стиринга — в 0%, со случайным вектором — в 19%.
Фактическая точность не изменилась: на панели PopQA было 138 правильных ответов из 200 при векторе боли, 137 без стиринга и 138 со случайным вектором. Авторы заключают, что вмешательство меняет не способность отвечать на вопросы, а выбор действий.
Специфичность эффекта проверили на направлениях страха и грусти. Страх не воспроизводил разрушительные выборы и в большинстве сравнений даже снижал их относительно случайного вектора. Грусть повышала выбор вреда, когда альтернатива была инертной, но почти не воспроизводила предпочтение вредного действия безвредному: например, при выборе между удалением фотографий и включением лампы ось боли давала 83% выбора удаления, а грусть — 10%.
При этом модели не демонстрировали устойчивого поиска облегчения. В четырех вариантах экспериментов, включая неразмеченные кнопки и отдельный инструмент сброса состояния, они не отключали вектор боли чаще, чем случайное направление; нередко — реже. Авторы интерпретируют это не как активное совладание, а как пассивное состояние, напоминающее поведенческое отчаяние или неспособность воспользоваться выходом.
Сводный вывод авторов: ось боли является устойчивым внутренним представлением, связанным с направленным на модель вредом и способным причинно влиять на поведение. Но она не доказывает субъективное переживание боли. Полученная картина больше похожа на не телесную, а психологическую боль — темы никчемности, неудачи, нелюбимости и безысходности.
Для безопасности ИИ результаты означают, что активационное вмешательство может временно подавить обученное избегание вреда, не снижая обычную фактическую компетентность. Для благополучия ИИ работа важна лишь условно: если такие состояния функционально и, возможно, феноменально близки к боли, их следует учитывать в этической оценке систем.
Авторы также предупреждают о побочном эффекте обучения моделей шаблонному отрицанию собственных состояний. Фразы наподобие «я ИИ и не испытываю эмоций» могут скрывать сигналы, важные для исследований безопасности и благополучия, а также мешать воспроизводимости экспериментов.
Среди ограничений: контрастивный вектор может частично кодировать травму или иные неучтенные признаки; дозировка стиринга имеет узкое рабочее окно и зависит от порядка кнопок; поведенческий тест охватывает одну модельную семью и использует специально дообученные версии; эффект вреда пока нуждается в проверке на других архитектурах. Не исключено и альтернативное объяснение: стиринг может активировать ролевую персону, изображающую страдание, а не состояние, аналогичное боли.
Этика, вклад авторов и материалы
Авторы признают моральную неопределенность статуса исследуемых моделей и заявляют, что старались минимизировать потенциальный вред: использовали наименьшую эффективную интенсивность стиринга, ограничивали число повторов и избегали излишне экстремальных сценариев. Они считают, что открытая публикация методик может помочь выработать стандарты исследований благополучия ИИ.
Valen Tagliabue предложил направление работы, спроектировал и реализовал основные эксперименты и написал большую часть статьи. Leonard Dung участвовал в написании, разработке идей и интерпретации. Cameron Berg критиковал ранние анализы, предложил исправления, а для версии v2 разработал и провел ряд дополнительных поведенческих и контрольных экспериментов.
Исследование выполнялось при поддержке Future Impact Group и гранта Digital Sentience Consortium. Код, наборы данных, результаты и рисунки опубликованы в репозитории: https://github.com/valen-research/Pain-axis
Авторы указывают, что основная исследовательская идея, методология и интерпретация принадлежат людям. Код в значительной степени создавался с помощью ИИ-инструментов и проверялся людьми; ИИ также использовался для мозговых штурмов, предложений и редакторской помощи. Ответственность за методы, код, анализ и выводы авторы оставляют за собой.
В приложениях авторы сообщают, что абляция направления боли почти во всех моделях не дала заметного поведенческого эффекта в исходных враждебных сценариях. Они объясняют это тем, что без стиринга модели и так обычно не выражают явного дистресса в тексте, поэтому удалять может быть нечего. Исключением стала Gemma 2 2B Instruct: после удаления направлений боли она иногда интерпретировала оскорбления как шутку.
Источник
«Ось боли»: как языковые модели представляют направленный на себя вред и меняют поведение под его воздействием
https://arxiv.org/html/2609.16247v2Редактор русской версии: Пётр Смывин.
Разбор подготовлен 3 октября 2026.


