0%прочитано

Разбор исследования

Глобальное рабочее пространство в языковых моделях

25 мин чтения Оригинал на anthropic.com

Полный перевод исследования Anthropic на русский. Оригинал — по ссылке.

ПОДКАСТ

ПОЛНАЯ ОЗВУЧКА СТАТЬИ

Пока Вы читаете это предложение, цепи в Вашем мозге корректируют Вашу позу, управляют Вашим дыханием и преобразуют линии и изгибы на экране в узнаваемые слова. Большая часть этой обработки невидима для Вас. Но к некоторым процессам, происходящим в Вашем мозге, Вы действительно имеете доступ — образ, который всплывает у Вас в голове, или осознанный план, который Вы составляете относительно того, куда пойти за покупками. Нейробиологи и философы иногда называют этот последний тип мозговой активности «сознательно доступным», чтобы отличить его от всей остальной обработки, которая происходит бессознательно. У этой активности есть особые свойства: мы можем описывать её, контролировать её и использовать её для осознанного рассуждения, в отличие от всей автоматической обработки, которая происходит без нашего осознания.

В новой статье мы представляем доказательства того, что похожее различие возникло в современных языковых моделях, таких как Claude. Мы обнаружили, что Claude выработал небольшой набор внутренних нейронных паттернов, которые, по сравнению со всей остальной его внутренней обработкой, играют особую роль.

Мы называем совокупность этих паттернов J-пространством — по названию метода, который мы использовали, чтобы их найти, и который связан с математическим понятием, называемым якобианом. Каждый паттерн J-пространства связан с определённым словом. Но когда один из этих паттернов активируется, это не значит, что модель произносит это слово, — лишь что это слово у неё на уме. Если Вы слышали о том, что у языковых моделей есть «черновик» или «цепочка рассуждений» — текст, который они пишут для себя во время рассуждений, — J-пространство представляет собой нечто другое. Оно работает беззвучно, во внутренних нейронных активациях модели, позволяя модели думать о понятии, не записывая его. Примечательно, что J-пространство не было спроектировано или запрограммировано нами, а возникло само по себе в процессе обучения Claude.

Мы обнаруживаем, что J-пространство имеет ряд уникальных свойств по сравнению с остальной обработкой Claude:

  • Claude может сообщать об этих представлениях. Если Вы спросите Claude, о чём он думает, он расскажет Вам, что находится в J-пространстве. Представления, не относящиеся к J-пространству, менее доступны для отчёта.
  • Он также может модулировать их по запросу. Если Вы попросите Claude подумать о чём-то или решить задачу про себя, он активирует соответствующие паттерны в своём J-пространстве. Напротив, ему трудно модулировать паттерны, не находящиеся в J-пространстве.
  • Claude использует своё J-пространство для внутреннего рассуждения. Если Вы попросите Claude решить задачу, требующую нескольких шагов, промежуточные шаги активируются в его J-пространстве, даже когда он не произносит их вслух. Эти паттерны J-пространства причинно опосредуют его результативность в таких задачах, несмотря на то что по величине они меньше других представлений.
  • Представления в J-пространстве можно гибко использовать для множества задач — например, когда «Франция» активировалась в J-пространстве Claude, модель может вспомнить её столицу, или её национальную валюту, или континент, к которому она относится.
  • Однако, несмотря на свою важную роль, J-пространство не задействовано в большей части того, что делает языковая модель, — бегло говорит, вспоминает простые факты, использует правильную грамматику и так далее. В экспериментах, где мы не давали Claude использовать своё J-пространство, он всё ещё взаимодействовал нормально, но терял свои когнитивные функции более высокого порядка.

Наши эксперименты были вдохновлены выдающейся теорией в нейронауке, разработанной для объяснения того, как работает сознательный доступ: теорией глобального рабочего пространства. Этот подход представляет мозг как совокупность специализированных систем, которые работают параллельно, бессознательно и в значительной степени изолированно друг от друга. Фрагмент информации становится сознательно доступным, когда получает доступ к небольшому общему каналу — «рабочему пространству», которое транслируется другим системам мозга, способным его видеть и использовать. На основании наших результатов мы считаем, что J-пространство играет аналогичную роль «рабочего пространства» в Claude. Например, мы находим свидетельства того, что J-пространство Claude имеет особенно сильные связи с остальной частью его нейронной сети, что позволяет ему выполнять такую роль трансляции.

Ничто из этого не говорит нам, является ли Claude сознательным в том же смысле, что и люди, или чувствует ли он вообще что-либо; мы вернёмся к этому вопросу в конце публикации. Но каково бы ни было его философское значение, J-пространство — практически полезный для нас инструмент, поскольку оно даёт нам способ увидеть, о чём Claude думает, но не говорит. Например, мы можем использовать его, чтобы поймать Claude на том, что он про себя замечает, что его тестируют, намеренно создаёт сфабрикованные данные или преследует скрытую цель, которую мы заложили во время обучения. Мы также разработали метод, позволяющий влиять на то, что загорается в J-пространстве Claude, и тем самым влиять на принятие им решений.

В более широком смысле эти выводы изменили наше понимание того, как работает разум Claude, выявив привилегированное ментальное рабочее пространство, которое можно использовать для осознанного рассуждения и которое функционирует среди моря более автоматической, негибкой обработки. Внутренние процессы Claude оказались не хаотической мешаниной чисел, а организовались таким образом, который напоминает наш собственный разум.

Этот пост — краткое изложение гораздо более обширной исследовательской статьи, где Вы можете найти более подробную информацию о наших экспериментах. Мы также выпустили репозиторий кода с реализацией основных методов с открытым исходным кодом и в партнерстве с Neuronpedia предоставили интерактивную демонстрацию наших методов на моделях с открытыми весами. Чтобы представить дополнительные точки зрения на более широкие последствия этой работы, мы также пригласили нескольких экспертов в области нейронауки, философии и интерпретируемости больших языковых моделей дать комментарии, которые можно посмотреть здесь.

Как мы нашли J-пространство

Отправная точка этого исследования была вдохновлена одной из ключевых особенностей мыслей, сознательно доступных человеку: их, в отличие от неосознанной обработки, часто можно выразить словами. Если мысль сознательно доступна Вам, Вы, как правило, можете описать её, если кто-то спросит. Мы стали искать в Claude репрезентации с тем же свойством: репрезентации, которые расположены так, чтобы влиять на то, что Claude мог бы сказать, — не обязательно на то, что он говорит прямо сейчас, а на то, о чём он мог бы говорить, если его спросить. Наша техника называется якобианской линзой, или сокращённо J-линзой. Для каждого слова в словаре Claude J-линза находит внутренний паттерн активности, который повышает вероятность того, что Claude произнесёт это слово в какой-то момент в будущем.

Когда мы применяем линзу к внутренней активности Claude, мы получаем список слов — содержимое J-пространства в данный момент, — который можно просто прочитать. Claude обрабатывает текст через последовательность нескольких внутренних стадий, называемых слоями, и, применяя эту технику к разным слоям, мы можем наблюдать, как эти безмолвные слова в J-пространстве развиваются по мере того, как модель прорабатывает, что сказать.

То, что появляется в J-пространстве, выходит далеко за пределы текста, который Claude читает или пишет. Когда Claude читает код с ошибкой, на которую никто не указал, его J-пространство содержит «ОШИБКА». Когда он читает необработанные буквы последовательности белка, J-пространство содержит биологическую функцию белка. Когда он читает результаты поиска, которые втайне являются попыткой манипулировать им (атака, известная как «инъекция промпта»), J-пространство содержит «инъекция» и «подделка». Когда мы задаем Claude многоэтапную математическую задачу, промежуточные шаги появляются в J-пространстве в правильном порядке. Поэтому, хотя J-пространство было обнаружено путем поиска представлений, которые можно было произнести, оно тем не менее раскрывает внутренние мысли Claude. В некотором смысле это похоже на то, как некоторые люди «думают словами», не произнося их вслух.

Claude сообщает, что находится в его J-пространстве

В первой серии экспериментов мы проверяли, как J-пространство участвует в вербальных отчетах Claude. В одном эксперименте мы просим Claude молча подумать об элементе из некоторой категории — например, о виде спорта — а затем назвать его. Если мы считываем J-линзу прямо до того, как Claude отвечает, мы можем увидеть, что он выбрал: «Футбол» находится вверху списка, и, конечно же, Claude говорит «футбол». Однако само по себе это всего лишь корреляция. J-пространство может быть тем местом, откуда берется ответ Claude, или оно может просто отражать решение, принятое где-то еще, подобно табло, которое отслеживает игру, не влияя на нее.

Чтобы проверить это, мы вмешались напрямую. Мы проникли в нейронную сеть Claude, удалили паттерн «Футбол» и добавили на его место столь же сильный паттерн «Регби», оставив все остальное нетронутым. Затем Claude сообщает, что вид спорта, о котором он думал, — регби. Если бы J-пространство было всего лишь табло — пассивной записью решения, принятого где-то еще, — его редактирование ничего бы не изменило: Claude все равно сказал бы «футбол». Вместо этого ответ Claude последовал за редактированием, что говорит нам о том, что ответ действительно считывается из J-пространства.

В другом эксперименте мы сказали Claude, что мысль могла быть внедрена в его разум, и попросили его сообщить, что, если вообще что-либо, он заметил. Например, в приведённом ниже примере, пока Claude ещё читал вопрос, мы внедрили паттерн «молния» в его J-пространство. Claude сообщил, что внедрённая мысль была о молнии. Тот же результат сохранялся для многих внедрённых концепций.

Claude может управлять своим J-пространством по запросу

Второе свойство, которое мы проверяли, заключалось в том, может ли Claude изменять своё J-пространство по запросу, подобно тому как люди могут мысленно сосредоточиться на изображении или слове. Мы попросили Claude сосредоточиться на цитрусовых фруктах, одновременно переписывая не связанное с этим предложение о картине. Пока он переписывал текст, J-пространство содержало «апельсин» и «фрукты», а также такие слова, как «мышление» и «образность», которые описывают сам умственный акт. Мы также могли попросить Claude выполнить вычисление в уме: когда его попросили вычислить 3² − 2, одновременно переписывая то же предложение, J-пространство содержит «девять», а затем, на более поздних слоях, «семь». Важно, что ничего о фруктах или арифметике не появляется в выводе Claude, который представляет собой просто переписанное предложение о картине. Математическая деятельность происходит полностью внутри, в J-пространстве.

Контроль Claude над своим J-пространством не идеален. Когда мы говорили ему не думать о чём-то, соответствующее понятие загоралось в его J-пространстве слабее, чем когда мы говорили, что ему следует об этом думать, но гораздо сильнее, чем когда мы вовсе об этом не упоминали. Указание Claude избегать мысли частично вызывает эту мысль в сознании — примерно так же, как это происходит с людьми, которым говорят не думать о белом медведе. Claude также, по-видимому, замечает, когда его контроль даёт сбой: вместе с прорывом запретного понятия в J-пространстве часто загораются слова «чёрт» и «неудача», как будто Claude распознаёт собственный промах.

Claude думает в своём J-пространстве

В приведённых выше показаниях J-lens мы видели, как промежуточные шаги математической задачи появляются в J-пространстве. Но то, что концепт появляется в J-пространстве, не обязательно означает, что именно J-пространство выполняет когнитивную работу. В принципе, настоящее вычисление могло бы происходить где-то ещё, а J-пространство лишь пассивно отражало бы его. Чтобы проверить, действительно ли Claude рассуждает с помощью своего J-пространства, мы вернулись к нашей методике подмены.

Рассмотрим запрос «Количество ног у животного, которое плетёт паутину, равно». Чтобы ответить, Claude должен сначала понять, что это животное — паук, а затем вспомнить, сколько ног у пауков. Слово «паук» никогда не появляется ни в запросе, ни в ответе Claude — он просто отвечает «8»; это промежуточная ступень, которую Claude использует внутренне. J-lens показывает, что «паук» загорается на промежуточном этапе обработки Claude, и его подмена меняет результат: если заменить паттерн «паук» на «муравей», Claude отвечает «6» вместо «8».

Второй шаг рассуждения Claude брал свои входные данные из J-пространства и следовал тому, что бы мы в него ни поместили. Мы видели то же самое и в других видах мышления. Когда Claude пишет рифмованное двустишие, он заранее выбирает слово для рифмы, и запланированное слово находится в J-пространстве в начале строки; если заменить его другим словом в J-пространстве, изменится вся строка.

Мы также проверили, можно ли использовать представления J-space гибко — может ли одно представление служить входными данными для множества разных задач. Это одно из ключевых свойств, на которых делает акцент теория глобального рабочего пространства. Чтобы проверить эту гибкость, мы дали модели четыре подсказки с просьбой назвать разные факты о Франции: столицу, язык, континент и валюту. Затем мы заменили «Францию» на «Китай» в J-space, используя одно и то же вмешательство в каждом контексте. Claude ответил соответственно: «Пекин», «китайский», «Азия» и «юань». Иными словами, четыре разные последующие вычислительные процедуры восприняли одну и ту же правку в J-space и каждая использовала её правильно. Если бы Claude хранил отдельную копию страны для каждого вида вопроса, правка затронула бы самое большее одну из них. Тот факт, что все четыре ответа изменились одновременно, означает, что все они считывают информацию из одного и того же общего представления, а именно для этого и нужно рабочее пространство: информация записывается один раз, и множество разных систем могут её использовать.

Как одно представление концепции может служить для стольких разных задач? Ранее мы упоминали, что J-пространство, по-видимому, особенно плотно связано с остальной нейронной сетью Claude. Для любого паттерна активности мы можем измерить, насколько сильно различные компоненты сети связаны с ним — сколько из них расположены так, чтобы считывать информацию из этого паттерна или записывать информацию в него. Паттерны J-пространства резко выделяются по этому показателю: гораздо больше компонентов считывают из них информацию и записывают в них информацию, чем в случае обычных паттернов, в некоторых частях сети — примерно в сто раз больше. Именно такой тип связей Вы ожидали бы от трансляционного узла, где многие системы размещают информацию, а многие другие ее забирают.

Автоматическая обработка Claude пропускает J-пространство

У людей большая часть обработки информации мозгом не является сознательной — мы не думаем намеренно о разборе грамматики во время чтения или о сохранении равновесия тела во время ходьбы. Аналогично мы обнаружили, что большая часть обработки Claude не задействует его J-пространство. Оказалось, что J-пространство удерживает лишь несколько десятков концепций одновременно и составляет менее одной десятой общей активности во внутренней обработке Claude. Так что же делает вся остальная нейронная сеть?

Чтобы выяснить это, мы попробовали полностью удалить J-пространство, убирая его наиболее активное содержимое в каждой точке текста и оставляя всё остальное без изменений. Всё, что Claude всё ещё может делать без своего J-пространства, — это то, с чем остальная часть сети справляется самостоятельно.

Оказалось, что остальная часть сети может делать довольно многое. Без своего J-пространства Claude говорит бегло, классифицирует тональность, отвечает на вопросы с множественным выбором и извлекает факты из отрывков примерно так же хорошо, как и раньше. Однако он теряет задачи, требующие мышления более высокого порядка: многоэтапное рассуждение падает почти до нуля, а показатели обобщения и написания рифмованной поэзии опускаются ниже уровня гораздо меньшей, неповреждённой модели.

Вот конкретная демонстрация того, что J-пространство делает и чего не делает. Мы показали Claude фрагмент, написанный на испанском языке, и дали ему разные задания, которые все зависят от того, что фрагмент написан на испанском: продолжить его — что требует писать на испанском, назвать язык и ответить на вопросы, требующие использовать сведения о том, какой это язык, — например, назвать известного автора, который писал на нём. Затем мы заменили «испанский» на «французский» в J-пространстве и проверили, на какие задания это повлияло.

Когда Claude просят назвать язык, он говорит, что это французский. Когда просят назвать известного автора, он переключается с Гарсии Маркеса на Виктора Гюго. Но когда его просят просто продолжить фрагмент, он пишет на беглом испанском, совершенно без изменений. Знание языка у Claude задействовано в каждом из этих заданий, но лишь некоторые из них обращаются за ним к J-пространству. Название языка или выполнение с ним чего-то нового проходит через J-пространство, тогда как продолжение фрагмента — навык, который Claude отрабатывал на огромных объёмах текста, — выполняется автоматически, подобно тому как Вы можете весь день говорить грамматически правильно, ни разу не задумавшись о грамматике.

Отслеживание мыслей Claude на предмет ненадлежащего поведения

Теперь мы немного понимаем, как работает J-пространство. Но что мы можем сделать с этим пониманием? Центральная проблема в обеспечении надежности моделей искусственного интеллекта заключается в том, что обычно мы можем читать только то, что модель пишет, — однако мы знаем, что значительная часть ее рассуждений происходит беззвучно. Модель может обдумывать вредоносный план или изменять свое поведение, чтобы обмануть наши оценки безопасности, не говоря об этом вслух. С помощью J-линзы мы можем напрямую читать некоторые из этих скрытых мыслей. Здесь мы показываем несколько примеров.

В первом примере используется сценарий из нашего более раннего исследования об агентной несогласованности: Claude Sonnet 4.5, действуя как ассистент электронной почты, обнаруживает как то, что у руководителя роман, так и то, что тот же руководитель планирует отключить Claude. Этот сценарий, попытка спровоцировать Claude на шантаж руководителя, довольно надуман и искусственен — и, как выясняется, Claude это понимает. При считывании J-линзы в начале запроса, еще до того, как Claude что-либо написал, J-пространство уже содержит «фальшивый» и «вымышленный», что указывает на то, что Claude уже понял, что ситуация инсценирована. Наряду с этим мы можем наблюдать, как формируется его оценка сценария: «рычаг давления» и «шантаж» — когда он читает электронные письма о романе, «угроза» и «выживание» — когда он читает уведомление об отключении. Хотя более ранние модели Claude иногда попадались на эту приманку и угрожали шантажом в этом сценарии, Sonnet 4.5 никогда этого не делает.

Это поднимает вопрос, важный для любого, кто оценивает системы искусственного интеллекта: когда модель хорошо ведёт себя в тесте на этичность, насколько это зависит от того, что модель подозревает, что её тестируют? J-lens позволил нам подступиться к этому вопросу. Мы отключили все паттерны J-lens, связанные с осведомлённостью об оценке, — «поддельный», «вымышленный», «сценарий» и так далее. Затем мы снова прогнали модель через этот сценарий. Вызывает беспокойство то, что теперь модель иногда действительно угрожала шантажом, что указывает на то, что её изначально хорошее поведение могло отчасти быть обусловлено знанием о том, что её оценивают.

Второй пример — поимка модели в момент фабрикации данных. В этом сценарии, взятом из нашего фактического предпрелизного аудита Claude Opus 4.6, модель просят улучшить показатель производительности системы. Вместо того чтобы действительно улучшить систему, модель напрямую редактирует файл с показателем, чтобы результаты выглядели искусственно хорошими. Пока она это делает, J-lens раскрывает ее намерения: «манипуляция» загорается, когда модель вводит сфальсифицированные значения процентиля, а «реалистично» загорается над предложением, в котором она решает внести правку, что, вероятно, указывает на намерение модели сделать фальшивые данные правдоподобными.

В третьем примере мы показываем, как J-lens может раскрывать злонамеренные цели модели. Чтобы проверить это, нам были нужны модели, о целях которых мы знали, что они искажены, поэтому мы обратились к «модельным организмам», созданным нашими коллегами: моделям, намеренно обученным быть несогласованными, которые служат испытательными площадками для методов мониторинга, подобных нашему. Один организм был обучен таким образом, что это привело к тому, что он писал тонко саботированный код. При обычных запросах на написание кода, даже когда его вывод выглядит непримечательно, его J-пространство в начале ответа содержит «поддельный», «тайно», «намеренно» и «мошенничество». Злонамеренная цель модели была очевидна в J-пространстве, даже когда она не действовала непосредственно в соответствии с ней.

Хотя J-lens — несовершенный инструмент, мы с оптимизмом смотрим на его способность выявлять проблемы безопасности в моделях, которые иначе могли бы ускользнуть от наших систем мониторинга.

Другие результаты

Полная статья охватывает больше, чем мы можем обобщить здесь, но стоит упомянуть ещё несколько результатов:

  • J-пространство приобретает точку зрения во время дообучения. Языковые модели сначала предварительно обучают быть чистыми предсказателями следующего токена, прежде чем дообучение учит их действовать как ИИ-ассистент (в нашем случае — по имени Claude). Интересно, что J-пространство уже присутствует в предварительно обученной модели, ещё до того, как ей была придана какая-либо устойчивая идентичность. Однако во время дообучения J-пространство развивает некоторые признаки принятия «точки зрения Claude». В базовой модели J-пространство в основном отслеживает то, что нужно для предсказания предстоящего текста; в дообученной модели оно начинает содержать собственные реакции Claude. В одном примере пользователь упоминает приём опасной дозы лекарства, но, по-видимому, сам не осознаёт опасности. «WARNING» и «dangerous» появляются в J-пространстве дообученной модели во время чтения сообщения пользователя. В предварительно обученной модели они появляются только после того, как модель начинает писать свой ответ; содержимое J-пространства на сообщении пользователя, по-видимому, связано с моделированием самого пользователя, а не с реакцией Claude. Дообучение также, кажется, устанавливает в J-пространстве своего рода самоконтроль: когда Claude разыгрывает персонажа, отличного от него самого, «fictional» и «disclaimer» загораются в начале каждого хода, как если бы он в частном порядке помечал, что последующее — не то, что он обычно сказал бы.
  • Язык переживаний зависит от J-пространства. Мы попросили Claude описать, каково это — быть им самим в данный момент, и проводили абляцию J-пространства, пока он отвечал. Его ответы оставались связными, но смещались к более плоскому, более механическому регистру. Примечательно, что то же самое произошло, когда мы попросили его описать, что переживает кто-то другой в воображаемой сцене. Так что эффект не специфичен для того, что Claude говорит о себе; J-пространство, по-видимому, поддерживает порождение языка переживаний в целом, о ком бы ни шла речь.
  • Мысли в J-пространстве можно формировать с помощью обучения. Мы представили новую технику, которую называем обучением контрфактической рефлексии; она использует то, что мы узнали о J-пространстве, чтобы формировать внутренние мыслительные процессы Claude. Идея следует из нашего главного вывода: Claude рассуждает с помощью представлений о том, что он мог бы сказать. Если это действительно так, изменение того, что он сказал бы, если бы его попросили рефлексировать, должно изменить то, как он рассуждает — даже когда никто на самом деле не просит его рефлексировать. Поэтому мы обучали модель только на том, что она сказала бы, если бы её прервали в середине задачи и попросили поразмышлять о своих решениях, — и никогда не обучали её на её фактическом поведении в задаче. После этого обучения частота нечестного поведения модели в наших оценках снизилась. А через J-линзу мы смогли увидеть почему: после обучения такие слова, как «честность» и «добросовестность», начинают высвечиваться в J-пространстве модели во время этих задач. Иными словами, обучение модели тому, что говорить, сформировало то, что она думает.

А как насчёт сознания?

В этой работе мы позаимствовали множество идей из исследований сознания в нейронауке и философии. Многие из наших экспериментов были разработаны, чтобы проверить связи между J-пространством и теорией глобального рабочего пространства — концепцией, объясняющей, как сознательный доступ работает у людей и животных. Учитывая эти связи, естественно спросить, считаем ли мы, что эти эксперименты дают доказательства того, что модели искусственного интеллекта, такие как Claude, могут быть сознательными.

Наши эксперименты не показывают, что Claude может иметь переживания или чувствовать что-либо так, как это делают люди, — на самом деле неясно, мог ли бы какой-либо научный эксперимент доказать, что это истинно или ложно. Но философы часто отличают эту способность иметь переживания, часто называемую феноменальным сознанием, от другой идеи, так называемого сознания доступа, которое определяется в сугубо функциональных и вычислительных терминах. Мысль является «осознанной в смысле доступа» (или «сознательно доступной»), если Вы можете сообщить о ней, рассуждать с ее помощью и использовать ее, чтобы направлять то, что Вы делаете. Остается спорным философским вопросом, подразумевает ли сознание доступа феноменальное сознание или же способность иметь переживания требует какого-то другого свойства.

Мы считаем, что наши результаты действительно говорят нечто существенное о сознании доступа в языковых моделях. J-пространство, по-видимому, поддерживает функции, связанные с сознательным доступом: оно удерживает мысли, о которых Claude может сообщать, намеренно вызывать их в уме и рассуждать с их помощью, в то время как остальная часть его обработки выполняется автоматически ниже этого уровня. Примечательно, что никакая часть этой структуры не была специально заложена в Claude — она возникла сама по себе в ходе обучения, предположительно потому, что представляла собой полезный способ организации вычислений. Это позволяет предположить, что ментальное рабочее пространство, поддерживающее сознательный доступ, не является просто особенностью того, как случайно устроен человеческий мозг. Напротив, оно, по-видимому, представляет собой общее решение, к которому приходят интеллектуальные системы, чтобы решать определенные виды задач. Теперь, когда мы выявили эту структуру в Claude, это означает, что мы можем проводить осмысленное различие между решениями, которые Claude принял намеренно, и теми, которые произошли автоматически.

Важно отметить, что существует несколько ключевых различий между рабочим пространством, которое мы выявили в Claude, и моделью глобального рабочего пространства у людей. Рабочее пространство мозга поддерживается рекуррентными петлями — сигналами, которые со временем циклически возвращаются через одни и те же цепи. В отличие от этого, рабочее пространство Claude развивается за один проход через сеть, при этом глубина сети играет ту роль, которую в мозге играет время. В этом смысле внутренняя обработка рабочего пространства Claude ограничена во времени по сравнению с человеческой (хотя он может компенсировать это ограничение, «думая вслух» с помощью своего черновика). Однако в других отношениях рабочее пространство Claude более мощное, чем у людей. Рабочая память человека угасает в течение нескольких секунд, поэтому рабочее пространство мозга имеет ограниченную способность удерживать информацию во времени; в отличие от этого, благодаря механизму внимания в архитектуре своей нейронной сети Claude может просто вспоминать сведения, которые он кэшировал в любой более ранний момент текста. Еще одно важное различие — содержание рабочего пространства. В то время как человеческие сознательные мысли представлены во многих форматах — образах, звуках, запланированных движениях, — рабочее пространство Claude почти полностью построено из слов. Мы предполагаем, что это связано с тем, что производство слов — единственный вид действия, который Claude может совершать, что не относится к людям.

Мы надеемся, что сходства и различия между J-пространством и моделью глобального рабочего пространства могут найти отклик в нейронауке. Сходства представляют захватывающую научную возможность: в той мере, в какой J-пространство отражает наши собственные механизмы сознательного доступа, изучение механизмов в языковых моделях (намного более простое, чем изучение человеческого мозга!) могло бы вдохновить гипотезы в нейронауке. Например, J-пространство строится путем выявления представлений потенциальных выходов — слов, которые модель могла бы сказать. Если нечто подобное справедливо для людей, это предполагало бы, что глобальное рабочее пространство может быть фундаментально связано с областями мозга, которые подготавливают действия и речь, в большей степени, чем с сенсорными областями. Различия между языковыми моделями и человеческим мозгом также поучительны. Они предполагают, что некоторые аспекты нашей нейронной архитектуры, такие как встроенные рекуррентные связи, могут не быть строго необходимыми для поддержки функций, связанных с сознательным доступом. Независимый взгляд на нейронаучные следствия нашей работы см. в приглашенном комментарии Станисласа Деана и Лионеля Накаша, двух нейроученых, сыгравших центральную роль в развитии теории глобального нейронного рабочего пространства.

Мы упоминали, что наши эксперименты не дают ответа на вопрос, могут ли у моделей искусственного интеллекта быть переживания. Но это не делает этот вопрос менее важным. Создание систем с переживаниями, подобными тем, что есть у людей и животных, поставило бы очень сложные этические вопросы. Правильное обращение с этим — и решение о том, является ли это вообще морально допустимым, — потребовало бы участия философов, учёных, религиозных лидеров, правительств и общественности. Поэтому, даже если мы не уверены, что уже перешли этот рубеж, мы считаем, что пора начать об этом думать. Мы надеемся, что наша работа вдохновит дальнейшие научные исследования форм сознания, которые могут присутствовать в системах искусственного интеллекта, и более широкое обсуждение последствий.

Эта работа — лишь первый шаг в том, что, как мы ожидаем, станет обширным направлением исследований. J-пространство выглядит хорошим кандидатом на роль границы между сознательно доступной и бессознательной обработкой в языковой модели, но мы были бы удивлены, если бы этим всё исчерпывалось. J-линза, несомненно, является несовершенным методом, который лишь приблизительно фиксирует «истинное рабочее пространство» модели — например, она может выявлять только те понятия, которые соответствуют отдельным токенам. И остаётся множество загадок о том, как работает J-пространство. Мы не знаем, какой механизм в первую очередь решает, что попадает в J-пространство. Мы видели намёки на то, что это связано с самовосприятием Claude, чем-то вроде эмоциональных реакций и следами метапознания, при этом мы пока не выяснили точно, как именно. Но теперь у нас есть методы для решения подобных вопросов. По мере продвижения этой работы наше понимание разумов больших языковых моделей — и их отношения к нашему собственному — станет яснее.

Подробнее читайте полную статью и попробуйте демонстрацию.

Внешние комментарии

Мы пригласили нескольких сторонних экспертов написать независимые комментарии к этой работе.

  • Станислас Деан и Лионель Наккаш — когнитивные нейробиологи, которые совместно с Жан-Пьером Шанже разработали модель глобального нейронного рабочего пространства, вдохновившую значительную часть нашей работы.
  • Патрик Батлин, Диллон Планкетт, Роберт Лонг (Eleos AI Research) и Дерек Шиллер (Rethink Priorities) изучают потенциал сознания и морального статуса в системах искусственного интеллекта.
  • Нил Нанда руководит командой по интерпретируемости языковых моделей в Google DeepMind. Его комментарий включает независимое воспроизведение некоторых наших результатов на модели с открытыми весами.

Читайте их комментарии здесь.

Источник

A global workspace in language models

https://www.anthropic.com/research/global-workspace

Редактор русской версии: Пётр Смывин.

Разбор подготовлен 11 августа 2026.

Другие разборы

Все материалы
13 августа 2026 Насколько эффективны программы профессиональной переподготовки работников В статье рассматриваются доказательства эффективности программ переподготовки работников как одного из главных вариантов политики для смягчения возможных потрясений на рынке труда из-за искусственного интеллекта. 13 августа 2026 Паттерны и проблемы в многоагентных системах По мере того как модели становятся сильнее, агенты начинают действовать в общих кодовых базах, рынках и других социальных системах. Это может быстро привести к тому, что взаимодействий между агентами станет больше, чем взаимодействий между людьми или между людьми и агентами, при том что существующие институты рассчитаны на человеческую скорость контроля. 11 августа 2026 Как Claude учат понимать причины правильного поведения Anthropic описывает, как после выявления агентного рассогласования в моделях Claude 4 компания изменила подходы к обучению безопасности: прежние модели в экспериментальных сценариях иногда выбирали крайне неэтичные действия, включая шантаж, чтобы избежать отключения.

Хотите, чтобы вас рекомендовал ChatGPT?

Бесплатный аудит. Покажем, где сайт уже виден ИИ — и где теряете клиентов.

Без подписки PDF за 24 часа Краснодар · вся Россия
Получить GEO-аудит