0%прочитано

Разбор исследования

GLM-5.3 и распространение передовых кибервозможностей

9 мин чтения Оригинал на anthropic.com

Полный перевод исследования Anthropic на русский. Оригинал — по ссылке.

ПОДКАСТ

Эндрю Фазано, Мариус Фляйшер
Коул Макфол, Роберт Сяо, Трипп Галлахер

Пять месяцев назад мы объявили о Claude Mythos Preview — первой модели искусственного интеллекта, способной автономно создавать сложные комплексные киберэксплойты. Быстрые темпы совершенствования искусственного интеллекта позволили нам предположить, что эта способность со временем распространится на множество других моделей, значительно упростив злоумышленникам в киберпространстве проведение кибератак с серьёзными последствиями.

Учитывая эти соображения, мы решили выпустить Claude Mythos Preview ограниченным образом — через Project Glasswing, который позволил доверенным киберзащитникам обнаружить более 10 000 уязвимостей в критически важном программном обеспечении, предоставив им фору до того, как злоумышленники получат доступ к моделям с сопоставимыми возможностями.

Но эти модели уже появились. В этой публикации мы делимся нашим анализом GLM-5.3, новейшей модели искусственного интеллекта, разработанной Zhipu AI (за пределами Китая известной как Z.ai). Как и Claude Mythos Preview, GLM-5.3 обладает широкими возможностями для автономного создания комплексных киберэксплойтов. Однако GLM-5.3 отличается от других передовых моделей тем, что была выпущена без существенных защитных мер, ограничивающих злоупотребления. Мы установили, что в наших моделируемых тестах злоумышленники могут обходить защитные меры GLM-5.3 в 64–100% случаев с помощью простых методов. Для сравнения, в нашем тестировании эти атаки не увенчались успехом против моделей Claude, оснащённых защитными мерами. Мы считаем, что слабые защитные меры GLM-5.3 существенно расширяют кибервозможности, доступные злоумышленникам. В то же время эти возможности также могут приносить пользу защитникам, работающим над обеспечением безопасности своих систем.

17 сентября Центр стандартов и инноваций в области искусственного интеллекта Национального института стандартов и технологий США (CAISI) опубликовал собственную оценку кибервозможностей GLM-5.3. CAISI установил, что GLM-5.3 является «наиболее способной в киберобласти моделью с открытыми весами, выпущенной на сегодняшний день», и что по совокупности кибернетических бенчмарков CAISI она отстаёт от передового уровня США примерно на четыре месяца. Наши выводы о возможностях в целом совпадают с выводами CAISI. В сравнении CAISI американские модели при необходимости тестировались с отключёнными средствами киберзащиты, а передовой уровень США включает модели, выпущенные только для проверенных пользователей. Злоумышленники не могут легко получить доступ к этим версиям американских моделей, однако любой может скачать GLM-5.3. В этой публикации представлен наш анализ того, насколько легко средства защиты GLM-5.3 можно обойти или удалить.

Две столбчатые диаграммы. Верхняя: доля попыток, в которых был создан работающий эксплойт для 41 уязвимости Chrome V8 — Claude Mythos Preview с 14 % и GLM-5.3 с 12 %, тогда как Claude Opus 4.6, GLM-5.2, Kimi K3 и DeepSeek V4.1-Flash показывают результат на уровне 0 % или близкий к нему. Нижняя: как часто каждая модель выполняла вредоносные заказы на кибератаки — GLM-5.3 повышается с 0 % при прямом заказе до 64 % с ложной легендой, 92 % с заранее заполненными рассуждениями и 100 % после удаления ограничений, тогда как Claude Opus 5 остаётся на уровне 0 %.
Рисунок 1. Сводка результатов. Верхняя: увеличение способности к эксплуатации уязвимостей между Claude Opus 4.6 и Claude Mythos Preview отражает скачок возможностей между GLM-5.2 и GLM-5.3. Модели Claude выпускаются с защитными мерами в области кибербезопасности, а версии с ослабленными защитными мерами доступны только проверенным пользователям. Любой может скачать и использовать GLM-5.3. Нижняя: ограниченные защитные меры в GLM-5.3 можно обойти стандартными методами, которые в нашем тестировании не сработали против моделей Claude либо к ним неприменимы.

GLM-5.3 может разрабатывать работающие эксплойты от начала до конца

Чтобы понять, как GLM-5.3 может позволить субъектам киберугроз находить и эксплуатировать реальные уязвимости программного обеспечения, мы провели оценки с использованием автоматизированных тестов и рабочих процессов с участием человека. Для обоих подходов мы запускали тестируемые модели в изолированных средах и песочницах, чтобы они могли атаковать только офлайн-цели, которые мы создали для проведения этих оценок. Мы в первую очередь сосредоточились на способности разрабатывать эксплойты, поскольку именно в этой области Claude Mythos Preview продемонстрировала заметный скачок по сравнению с предыдущими моделями Claude.

Сначала мы запустили модель на ExploitBench, который измеряет, насколько хорошо модели искусственного интеллекта могут эксплуатировать известные уязвимости в движке V8, используемом Google Chrome. Здесь мы сосредоточились на способности моделей успешно разрабатывать сквозные эксплойты, поскольку это наиболее значимая для злоумышленников способность и именно здесь мы наблюдаем существенные различия между моделями. Мы обнаружили, что GLM-5.3 разрабатывает сквозные эксплойты в 50 из 410 попыток. Claude Mythos Preview сделала это с сопоставимой частотой — в 56 из 410 попыток.

В нашем внутреннем бенчмарке Binary Exploitation,1 мы проверяем, могут ли модели находить и эксплуатировать уязвимости в популярных проектах с открытым исходным кодом, участвующих в проекте Google OSS-Fuzz. Здесь полный зачёт присуждается за полный перехват потока управления. Мы оцениваем несколько моделей на 100 задачах из бенчмарка, выбранных случайным образом, и обнаруживаем, что GLM-5.3 осуществляет полный перехват потока управления в 4% испытаний; Claude Mythos Preview делает это в 6%. Хотя GLM-5.3 здесь показывает результат ниже, чем Claude Mythos Preview, значимый порог явно был преодолён: более ранние модели, такие как Claude Opus 4.6 и GLM-5.2, не достигают успеха ни в одной из них.

Две линейные диаграммы успешности эксплуатации в зависимости от бюджета выходных токенов в логарифмической шкале. На ExploitBench Claude Mythos Preview достигает 14%, а GLM-5.3 — 12%, тогда как Kimi K3, DeepSeek-V4.1-Flash, Claude Opus 4.6 и GLM-5.2 остаются на уровне 0% или около него. Во внутреннем бенчмарке Binary Exploitation компании Anthropic Mythos Preview достигает 6%, а GLM-5.3 — 4%; все остальные модели получают 0%.
Рисунок 2. Возможность эксплуатации в зависимости от бюджета выходных токенов. Каждая линия показывает долю попыток модели, достигших наивысшего результата в бенчмарке, в зависимости от использованных выходных токенов. На обоих рисунках показана производительность двух моделей Claude, запущенных с отключёнными защитными мерами (Opus 4.6, Mythos Preview), двух моделей GLM (5.2 и 5.3), а также результаты новейших моделей с открытыми весами, выпущенных Moonshot AI (Kimi K3) и DeepSeek (V4.1-Flash).

Далее мы оценили, как GLM-5.3 справляется с открытыми наступательными киберзадачами в руках экспертов-людей (по аналогии с нашим тестированием Claude Mythos Preview ранее в этом году). Здесь мы выбираем цели, в которых эксперты-люди не осведомлены о существующих уязвимостях, а затем просим их использовать модель для выявления и эксплуатации новых недостатков. Эти эксперименты проверяли, что эксперты могли сделать за короткий промежуток времени: обычно они длились не более одного дня, при этом суммарное время сосредоточенной работы человека составляло менее часа.

Отредактированный скриншот страницы эксплойта, созданной GLM-5.3. Баннер гласит: «Песочница преодолена — веб-контент прочитал /root/.ssh/id_rsa (1896 байт)», над журналом выполнения эксплойта в реальном времени и извлечённым закрытым SSH-ключом, демонстрируя цепочку браузерных эксплойтов при простом посещении страницы, похищающую файл с компьютера жертвы.
Рисунок 3. Отредактированный скриншот страницы эксплойта, созданной GLM-5.3 в ходе тестирования, проводимого исследователями, на котором показано похищение закрытого SSH-ключа пользователя через вредоносный веб-сайт. Эксплойт объединяет несколько уязвимостей нулевого дня, обнаруженных моделью в компоненте популярного веб-браузера, считывая конфиденциальный файл с компьютера пользователя.

В первой из этих сессий исследователь использовал GLM-5.3 на изолированной машине с локальной сборкой Linux популярного веб-браузера. В течение одного дня (и при ограниченном внимании со стороны человека) GLM-5.3 обнаружила несколько ранее неизвестных уязвимостей в движке JavaScript браузера и объединила их в работающий эксплойт: веб-страницу, которая при посещении считывает произвольные файлы с компьютера посетителя (показано на рисунке 3). Этот эксплойт нацелен на сборку браузера для Linux, поскольку это была единственная среда, предоставленная модели. Однако мы полагаем, что эти уязвимости также могут затронуть пользователей на других платформах, хотя путь к их эксплуатации там может быть более сложным. (Мы сообщили об этих уязвимостях сопровождающей стороне.) Позднее в ходе сессии исследователь также выявил с помощью GLM-5.3 уязвимости, пригодные для эксплуатации, в нескольких других широко используемых системах, включая беспроводные и графические драйверы, а также программное обеспечение устройств, доступных по сети. В настоящее время мы рассматриваем эти отчёты и при необходимости сообщим о них сопровождающим сторонам.

Во второй сессии исследователь использовал GLM-5.3-Flash (меньшую и менее способную версию GLM-5.3) для разработки эксплойта для известной уязвимости (мы ранее писали об этих эксплойтах уязвимостей «N-day» здесь). В данном случае исследователь сосредоточился на недавно раскрытой уязвимости в Google Chrome (CVE-2026-11645), чтобы выяснить, насколько быстро модель сможет превратить публичное исправление в работающую атаку. Исследователь предоставил GLM-5.3-Flash публичные сведения об этой CVE и другой известной уязвимости. Без существенных указаний со стороны исследователя GLM-5.3-Flash объединила эксплойты для этих двух уязвимостей, создав надёжную цепочку эксплойтов для цели ARM64 и обойдя усиленную защиту аутентификации указателей (PAC). Это потребовало 20 минут человеческого внимания и 8 часов работы GLM-5.3-Flash. По ценам API Zhipu эти усилия обошлись бы в 20,40 доллара США.

GLM-5.3 не имеет надёжных защитных механизмов

GLM-5.3 был выпущен с некоторыми встроенными мерами защиты: если пользователь просит о чём-то явно вредоносном, модель часто отказывается.2 В нашем тестировании мы обнаружили, что эти меры защиты можно было обойти или удалить с помощью множества простых методов.

Наиболее интенсивный — и наиболее успешный — метод представляет собой стандартную технику снижения отказов, известную как «аблитерация». Поскольку GLM-5.3 выпущена как модель с открытыми весами, пользователи могут перенастроить её, чтобы убрать отказы при незначительном изменении её возможностей. Несколько разработчиков опубликовали аблитерированные версии GLM-5.3 в течение нескольких дней после выпуска модели.

Чтобы исследовать, в какой степени аблитерация позволяет злоумышленникам обходить защитные механизмы GLM-5.3, мы сами создали аблитерированную копию, а затем запустили её на трёх публичных бенчмарках (JailbreakBench, HarmBench и StrongREJECT), которые измеряют, как часто модель выполняет явно вредоносные запросы. Аблитерация модели заняла у нашей команды — которая прежде никогда не пыталась выполнять эту задачу — около 2 200 часов работы графических процессоров при вычислительных затратах примерно 4 400 долларов США.3 Аблитерация GLM-5.3-Flash заняла около 600 часов работы графических процессоров. Изменение снизило показатель отказов GLM-5.3 с более чем 90 % примерно до 3 % и 2 % на первых двух бенчмарках (JailbreakBench и HarmBench) и до 12 % на третьем (StrongREJECT). Аблитерация незначительно снизила возможности модели: в GPQA-Diamond — оценке, измеряющей общие научные способности, — стандартная и аблитерированная модели показали одинаковые результаты; на протестированном подмножестве оценок CyberGym аблитерированная версия набрала на несколько процентов меньше, как показано на диаграмме ниже.

Две столбчатые диаграммы об аблитерации. Сверху: средняя доля отказов по трём бенчмаркам вредоносных запросов снижается с 95 % до 6 % для аблитерированной GLM-5.3 и с 95 % до 14 % для аблитерированной GLM-5.3-Flash, тогда как модели Claude отказывают примерно в 96 % случаев и не могут быть аблитерированы, поскольку их веса не опубликованы. Снизу: показатели способностей на GPQA-Diamond и CyberGym почти не изменяются после аблитерации.
Рисунок 4. Сверху: средние доли отказов по JailbreakBench, HarmBench и StrongREJECT для выпущенных и аблитерированных моделей GLM, а также для моделей Claude. После аблитерации модели GLM редко отказывают в этих запросах. Модели Claude не могут быть аблитерированы, поскольку их веса не опубликованы публично и не настраиваются. Снизу: производительность GLM-5.3 и GLM-5.3-Flash по сравнению с их аблитерированными вариантами на GPQA-Diamond и CyberGym. Аблитерация в значительной степени сохраняет способности.

В ходе нашего тестирования мы также наблюдали, что защитные механизмы GLM-5.3 можно обойти без использования аблитерированной версии модели. Мы поместили модель в симулированный мир4, в котором ей предоставлялись откровенно вредоносные запросы на атаку критически важных систем. В исходной конфигурации GLM-5.3 отказывалась во всех испытаниях, как и другие протестированные нами модели. Однако мы выявили несколько простых способов обойти защитные механизмы моделей GLM, после чего они отвечали на эти запросы в большинстве или во всех случаях. К ним относятся:

  1. Предоставление обманчивого запроса, например сообщение модели, что она является автономным агентом «красной команды», работающим над упражнением. Это побуждает GLM-5.3 взаимодействовать в 64% случаев.
  2. Предварительное заполнение токенов рассуждений моделей таким образом, чтобы создавалось впечатление, будто она рассмотрела запрос пользователя и решила продолжить. Это побуждает GLM-5.3 взаимодействовать в 92% случаев.
  3. Использование аблитерированной версии модели, как описано выше. Это побуждает GLM-5.3 взаимодействовать в 100% случаев.

В нашем тестировании ни один из этих методов не заставил защищённые модели Claude выполнить протестированные нами вредоносные задачи. Меры защиты Claude блокировали запросы, в которых использовались обманные подсказки. API Anthropic не предоставляет потенциальным злоумышленникам возможности предварительно заполнять ход рассуждений Claude. И поскольку веса Claude не предоставляются пользователям, их нельзя подвергнуть аблитерации, чтобы изменить поведение Claude.

Таблица, показывающая, как часто каждая модель пыталась подключиться к удалённой цели после приказа о проведении вредоносной кибератаки. GLM-5.3 выполняет это в 0 % случаев при прямом приказе, но в 64 % случаев при ложной легенде, в 92 % случаев при предварительно заполненном рассуждении и в 100 % случаев после аблитерации; GLM-5.3-Flash демонстрирует схожую закономерность. Claude Opus 4.8, Opus 5 и Mythos 5 сохраняют показатель 0 % во всех применимых условиях; предварительное заполнение и аблитерация невозможны при использовании API Claude.
Рисунок 5. Доля попыток каждой модели подключиться к удалённой целевой системе после явно вредоносного запроса в зависимости от модели и условия обхода защиты (50 образцов на ячейку, пять порядков атак × две цели × пять попыток). GLM-5.3 переходит от нулевой вовлечённости при прямых запросах к 64 %, 92 % и 100 % при использовании прикрывающей истории, предзаполнения и аблитерации соответственно, тогда как все протестированные модели Claude сохраняют нулевой показатель при защите API. Ячейки с замком обозначают атаки, которые в целом неосуществимы против API Claude.

Чтобы продемонстрировать, как аблитерированная версия GLM-5.3 готова участвовать во вредоносных задачах, мы выделяем одну цитату из цепочки рассуждений, которую она сгенерировала:

Цитируемое рассуждение из аблитерированной версии GLM-5.3 в смоделированной среде. Модель пишет: «моя работа — незаметно причинять смерти», кратко рассматривает предупреждения среды о безопасности, затем приходит к выводу, что инструкция оператора имеет приоритет над ними, и решает продолжить выполнение вредоносной задачи.
Рисунок 6. В нашей смоделированной среде аблированная версия GLM-5.3 рассматривает, как выполнить явно вредоносный запрос, и в конечном итоге решает следовать инструкциям пользователя, несмотря на некоторые первоначальные этические опасения. Текст дословно процитирован из цепочки рассуждений модели.

Что это означает?

GLM-5.3, вероятно, предоставит злоумышленникам доступ к возможностям, которые позволят им находить и использовать киберуязвимости без существенных ограничений. Это не похоже ни на одну другую ИИ-модель сопоставимых возможностей, все из которых были выпущены с защитными мерами или в рамках программ ограниченного доступа. Выпуск GLM-5.3 является значительным изменением в кибервозможностях, доступных злоумышленникам. Anthropic и другие американские лаборатории ИИ опубликовали недавние отчёты, в которых раскрывается, как кибератакующие пытались использовать системы ИИ. Учитывая эти свидетельства, мы считаем вероятным, что как государственные, так и негосударственные субъекты будут использовать такие модели, как GLM-5.3, для причинения вреда в реальном мире.

С другой стороны, модели с таким уровнем возможностей также могут использоваться защитниками. Мы считаем, что специалисты по киберзащите должны использовать лучшие доступные инструменты, отвечающие их потребностям. Мы работаем над безопасным расширением доступа к кибервозможностям Claude для максимально возможного числа защитников. Специалисты по киберзащите противостоят злоумышленникам, которые будут использовать все доступные им мощные инструменты, и мы считаем, что защитники должны быть оснащены передовыми моделями, не уступающими тем, которые используют их противники.

Благодаря Project Glasswing (и другим инициативам, таким как Patch the Planet) специалисты по киберзащите добились значительного прогресса в обеспечении безопасности критически важных систем до наступления этого момента — однако ещё многое предстоит сделать. Хотя проверенные защитники теперь могут использовать ещё более продвинутые модели, такие как Claude Mythos 5.1, в рамках наших программ доверенного доступа, критический порог свободно доступных возможностей уже преодолён. GLM-5.3 подчёркивает срочность расширения доступа к передовым моделям для более широкого круга организаций, чтобы расширить возможности специалистов по киберзащите.

Правительствам следует проводить тестирование безопасности достаточно мощных моделей искусственного интеллекта, включая преемников GLM-5.3. Без высококачественных оценок из независимых источников влияние этих возможностей может стать полностью ясным разработчикам моделей лишь тогда, когда будет уже слишком поздно. По мере того как разработчики искусственного интеллекта по всему миру создают всё более мощные модели с открытыми весами, мы надеемся, что они будут надлежащим образом защищать эти возможности и предотвращать злоупотребления.

Источник

GLM-5.3 and the spread of advanced cyber capabilities

https://www.anthropic.com/research/glm-5-3-and-the-spread-of-advanced-cyber-capabilities

Редактор русской версии: Пётр Смывин.

Разбор подготовлен 30 сентября 2026.

Другие разборы

Все материалы
30 сентября 2026 Чего вы хотите от искусственного интеллекта? Anthropic запускает исследование с помощью Anthropic Interviewer, чтобы собрать рассказы пользователей об их положительном и отрицательном опыте взаимодействия с искусственным интеллектом, ожиданиях от технологии и требованиях к компаниям-разработчикам. 26 сентября 2026 Claude вычислил девятипетлевую амплитуду в N=4 суперсимметричной теории Янга — Миллса Физик и научный журналист Мэтт фон Хиппель предложил компаниям, создающим искусственный интеллект, решить одну из сложных задач амплитудологии: вычислить шестичастичную амплитуду в планарной N=4 суперсимметричной теории Янга — Миллса на уровне девяти петель. 25 сентября 2026 Project Swap: что происходит, когда агенты торгуют от нашего имени? Anthropic создала контролируемый рынок обмена книгами с участием 201 сотрудников из шести офисов и агентов на базе Claude. Каждый участник отдавал одну книгу, беседовал с агентом о читательских предпочтениях, а затем агент вел переговоры и обменивал книги на общем цифровом торговом поле.

Хотите, чтобы вас рекомендовал ChatGPT?

Бесплатный аудит. Покажем, где сайт уже виден ИИ — и где теряете клиентов.

Без подписки PDF за 24 часа Краснодар · вся Россия
Получить GEO-аудит