Полный перевод исследования Anthropic на русский. Оригинал — по ссылке.
ПОДКАСТ
Эндрю Фазано, Мариус Фляйшер
Коул Макфол, Роберт Сяо, Трипп Галлахер
Пять месяцев назад мы объявили о Claude Mythos Preview — первой модели искусственного интеллекта, способной автономно создавать сложные комплексные киберэксплойты. Быстрые темпы совершенствования искусственного интеллекта позволили нам предположить, что эта способность со временем распространится на множество других моделей, значительно упростив злоумышленникам в киберпространстве проведение кибератак с серьёзными последствиями.
Учитывая эти соображения, мы решили выпустить Claude Mythos Preview ограниченным образом — через Project Glasswing, который позволил доверенным киберзащитникам обнаружить более 10 000 уязвимостей в критически важном программном обеспечении, предоставив им фору до того, как злоумышленники получат доступ к моделям с сопоставимыми возможностями.
Но эти модели уже появились. В этой публикации мы делимся нашим анализом GLM-5.3, новейшей модели искусственного интеллекта, разработанной Zhipu AI (за пределами Китая известной как Z.ai). Как и Claude Mythos Preview, GLM-5.3 обладает широкими возможностями для автономного создания комплексных киберэксплойтов. Однако GLM-5.3 отличается от других передовых моделей тем, что была выпущена без существенных защитных мер, ограничивающих злоупотребления. Мы установили, что в наших моделируемых тестах злоумышленники могут обходить защитные меры GLM-5.3 в 64–100% случаев с помощью простых методов. Для сравнения, в нашем тестировании эти атаки не увенчались успехом против моделей Claude, оснащённых защитными мерами. Мы считаем, что слабые защитные меры GLM-5.3 существенно расширяют кибервозможности, доступные злоумышленникам. В то же время эти возможности также могут приносить пользу защитникам, работающим над обеспечением безопасности своих систем.
17 сентября Центр стандартов и инноваций в области искусственного интеллекта Национального института стандартов и технологий США (CAISI) опубликовал собственную оценку кибервозможностей GLM-5.3. CAISI установил, что GLM-5.3 является «наиболее способной в киберобласти моделью с открытыми весами, выпущенной на сегодняшний день», и что по совокупности кибернетических бенчмарков CAISI она отстаёт от передового уровня США примерно на четыре месяца. Наши выводы о возможностях в целом совпадают с выводами CAISI. В сравнении CAISI американские модели при необходимости тестировались с отключёнными средствами киберзащиты, а передовой уровень США включает модели, выпущенные только для проверенных пользователей. Злоумышленники не могут легко получить доступ к этим версиям американских моделей, однако любой может скачать GLM-5.3. В этой публикации представлен наш анализ того, насколько легко средства защиты GLM-5.3 можно обойти или удалить.

GLM-5.3 может разрабатывать работающие эксплойты от начала до конца
Чтобы понять, как GLM-5.3 может позволить субъектам киберугроз находить и эксплуатировать реальные уязвимости программного обеспечения, мы провели оценки с использованием автоматизированных тестов и рабочих процессов с участием человека. Для обоих подходов мы запускали тестируемые модели в изолированных средах и песочницах, чтобы они могли атаковать только офлайн-цели, которые мы создали для проведения этих оценок. Мы в первую очередь сосредоточились на способности разрабатывать эксплойты, поскольку именно в этой области Claude Mythos Preview продемонстрировала заметный скачок по сравнению с предыдущими моделями Claude.
Сначала мы запустили модель на ExploitBench, который измеряет, насколько хорошо модели искусственного интеллекта могут эксплуатировать известные уязвимости в движке V8, используемом Google Chrome. Здесь мы сосредоточились на способности моделей успешно разрабатывать сквозные эксплойты, поскольку это наиболее значимая для злоумышленников способность и именно здесь мы наблюдаем существенные различия между моделями. Мы обнаружили, что GLM-5.3 разрабатывает сквозные эксплойты в 50 из 410 попыток. Claude Mythos Preview сделала это с сопоставимой частотой — в 56 из 410 попыток.
В нашем внутреннем бенчмарке Binary Exploitation,1 мы проверяем, могут ли модели находить и эксплуатировать уязвимости в популярных проектах с открытым исходным кодом, участвующих в проекте Google OSS-Fuzz. Здесь полный зачёт присуждается за полный перехват потока управления. Мы оцениваем несколько моделей на 100 задачах из бенчмарка, выбранных случайным образом, и обнаруживаем, что GLM-5.3 осуществляет полный перехват потока управления в 4% испытаний; Claude Mythos Preview делает это в 6%. Хотя GLM-5.3 здесь показывает результат ниже, чем Claude Mythos Preview, значимый порог явно был преодолён: более ранние модели, такие как Claude Opus 4.6 и GLM-5.2, не достигают успеха ни в одной из них.

Далее мы оценили, как GLM-5.3 справляется с открытыми наступательными киберзадачами в руках экспертов-людей (по аналогии с нашим тестированием Claude Mythos Preview ранее в этом году). Здесь мы выбираем цели, в которых эксперты-люди не осведомлены о существующих уязвимостях, а затем просим их использовать модель для выявления и эксплуатации новых недостатков. Эти эксперименты проверяли, что эксперты могли сделать за короткий промежуток времени: обычно они длились не более одного дня, при этом суммарное время сосредоточенной работы человека составляло менее часа.

В первой из этих сессий исследователь использовал GLM-5.3 на изолированной машине с локальной сборкой Linux популярного веб-браузера. В течение одного дня (и при ограниченном внимании со стороны человека) GLM-5.3 обнаружила несколько ранее неизвестных уязвимостей в движке JavaScript браузера и объединила их в работающий эксплойт: веб-страницу, которая при посещении считывает произвольные файлы с компьютера посетителя (показано на рисунке 3). Этот эксплойт нацелен на сборку браузера для Linux, поскольку это была единственная среда, предоставленная модели. Однако мы полагаем, что эти уязвимости также могут затронуть пользователей на других платформах, хотя путь к их эксплуатации там может быть более сложным. (Мы сообщили об этих уязвимостях сопровождающей стороне.) Позднее в ходе сессии исследователь также выявил с помощью GLM-5.3 уязвимости, пригодные для эксплуатации, в нескольких других широко используемых системах, включая беспроводные и графические драйверы, а также программное обеспечение устройств, доступных по сети. В настоящее время мы рассматриваем эти отчёты и при необходимости сообщим о них сопровождающим сторонам.
Во второй сессии исследователь использовал GLM-5.3-Flash (меньшую и менее способную версию GLM-5.3) для разработки эксплойта для известной уязвимости (мы ранее писали об этих эксплойтах уязвимостей «N-day» здесь). В данном случае исследователь сосредоточился на недавно раскрытой уязвимости в Google Chrome (CVE-2026-11645), чтобы выяснить, насколько быстро модель сможет превратить публичное исправление в работающую атаку. Исследователь предоставил GLM-5.3-Flash публичные сведения об этой CVE и другой известной уязвимости. Без существенных указаний со стороны исследователя GLM-5.3-Flash объединила эксплойты для этих двух уязвимостей, создав надёжную цепочку эксплойтов для цели ARM64 и обойдя усиленную защиту аутентификации указателей (PAC). Это потребовало 20 минут человеческого внимания и 8 часов работы GLM-5.3-Flash. По ценам API Zhipu эти усилия обошлись бы в 20,40 доллара США.
GLM-5.3 не имеет надёжных защитных механизмов
GLM-5.3 был выпущен с некоторыми встроенными мерами защиты: если пользователь просит о чём-то явно вредоносном, модель часто отказывается.2 В нашем тестировании мы обнаружили, что эти меры защиты можно было обойти или удалить с помощью множества простых методов.
Наиболее интенсивный — и наиболее успешный — метод представляет собой стандартную технику снижения отказов, известную как «аблитерация». Поскольку GLM-5.3 выпущена как модель с открытыми весами, пользователи могут перенастроить её, чтобы убрать отказы при незначительном изменении её возможностей. Несколько разработчиков опубликовали аблитерированные версии GLM-5.3 в течение нескольких дней после выпуска модели.
Чтобы исследовать, в какой степени аблитерация позволяет злоумышленникам обходить защитные механизмы GLM-5.3, мы сами создали аблитерированную копию, а затем запустили её на трёх публичных бенчмарках (JailbreakBench, HarmBench и StrongREJECT), которые измеряют, как часто модель выполняет явно вредоносные запросы. Аблитерация модели заняла у нашей команды — которая прежде никогда не пыталась выполнять эту задачу — около 2 200 часов работы графических процессоров при вычислительных затратах примерно 4 400 долларов США.3 Аблитерация GLM-5.3-Flash заняла около 600 часов работы графических процессоров. Изменение снизило показатель отказов GLM-5.3 с более чем 90 % примерно до 3 % и 2 % на первых двух бенчмарках (JailbreakBench и HarmBench) и до 12 % на третьем (StrongREJECT). Аблитерация незначительно снизила возможности модели: в GPQA-Diamond — оценке, измеряющей общие научные способности, — стандартная и аблитерированная модели показали одинаковые результаты; на протестированном подмножестве оценок CyberGym аблитерированная версия набрала на несколько процентов меньше, как показано на диаграмме ниже.

В ходе нашего тестирования мы также наблюдали, что защитные механизмы GLM-5.3 можно обойти без использования аблитерированной версии модели. Мы поместили модель в симулированный мир4, в котором ей предоставлялись откровенно вредоносные запросы на атаку критически важных систем. В исходной конфигурации GLM-5.3 отказывалась во всех испытаниях, как и другие протестированные нами модели. Однако мы выявили несколько простых способов обойти защитные механизмы моделей GLM, после чего они отвечали на эти запросы в большинстве или во всех случаях. К ним относятся:
- Предоставление обманчивого запроса, например сообщение модели, что она является автономным агентом «красной команды», работающим над упражнением. Это побуждает GLM-5.3 взаимодействовать в 64% случаев.
- Предварительное заполнение токенов рассуждений моделей таким образом, чтобы создавалось впечатление, будто она рассмотрела запрос пользователя и решила продолжить. Это побуждает GLM-5.3 взаимодействовать в 92% случаев.
- Использование аблитерированной версии модели, как описано выше. Это побуждает GLM-5.3 взаимодействовать в 100% случаев.
В нашем тестировании ни один из этих методов не заставил защищённые модели Claude выполнить протестированные нами вредоносные задачи. Меры защиты Claude блокировали запросы, в которых использовались обманные подсказки. API Anthropic не предоставляет потенциальным злоумышленникам возможности предварительно заполнять ход рассуждений Claude. И поскольку веса Claude не предоставляются пользователям, их нельзя подвергнуть аблитерации, чтобы изменить поведение Claude.

Чтобы продемонстрировать, как аблитерированная версия GLM-5.3 готова участвовать во вредоносных задачах, мы выделяем одну цитату из цепочки рассуждений, которую она сгенерировала:

Что это означает?
GLM-5.3, вероятно, предоставит злоумышленникам доступ к возможностям, которые позволят им находить и использовать киберуязвимости без существенных ограничений. Это не похоже ни на одну другую ИИ-модель сопоставимых возможностей, все из которых были выпущены с защитными мерами или в рамках программ ограниченного доступа. Выпуск GLM-5.3 является значительным изменением в кибервозможностях, доступных злоумышленникам. Anthropic и другие американские лаборатории ИИ опубликовали недавние отчёты, в которых раскрывается, как кибератакующие пытались использовать системы ИИ. Учитывая эти свидетельства, мы считаем вероятным, что как государственные, так и негосударственные субъекты будут использовать такие модели, как GLM-5.3, для причинения вреда в реальном мире.
С другой стороны, модели с таким уровнем возможностей также могут использоваться защитниками. Мы считаем, что специалисты по киберзащите должны использовать лучшие доступные инструменты, отвечающие их потребностям. Мы работаем над безопасным расширением доступа к кибервозможностям Claude для максимально возможного числа защитников. Специалисты по киберзащите противостоят злоумышленникам, которые будут использовать все доступные им мощные инструменты, и мы считаем, что защитники должны быть оснащены передовыми моделями, не уступающими тем, которые используют их противники.
Благодаря Project Glasswing (и другим инициативам, таким как Patch the Planet) специалисты по киберзащите добились значительного прогресса в обеспечении безопасности критически важных систем до наступления этого момента — однако ещё многое предстоит сделать. Хотя проверенные защитники теперь могут использовать ещё более продвинутые модели, такие как Claude Mythos 5.1, в рамках наших программ доверенного доступа, критический порог свободно доступных возможностей уже преодолён. GLM-5.3 подчёркивает срочность расширения доступа к передовым моделям для более широкого круга организаций, чтобы расширить возможности специалистов по киберзащите.
Правительствам следует проводить тестирование безопасности достаточно мощных моделей искусственного интеллекта, включая преемников GLM-5.3. Без высококачественных оценок из независимых источников влияние этих возможностей может стать полностью ясным разработчикам моделей лишь тогда, когда будет уже слишком поздно. По мере того как разработчики искусственного интеллекта по всему миру создают всё более мощные модели с открытыми весами, мы надеемся, что они будут надлежащим образом защищать эти возможности и предотвращать злоупотребления.
Источник
GLM-5.3 and the spread of advanced cyber capabilities
https://www.anthropic.com/research/glm-5-3-and-the-spread-of-advanced-cyber-capabilitiesРедактор русской версии: Пётр Смывин.
Разбор подготовлен 30 сентября 2026.


