0%прочитано

Разбор публикации

Как Claude Tag стал первым помощником Anthropic при сбоях непрерывной интеграции и непрерывной доставки

10 мин чтения Оригинал на claude.com

Полный перевод статьи из блога Claude на русский. Оригинал — по ссылке.

ПОДКАСТ

Настройте собственного Claude для дежурств с помощью нашего набора для настройки.

Несколько недель назад я был на дежурстве, и мой коллега написал мне в Slack в 22:00: примерно 44 теста в новом сервисе не запускались.

Раньше я бы отложил то, чем занимался, сел за ноутбук, устало вздохнул и начал бы часовой процесс расследования и исправления. Но теперь мой рабочий процесс совершенно другой: я подключаю @Claude и спрашиваю, что он видит. 

В этом случае Claude обнаружил, что тесты исчезли, когда тем утром включили флаг функции, а также что откатить изменение будет безопасно. Я попросил коллегу откатить флаг. Claude написал мне в Slack через 3 минуты, чтобы подтвердить, что правила пропуска действительно были удалены, а частота ошибок вернулась к базовому уровню.

Последние несколько месяцев Claude Tag был первым дежурным реагирующим на сбои CI/CD в Anthropic. Это не только помогло нашей социальной жизни, но и обеспечило каждому инциденту CI мгновенного первого реагирующего: Claude подготовил первый отчёт о ситуации в каждом недавнем инциденте, где такой отчёт был, обычно публикуя свой первый анализ в течение 15 минут.

В этой статье мы разберём, что мы создали и как это работает, чтобы Вы могли создать это самостоятельно и перестали бояться своей очереди в ротации.

Наша настройка дежурства Claude

Прежде чем мы перейдём к каждому этапу процесса реагирования на инциденты, я дам здесь общий обзор нашей настройки, чтобы Вы держали в голове общую картину, пока мы будем заполнять детали.

Дежурному агенту нужна память, чтобы он помнил, что уже было сделано; подключения и доступ, чтобы он мог расследовать, понимать и действовать; расписания, чтобы он знал, когда возвращаться к работе; и инструкции, чтобы он знал, что делать.

Claude Tag — основа нашего дежурного агента. Claude Tag сохраняет память в нашем дежурном канале Slack и интерфейсе, чтобы предоставлять инструкции для каждого хода во время инцидента. Claude также реагирует в режиме реального времени на события в дежурном канале и других каналах. Планирование процедур, или регулярных действий, которые выполняет Claude, также происходит в этом канале с помощью подсказок на естественном языке, например «выполняй передачу смены по непрерывной интеграции каждый понедельник в 9:00 утра по восточному стандартному времени».

У Claude Tag есть собственная служебная учетная запись и доступ к инструментам, которые нужны инженеру Anthropic по непрерывной интеграции, таким как Datadog или Grafana. Это было один раз настроено администратором для канала (вот как это сделать).

Помимо дежурного канала, мы настроили Claude на отслеживание других релевантных каналов, в которых Claude Tag также является участником, чтобы он мог получать дополнительный контекст, например оповещения о сервисах, изменения конфигурации или обновления по запросам на включение изменений.

Постоянные инструкции находятся в Markdown-файлах в виде навыков, зафиксированных в репозитории GitHub. Так несколько коллег по команде могут дорабатывать их, а мы можем управлять изменениями так же, как делаем это с кодом. В них также включена ключевая информация, например инструкции по маршрутизации, политики и журнал усвоенных уроков как часть цикла самоулучшения.

Такая настройка заняла у нас часы, а не дни. Мы создали обобщенный набор для настройки дежурств в GitHub, который может помочь Вам начать работу с похожим агентом. Он преобразует собственную историю инцидентов Вашей команды в сценарии сортировки обращений и оставляет в Вашем канале инцидентов Claude с доступом только для чтения, который диагностирует, эскалирует и учится. Вы можете посмотреть, как он работает с историей вымышленной команды примерно за десять минут.

Если подытожить шаги в формате «слишком длинно; не читал»

  • Вам понадобится тарифный план Claude Team или Claude Enterprise
  • Владелец организации должен добавить Claude в дежурный канал Slack с помощью Claude Tag
  • Владелец организации также должен помочь подключить Claude в дежурном канале Slack к соответствующим коннекторам, репозиторию GitHub и настроить Claude Code Remote.
  • Добавьте Claude в Ваш канал инцидентов и поручите ему отслеживать инциденты и немедленно выполнять первичный анализ

Теперь рассмотрим подробнее, как выглядит эта трансформация на каждом этапе инцидента.

Обнаружение

Claude меняет не только то, как Вы реагируете на инциденты, но и то, как Вы их изначально обнаруживаете. Ранее существовали два основных сценария сбоя при обнаружении инцидентов. 

Людям трудно всегда заранее задавать идеальные правила с идеальными пороговыми значениями. Это особенно сложно, когда у Вас недостаточно данных для анализа закономерностей трафика.

Чтобы решить эту проблему, мы поручаем Claude анализировать данные и входящие оповещения в течение первых нескольких дней работы нового сервиса, чтобы предлагать дополнительные правила и точно настраивать те, которые являются слишком широкими или узкими. 

Вторым основным типом сбоя при обнаружении инцидентов была усталость от оповещений: проверять и оценивать каждое сработавшее оповещение утомительно. Однако Claude не устает так же, как человек. 

Claude отслеживает каждое релевантное оповещение в каждом канале оповещений и проходит по критериям в корневом файле oncall.md, чтобы определить, может ли это подождать до утра или дежурному нужен вызов. Например, после настройки на основе анализа данных правило в файле могло бы быть таким: «Если частота ошибок превышает 2% дольше 5 минут И это не известное окно развертывания, вызовите дежурного, иначе запишите это в lessons.md».

Есть еще два способа, которыми может запускаться процесс оповещения дежурного Claude:

  • Участник команды непрерывной интеграции может сообщить о проблеме в канале дежурного, как это было в первом примере с 44 отсутствующими тестами; или  
  • Любой сотрудник компании может открыть инцидент через внутреннюю страницу. Если он отмечен как инцидент инфраструктуры непрерывной интеграции, то для этого инцидента создается канал Slack, и наш дежурный Claude подхватывает его.

Главный вывод здесь в том, что процесс оповещения детерминирован, тогда как эскалация дежурному имеет как детерминированные, так и агентные пути. 

Триаж

Одно дело — поручить Claude фильтровать шум оповещений, но настоящая экономия появляется на этапе расследования. Claude публикует свой первый анализ, основанный на доказательствах, медианно через 14 минут после открытия инцидента, а в самых быстрых случаях указывает первопричину в течение 4 минут в своем первом отчете.

Когда оповещение эскалировано до инцидента, Claude часто уже готов в нашем канале Slack с гипотезой, основанной на доказательствах, которую мы можем рассмотреть. Claude Tag запускает динамический рабочий процесс с агентом оркестрации, который создает исполнительные субагенты для расследования каждой зависимости и источника истины. 

Для нас это Grafana, наше хранилище журналов, PagerDuty, GitHub, Kubernetes и каналы инцидентов Slack — все они подключены через MCP Connectors. Claude может параллельно отслеживать несколько направлений, помогая сократить среднее время до устранения.

Исполнители передают результаты агенту-оркестратору, который обобщает и выводит информацию в виде связной ситуационной сводки. 

Агенты-оркестратор и исполнители не ищут вслепую. Они руководствуются навыком расследования с более подробными справочными Markdown-файлами для каждого класса ошибок

Например, навык расследования для ошибок теневого расхождения объёмом 617 строк кодирует каждый шаг, который я выполняю во время типичного расследования. Я создал его, устраняя неполадки с Claude по шагам во время одного из инцидентов, а затем поручил ему создать файл на основе этого опыта.

Lessons.md также направляет устранение неполадок Claude. Этот Markdown-файл — текущий журнал каждого инцидента, который мы разрешили: что произошло, первопричина, исправление и нюанс, о котором стоит помнить. Claude автоматически добавляет записи в него самостоятельно. Каждое новое расследование начинается с его чтения, поэтому первая гипотеза Claude основывается на том, что происходило недавно. 

Если один и тот же шаблон проявляется достаточно часто, мы включаем его в сам навык расследования. Моя любимая запись — та, которую Claude написал обо мне. Я сделал предположение на основе файла конфигурации, прежде чем проверить метрики, и теперь в файле lessons.md сказано: «сначала запрашивайте данные, затем стройте теории. Конфигурация показывает, что могло пойти не так; метрики показывают, что пошло не так».

Даже с этими инструментами и контекстом Claude не всегда справляется правильно с первого раза. Человеческая интуиция и опыт имеют значение. Claude Tag позволяет команде устранять неполадки при инцидентах в многопользовательском режиме. Любой из нас может направлять расследование или добавлять гипотезу в реальном времени, совместно.

Устранение

Если Claude может эскалировать оповещения и устранять их причины, может ли он также их исправлять? Ответ на этот вопрос будет различаться от команды к команде, но вот как мы это делаем.

Большинство развёртываний в нашей команде происходит за флагом функции. Я создал отдельного агента в Claude Code с моими разрешениями, способного выполнять прогрессивное развёртывание за каждым из этих флагов функции.

Первый этап нашего процесса развёртывания обычно включает управление канареечным трафиком со стороны Claude, мониторинг проблем и автоматическое увеличение или уменьшение доли трафика для заданного флага функции. Это могло бы быть темой отдельной статьи, поэтому здесь я не буду вдаваться в подробности.

Другие пути разрешения проблем, с которыми Claude Tag помогает моей команде:

  • Сообщает нам, нужно ли вывести из обслуживания или изолировать определённые секции нашего кластера Kubernetes;.
  • Даёт нам инструкции о том, как масштабировать часть нашей инфраструктуры в ответ на всплески спроса — это случается редко, но очень полезно, когда Claude возвращается с точным описанием того, что мы можем сделать для смягчения последствий; и, чаще всего,
  • Исправления в виде PR, который дежурный может проверить, объединить, а затем развернуть для быстрого разрешения проблемы.

Проверка, коммуникация и передача дежурства

Claude использует многие из тех же коннекторов MCP и инструментов, что и при расследовании, чтобы убедиться, что исправление сработало так, как задумано. В рамках постоянных инструкций в oncall.md он пишет посмертный разбор в lessons.md и для SITREP при передаче дежурства.

Чтобы передавать полную картину по нескольким инцидентам, мы создали агента под названием ci-weather. Он собирает информацию из каждого Slack-канала инцидента, метрики сборок, статистику очереди слияний и задержку развёртывания. Затем он публикует отчёт в стиле редакционной сводки в одном публичном канале, который может читать любой сотрудник компании. Теперь наши инженеры могут ссылаться на этот канал, вместо того чтобы писать нам, когда они пытаются определить, стоит ли им приостановить свои слияния или ответить на вопрос «что не так с непрерывной интеграцией?».

Одно честное замечание: нам пришлось несколько раз доработать формат отчёта. Claude может с первой попытки создать навык, который генерирует отчёт о статусе, но читабельным его делает вкус конкретной команды. Это человеческая коммуникация, а не техническая обвязка.

Наконец, хотя Claude ведёт для себя журнал в lessons.md, мы также хотим каждый понедельник создавать отчёты для передачи дел людям. Claude создаёт ежедневные и еженедельные сводки, чтобы один член команды мог продолжить с того места, где остановился другой.

От мониторинга инцидентов к мониторингу системы реагирования на инциденты

Наши инженеры-программисты в среднем выпускают в 8 раз больше кода за квартал, чем они выпускали с 2021 по 2025 год. И хотя мы сохранили высокую планку качества (у каждого PR есть назначенный владелец-человек, каждое изменение требует одобрения для слияния, каждое изменение проходит через один и тот же набор проверок CI), единственный способ поспевать за агентным программированием — агентный CI.

Claude взял на себя утомительные части моей работы, внерабочие сбои и коммуникации по инцидентам, позволив мне сосредоточиться на среднесрочных и долгосрочных архитектурных изменениях, которые действительно повышают надежность системы. 

Лучшее в том, что мы создали, — это то, что оно не ощущается разрозненным. Наши процессы дежурства находятся в Slack, но теперь Claude присоединился к каналу.

Как начать:

  • Вам понадобится план Claude Team или Claude Enterprise
  • Владелец организации должен добавить Claude в дежурный канал Slack через Claude Tag
  • Владельцу организации также нужно помочь подключить Claude в дежурном канале Slack к соответствующим коннекторам, репозиторию GitHub и настроить Claude Code Remote.
  • Добавьте Claude в Ваш канал для инцидентов и поручите ему отслеживать инциденты и немедленно проводить первичную оценку

Настройте собственного дежурного Claude с помощью нашего комплекта для настройки.

Эта статья была написана Сачином Малхотрой, техническим сотрудником Anthropic, при участии Майкла Сегнера, сотрудника Anthropic.

Источник

How Claude Tag serves as Anthropic’s first responder for CI/CD failures

https://claude.com/blog/ai-ci-cd-on-call

Редактор русской версии: Пётр Смывин.

Разбор подготовлен 19 августа 2026.

Другие разборы

Все материалы
22 августа 2026 Практическое руководство по жизненному циклу разработки программного обеспечения, изначально ориентированному на искусственный интеллект Главная мысль статьи: написание кода перестало быть основным узким местом, потому что агентные инструменты искусственного интеллекта могут создавать код намного быстрее, чем традиционные процессы разработки способны планировать, проверять, согласовывать и выпускать изменения. 22 августа 2026 Расширение доступа защитников к возможностям кибербезопасности Claude Mythos 5 Claude Mythos 5 становится доступен в Claude Security для клиентов Claude Enterprise и вскоре будет интегрирован в инструменты партнеров по киберзащите, чтобы больше команд могли использовать передовые модели для поиска уязвимостей и подготовки исправлений. 21 августа 2026 Как monday.com преобразовала свою платформу в продукт, ориентированный на агентов, где люди и искусственный интеллект работают вместе monday.com перестроила свою платформу вокруг модели совместной работы людей и агентов искусственного интеллекта, отказавшись от простого добавления отдельных функций искусственного интеллекта к существующим рабочим процессам.

Хотите, чтобы вас рекомендовал ChatGPT?

Бесплатный аудит. Покажем, где сайт уже виден ИИ — и где теряете клиентов.

Без подписки PDF за 24 часа Краснодар · вся Россия
Получить GEO-аудит