0%прочитано

Разбор публикации

Как Warp создает самоулучшающихся агентов на Claude

8 мин чтения Оригинал на claude.com

Полный перевод статьи из блога Claude на русский. Оригинал — по ссылке.

ПОДКАСТ

В нашей серии, , мы показываем, как стартапы трансформируют свои отрасли с помощью ИИ. В этой статье мы рассказываем, как Warp превратила пользовательскую обратную связь без сохранения состояния в цикл самосовершенствования для своих агентов.

Агентам необходимо надежно и эффективно обрабатывать повторяющиеся задачи. Первоначальный промпт, который правильно выполняет 80 % задачи, может создавать шумный и раздражающий пользовательский опыт. Warp усвоила это на собственном опыте и использовала это для формирования своей продуктовой стратегии, создав улучшенный опыт для почти одного миллиона разработчиков по всему миру.

Warp, терминал на базе ИИ и агентная среда разработки, построена на платформе Claude. Команда столкнулась с этой проблемой «шумного опыта» со своим внутренним агентом для проверки кода. Инженеры жаловались, что их агент оставлял бесполезные комментарии и выдавал низкокачественный результат.

Сначала команда пробовала временные решения, например вручную переписывала промпт на основе наблюдаемых неудач при проверке кода. Это сделало результат более пригодным к использованию, но не масштабировалось. Улучшение контекстных файлов, таких как AGENTS.md, также помогло, но было далеко не полноценным исправлением.

В конечном счете они поняли, что настоящая проблема заключалась в том, что обратная связь для агента, независимо от ее цели, обычно исчезает после завершения сеанса, удаляя критически важный контекст из агентного цикла. Их решение — фреймворк на основе навыков агента для создания самоулучшающихся агентов, в котором обратная связь накапливается со временем, чтобы постоянно дорабатывать и улучшать результаты работы агента.

Читайте дальше, чтобы узнать, как они создали его с помощью навыков поверх платформы Claude.

Циклы самоулучшения агентов, построенные на навыках

Центральная техника — цикл самоулучшения с использованием навыков, которые представляют собой файловые кодирования знаний, удерживающие инструкции за пределами необработанного промпта. Warp развила архитектуру самоулучшающегося агента, состоящую из двух навыков, с обратной связью от человека между ними.

Внутренний/базовый навык крашение strong> содержит функциональные знания предметной области и инструкции. Например, когда открывается запрос на включение изменений, кодовый агент Warp выполняет работу, используя этот базовый навык и контекст, чтобы подготовить свою проверку.

Обратная связь от человека <крашение strong>по результату работы агента — критически важный компонент цикла самоулучшения. Для проверки кода это может быть что-то настолько простое, как одобрение, но чем более явно, тем лучше. 

 «Человек мог бы подтвердить: «это был хороший, полезный комментарий», — объясняет основатель Warp Зак Ллойд. — Но человек также мог бы подробно указать причины, по которым проверка кода была неудачной. Конкретика вроде «Вы предложили переименовать эту переменную, но в нашей кодовой базе принято, что для такого типа глобальной переменной используется именно такой контекст именования», подсказывает агенту, как в следующий раз сделать правильно».

Внешний/улучшающий навык крашение strong> работает как агент-наблюдатель, который запускается по расписанию, а не для каждой задачи. Он извлекает накопленную обратную связь от людей, сравнивает то, что предложил агент, с тем, как отреагировали люди, и предлагает небольшую, точечную правку базового навыка.

Поскольку навыки — это обычные файлы, агенты исключительно хорошо их обновляют. Эти обновления, которые можно проверять, утверждать и сливать, могут проходить через обычный рабочий процесс PR/ревью кода; после слияния следующий запуск внутреннего навыка наследует улучшение. 

Теперь Warp применяет этот шаблон во всем своем репозитории с открытым исходным кодом, с отдельными агентами для написания спецификаций, проверки и сортировки, каждый из которых несет собственный цикл самоулучшения.

«Файловые навыки — это способ кодирования знаний для агентов без помещения этих знаний непосредственно в промпт, как нечто, к чему агент может просто обратиться в ходе выполнения своей работы», — говорит Зак. «Фреймворк на самом деле очень прост: есть базовый предметно-специфический навык, а затем есть навык-улучшатель, который дорабатывает этот предметно-специфический навык. В этой простоте и заключается красота такого подхода».

Как писать самоулучшающиеся навыки для агентов

Вот несколько проверенных на практике советов команды Warp по написанию самоулучшающихся навыков для агентных циклов: 

  • Пишите принципы, а не правила. «Создавайте навык так, будто Вы инструктируете умного человека, а не программируете компьютер, — говорит Зак. — Включение в навык указаний вроде „Ищите повторяющийся код“ дает более точное направление, чем исчерпывающие правила именования переменных».
  • Объясняйте почему. Предоставление обоснования правила позволяет агенту рассуждать о проблеме вместо того, чтобы следовать жестким инструкциям, что, в свою очередь, обеспечивает лучшую обобщаемость.
  • Сделайте так, чтобы обратную связь было легко давать. Собирайте ее там, где люди уже работают, например через комментарии непосредственно к запросу на включение изменений или задаче. Кроме того, сделайте так, чтобы это происходило автоматически, без дополнительного этапа отправки. «Низкий уровень трения — это то, что поддерживает поток сигнала, — отмечает Зак. — Если Вы слишком усложните процесс, Вы не получите обратную связь и не сможете улучшить навык».
  • Держите навыки небольшими и используйте постепенное раскрытие. Хороший навык не является большим; он ссылается на файлы ресурсов и скрипты, а не выгружает все в контекст сразу. 
  • Качество обратной связи > количество, но количество помогает. Небольшой объем подробной, относящейся к конкретной предметной области обратной связи от старшего инженера может быть ценнее, чем большое количество поверхностной обратной связи, потому что бинарная оценка «палец вверх\/вниз» не говорит, почему. «Можно получить действительно хороший сигнал даже из относительно небольшой выборки, если это очень подробная обратная связь от человека по знаниям конкретной предметной области, которые агент иначе никак не смог бы получить», — продолжает Зак. «При этом чем больше корпус качественного сигнала, тем лучше. В Warp мы используем цикл для управления всем нашим репозиторием с открытым исходным кодом. У нас сотни людей вносят вклад, и мы проводим тысячи код-ревью».
  • Приложите дополнительные усилия к навыку улучшателя. Дополнительные усилия при написании навыка улучшателя (агента-наблюдателя) окупаются не только в непосредственном цикле агента, потому что навыки улучшателя очень хорошо переиспользуются в разных сценариях использования. «За пределами компонента предметно-специфических знаний это довольно переиспользуемый механизм — навык улучшателя для агента проверки кода не так уж отличается от навыка улучшателя для любого другого агента».

Цикл в действии: агент Warp для сортировки задач

Агент Warp для сортировки задач демонстрирует фреймворк самоулучшающихся навыков агента. Паттерн запускается всякий раз, когда кто-то создает новую задачу GitHub: GitHub Action запускает агента, который анализирует задачу на сложность и осуществимость, назначает метки и предлагает направление для исправления. Этот агент сортировки работает на основе внутреннего файла навыков, содержащего предметные знания о том, что означает каждая метка и как исследовать кодовую базу перед действием.

В примере задачи внутренний навык первого этапа хорошо справился с работой, но пропустил одну метку — «готово к спецификации», которая указывает, что участник может начать создавать продуктовые и технические спецификации по этой задаче. Сопровождающий из команды Warp заметил этот пробел и оставил отзыв прямо в задаче — именно там, где велась работа. Что особенно важно, он объяснил и то, чего ожидал, и то, почему он этого ожидал: практический отзыв, который агенту будет легко усвоить позже.

Внешний навык-улучшатель работает в Oz, платформе Warp для оркестрации агентов как агент «сортировки обновлений», запускаемый по расписанию. Агент прошёл аутентификацию в GitHub, запустил сценарий Python, включённый в состав навыка, чтобы извлечь недавние задачи с отзывами, свёл их в файл JSON и считал его обратно в контекст. Сам включённый сценарий является передовой практикой; навыки могут ссылаться на файлы ресурсов вместо того, чтобы писать новый код при каждом запуске.

Оттуда агент определил конкретные сигналы обратной связи в комментариях сопровождающего и предложил минимальное изменение, которое их учитывало. Он открыл запрос на включение изменений, редактирующий внутренний навык так, чтобы применять метку "готово к спецификации", когда задача описывает реальную проблему, даже если точная форма пользовательского интерфейса или пользовательского опыта еще не определена. 

Поскольку все обновление представляет собой файл навыка, оно проходит через обычный рабочий процесс проверки кода. Запрос на включение изменений поступил с описанием, объясняющим, какие сигналы побудили внести изменение и что оно изменило. Человек проверяет, одобряет и выполняет слияние, а следующий запуск навыка сортировки наследует новое знание. Этот финальный человеческий шаг замыкает цикл и сохраняет за человеком контроль над тем, что действительно меняется.

Это тот же механизм, который Warp теперь запускает в масштабе во всем своем репозитории с открытым исходным кодом, где агенты написания спецификаций, агенты проверки и агенты сортировки каждый имеют собственный цикл самосовершенствования. 

Любой агент, независимо от своей задачи, со временем становится лучше, если Вы с самого начала встраиваете в него один из таких циклов, чтобы фиксировать сигналы человеческой обратной связи, превращать их в обновления навыков и развивать агентов из разовых помощников в способные системы, которые накапливают эффект во всей Вашей организации.

Посмотрите полный вебинар с демонстрацией в реальном времени и более подробным обсуждением того, как Warp использует Claude для создания агентов, которые учатся на обратной связи команды и со временем самосовершенствуются.

Начните создавать на платформе Claude уже сегодня.

Источник

How Warp builds self-improving agents on Claude

https://claude.com/blog/how-warp-builds-self-improving-agents-on-claude

Редактор русской версии: Пётр Смывин.

Разбор подготовлен 27 августа 2026.

Хотите, чтобы вас рекомендовал ChatGPT?

Бесплатный аудит. Покажем, где сайт уже виден ИИ — и где теряете клиентов.

Без подписки PDF за 24 часа Краснодар · вся Россия
Получить GEO-аудит