0%прочитано

Разбор публикации

Снижение затрат и повышение производительности с Claude Platform

12 мин чтения Оригинал на claude.com

Полный перевод статьи из блога Claude на русский. Оригинал — по ссылке.

ПОДКАСТ

Производительность и стоимость часто рассматриваются как компромисс: чтобы тратить меньше, Вы соглашаетесь на худшие результаты. На практике мы обнаружили, что многие приложения, использующие платформу Claude, могут сократить расходы без снижения производительности с помощью трёх исправлений: максимально повысить частоту попаданий в кэш промптов, устранить антипаттерны из Ваших промптов при переходе на передовые модели Claude и соотнести усилия с задачей. Мы включили эти рекомендации в claude-api skill. В этой статье мы покажем, как Claude Code с claude-api часто может находить способы сократить расходы, сохраняя или повышая производительность.

Кэш промптов

Прежде чем Claude сгенерирует ответ, он сначала обрабатывает Ваш запрос во внутреннее рабочее состояние. Этот этап, называемый предзаполнением, является затратной частью обработки входных данных. Кэширование запросов сохраняет это состояние (кэш «ключ—значение», или KV): когда запрос начинается с того же префикса, Claude считывает его вместо повторного вычисления. Чтение из кэша оплачивается по части полной стоимости входных данных.

Чтобы эффективно использовать кэш запросов, необходимо учитывать несколько практических аспектов. Во-первых, кэш запросов привязан к конкретной модели. Во-вторых, чтение из кэша запросов должно быть побайтно точным на всём протяжении запроса. Наконец, кэш запросов имеет ограниченное время хранения (TTL).

С учётом этих моментов приведём несколько практических рекомендаций:

  • Не изменяйте настройки усилий или размышлений в середине разговора. Эти настройки добавляются в подсказку перед Вашим содержимым, поэтому они являются частью кэшированного префикса. В частности, с Claude Opus 5 и Fable 5.1 Вы можете обновлять усилия в середине разговора, не нарушая кэш.
  • Не включайте изменчивые значения в префикс. Динамическая временная метка или идентификатор в системной подсказке может изменяться между вызовами модели и нарушать кэш. 
  • Избегайте определений инструментов, которые меняют свой порядок. При использовании Claude Messages API подсказка собирается в фиксированном порядке, при этом определения инструментов размещаются вверху. Любое изменение определения инструмента нарушит кэш. 
  • Будьте осторожны при разветвлении разговоров. Подагенты и ветви используют общий кэш родительского разговора только тогда, когда префикс разветвления побайтно идентичен, используется та же модель и те же усилия. 
  • Избегайте синхронных вызовов инструментов и подагентов, которые работают дольше срока действия кэша. Если агент блокируется на длительном вызове инструмента или подагенте, срок действия кэша может истечь до получения результатов. При следующем ходе необходимо будет заново записать кэш по цене, в 1,25 раза превышающей обычную стоимость входных данных, а для кэша сроком на 1 час — в 2 раза, вместо низкой цены чтения.

Как это исправить

Мы накопили несколько уроков по управлению кэшем промптов: 

  • Тщательно отслеживайте показатель попаданий в кэш промптов. Claude Console предоставляет диагностику кэша промптов, включая причины промахов кэша промптов (рисунок 1). Если количество попаданий неожиданно снижается, API диагностики кэша точно сообщает, в каком месте два запроса разошлись.
Рисунок 1. Claude Console может диагностировать неожиданные промахи кэша промптов, сравнивая последовательные запросы и точно определяя, где префикс промпта разошёлся.
  • Откладывайте редко используемые инструменты. Объявите все свои инструменты заранее, но пометьте редко используемые как defer_loading: они остаются за пределами кэшируемого префикса и добавляются в беседу только тогда, когда Claude находит их с помощью поиска инструментов, поэтому кэш сохраняется.
  • Применяйте обновления системного промпта в виде сообщений. Платформа Claude позволяет Вам добавить системную инструкцию в виде сообщения в середине беседы вместо редактирования системного промпта, что сохраняет кэш.
  • Структурируйте запрос так, чтобы стабильная часть оставалась стабильной. Сначала добавьте статический контекст — определения инструментов и системный промпт, — а после него разместите развивающуюся беседу (рисунок 2).
Рисунок 2. Организуйте промпты так, чтобы динамическое содержимое добавлялось в конец стабильного префикса.
  • Вносите изменения в модель или уровень усилий, когда кэш промпта уже будет нарушен. Некоторые операции, например сжатие, уже переписывают значительную часть кэша (разговора). Это подходящий момент для смены модели или уровня усилий, поскольку Вы всё равно платите за промах.
  • Перемещайте точку разрыва кэша по мере роста разговора. В Claude Platform Вы можете настроить автоматическое кэширование, чтобы точка разрыва кэша автоматически применялась к последнему кэшируемому блоку. 
  • Предварительно прогревайте кэш. Чтобы уменьшить задержку, отправьте запрос с max_tokens: 0 и явной точкой остановки кэширования. Это обрабатывает промпт и записывает его в кэш, ничего не генерируя. Если выполнить это в начале сессии, например пока пользователь печатает, первый реальный запрос попадёт в прогретый кэш.
  • Не превышайте время жизни кэша промпта. Время жизни кэша, составляющее 5 минут, отсчитывается с начала запроса. Если агент блокируется на вызовах инструментов или запросах к субагентам, выполняющихся дольше 5 минут, кэш родительского агента истекает до того, как вернётся результат. В таких случаях рассмотрите возможность установить для префикса время жизни 1 час.

Инструкции

В промптах могут накапливаться инструкции, компенсирующие слабые стороны модели. Эти инструкции могут расходиться с возможностями новейших моделей Claude. Ниже приведены распространённые «антипаттерны» промптинга, которые ограничивают передовые модели Claude и могут непреднамеренно увеличить расходы:

  • Ритуалы проверки. Инструкции вроде "дважды проверьте свою работу” или "проверьте дважды перед ответом” часто воспринимаются передовыми моделями буквально и могут расходовать токены впустую.
  • Усилители тщательности и акцента. "Будьте максимально тщательны," "КРИТИЧЕСКИ ВАЖНО: ВЫ ВСЕГДА ДОЛЖНЫ…" могут приводить к многословности и дополнительным вызовам инструментов при работе с передовыми моделями.
  • Обязательные процедуры и структуры для черновика рассуждений. Фиксированные пошаговые процессы, например "думайте шаг за шагом в черновике", или шаблоны рассуждений — это ритуалы, которые передовым моделям не нужны. Эта структура может накладываться поверх встроенного рассуждения и использовать лишние токены.
  • Устаревшие примеры. Примеры с несколькими образцами, настроенные под режимы сбоев старой модели, могут научить передовую модель имитировать длинные цепочки рассуждений для запросов, которым они не нужны.
  • Противоречивые правила. Передовые модели лучше следуют инструкциям. Противоречивые инструкции ("всегда возвращайте средства в рамках политики" и "никогда не возвращайте средства без эскалации") могут более буквально выполняться передовыми моделями, что приводит к снижению производительности.  
  • Устаревшая конфигурация. Настройки, написанные для более старого поколения Claude (например, ручные бюджеты на размышления), могут быть отклонены платформой Claude при переходе на передовые модели.

Как это исправить

Мы обновили навык claude-api , добавив новую команду, которая выявляет эти антипаттерны. В Claude Code выполните /claude-api prompt-audit для Ваших промптов, навыков или описаний инструментов. Аудит охватывает всё в Вашем рабочем каталоге, включая код приложения, вызывающий Claude API, и собственную конфигурацию Claude Code (например, CLAUDE.md или навыки).

Например, мы протестировали миграцию модели с Opus 4.8 на Opus 5 на эталонном тесте поддержки клиентов. Мы начали с чистого промпта и по одному добавляли антипаттерну (устаревшую настройку рассуждений, пару противоречащих друг другу правил возврата средств, ручной черновик, "проверять дважды", "быть максимально тщательным" и обязательную процедуру из шести шагов), получив шесть устаревших промптов. 

Мы запускали каждый из них на Opus 4.8, на Opus 5 только с изменённым идентификатором модели и на Opus 5 после однократного запуска \/claude-api prompt-audit для каждого промпта (на рисунке 3 показано среднее значение по всем шести).

Рисунок 3. Влияние антипаттернов промптинга при миграции модели с Opus 4.8 на Opus 5.

В Opus 5 ритуалы проверки ("проверять дважды") используют лишние токены, дублируя поиск заказа при каждом возврате средств. Усилители акцента ("быть максимально тщательным") превратились в десятки ненужных поисков по базе знаний. 

Запуск \/claude-api prompt-audit устранил антипаттерны, снизив затраты на 14,6 % и повысив точность в среднем на 5,3 %. Затраты снизились, поскольку были устранены лишние вызовы инструментов и дублирующиеся рассуждения. Точность повысилась по трём причинам. Устаревшая настройка мышления заставляла API полностью отклонять каждый запрос маршрутизации. Противоречивые правила возврата средств привели к тому, что Opus 5 удержал четыре возврата, которые должен был произвести, пока просил клиента подтвердить. А ручной черновик конфликтовал со встроенным мышлением Opus 5: в трёх обращениях он записал вызов инструмента внутри своих рассуждений и так и не выполнил его.

Усилия

Усилия сообщает Claude, «насколько усердно работать». При низком уровне усилий Claude обычно приходит к выводам быстрее. При высоком уровне усилий Claude обдумывает, проверяет и исследует альтернативы перед ответом. 

Соотношение стоимости и производительности на разных уровнях усилий для одной модели может различаться. Например, Claude Fable 5 набирает 11,5 % при низком уровне усилий при стоимости 5,35 доллара США за задачу на FrontierCode Diamond (50 самых сложных задачах). При максимальном уровне усилий Fable 5 достигает 30,9 % при стоимости 19,00 доллара США за задачу; изменение уровня усилий повышает результат примерно в 2,7 раза (+19 пунктов) при увеличении стоимости примерно в 3,5 раза (рисунок 4). 

На Claude Fable 5.1 Humanity's Last Exam (без инструментов) показывает крутую кривую с уменьшающимся последним шагом. Он набирает около 53 % при низком уровне усилий при стоимости около 0,30 доллара США за вопрос и около 61 % при максимальном уровне усилий при стоимости около 2,23 доллара США; последний шаг до максимума добавляет около половины пункта при увеличении стоимости на 46 %. Прирост находится в пределах шума между запусками бенчмарка, поэтому Вы платите больше без измеримого прироста.

Рисунок 4. Производительность Fable 5 в сравнении со стоимостью на разных уровнях усилий на FrontierCode Diamond.

Уровень усилий может быть неправильно откалиброван в любом направлении:

  • Предположение, что больше всегда лучше. Высокий уровень усилий может привести к чрезмерному>обдумыванию. Claude тратит на обдумывание больше времени, чем требует задача, что увеличивает стоимость \/ задержку и может ухудшить качество ответа. Обдумывание помогает лишь до тех пор, пока ещё есть доказательства, которые можно найти. 
  • Смещение в сторону низких усилий. Если установить слишком низкий уровень, Claude останавливается до того, как у него будет достаточно доказательств. Он делает меньше вызовов инструментов, поэтому может ответить на основе первого результата поиска вместо третьего. Он меньше размышляет над сложными шагами и пропускает проверку, которую обычно выполняет самостоятельно. Ответ выглядит завершённым, но он построен на неполной информации. 

Как это исправить

Существует несколько полезных способов откалибровать усилия: 

  • Тестируйте более сильные модели при меньших усилиях. Более сильная модель при низких усилиях может быть дешевле, чем более слабая модель, работающая с высокой нагрузкой (при высоких усилиях). Например, в CursorBench 3.2 Claude Fable 5.1 при низких усилиях соответствует производительности Fable 5 при высоких усилиях при трети стоимости (рисунок 5). Новую модель делают дешевле две вещи: при низких усилиях она выполняет меньше работы на задачу, а чтение кэша подсказок у Fable 5.1 стоит 0,25 доллара США за миллион токенов против 1,00 доллара США у Fable 5. Даже при ценах Fable 5 Fable 5.1 при низких усилиях стоила бы примерно на 40 % меньше.
Рисунок 5. Fable 5 по сравнению с Fable 5.1 на разных уровнях усилий в CursorBench 3.2.
  • Поймите структуру Вашей задачи. Измерение производительности приложения в диапазоне уровней усилий — полезный способ понять компромисс между стоимостью и производительностью для Вашей конкретной задачи. При ненасыщенной оценке плоская кривая производительности и стоимости на разных уровнях усилий указывает на то, что задача не ограничена вычислениями для рассуждений; увеличение усилий не приносит пользы.

Такая калибровка часто предполагает проведение оценки для разных моделей и уровней усилий. В Claude Code \/claude-api hillclimb выполняет этот поиск за Вас: он разделяет Вашу оценку на обучающую и тестовую выборки, предлагает изменения конфигурации и считывает неудачные обучающие примеры, чтобы исправить обнаруженные проблемы.

Мы запустили это на бенчмарке поддержки клиентов, начав с Opus 4.8 с его стандартным (высоким) уровнем усилий. Hillclimber сначала попробовал Opus 5 с низким уровнем усилий, применив аудит промпта, чтобы убрать обязательные ритуалы вызова инструментов, шаги в черновом пространстве и противоречивые правила. Это превзошло базовый уровень Opus 4.8 с точностью на обучающей выборке 98,9 % и снизило стоимость до 2,6 цента за тикет.

Рисунок 6. Hillclimbing улучшает стоимость и производительность, обновляя выбор модели, уровень усилий и промпт.

Затем он перешёл на Sonnet 5 с низким уровнем усилий, который был ещё дешевле — 1 цент за тикет, однако точность снизилась до 88,9 %. Изучив неуспешные тикеты обучающей выборки, Claude добавил в промпт правила маршрутизации и перекрёстную ссылку на лимит возврата средств, вернув Sonnet 5 к 98,9 % при той же стоимости.

На 14 отложенных тикетах, которых поиск никогда не видел, итоговая конфигурация получила 90,5 % против 78,6 % у исходной настройки — примерно при одной пятой стоимости.

Автоматизация снижения затрат

Кэширование промптов, инструкции и уровень усилий — распространённые рычаги для снижения затрат. Наша документация охватывает ещё больше. Чтобы провести комплексный аудит затрат кода приложения, использующего API Claude, мы добавили /claude-api cost-optimize: она анализирует, на что уходят Ваши расходы, применяет меры по снижению затрат и, если Вы предоставите оценку, показывает, как экономия соотносится с производительностью.

cost-optimize начинает с определения того, куда уходят Ваши токены: из отчётов об использовании и затратах Вашей организации, если у Вас есть ключ Claude Admin API, из объекта использования в каждом ответе API, если Ваше приложение его журналирует, или, если ни один из этих вариантов недоступен, путём чтения кода формирования Ваших запросов и выполнения оценки.

Затем он ранжирует доступные способы экономии, начиная с кэширования промптов, сокращения того, что включает каждый запрос (в том числе с помощью аудита промптов), ограничения вывода и пакетной обработки задач без присмотра. Если Вы предоставите оценку, он пойдёт дальше и рассчитает стоимость и производительность для разных уровней усилий и вариантов выбора моделей. 

Мы протестировали это на четырёх общедоступных бенчмарках, начав с Sonnet 5 в качестве базового уровня (рисунок 7):

  • LegalBench (примерно на 58% ниже стоимость):  cost-optimize предложил кэшировать общий префикс для всех задач, установить низкий уровень усилий и обрабатывать задачи через Batch API. Количество токенов размышлений сократилось со 102 779 до 8 284, однако доля успешного прохождения осталась в пределах статистического шума, а стоимость снизилась примерно на 58%.
  • tau2-bench retail (примерно на 73% ниже стоимость): Внедрив кэширование промптов с явным размещением точки разделения, cost-optimize сократил расходы на 73%, сохранив долю успешного прохождения без изменений.
  • OfficeQA Pro (примерно на 52% ниже стоимость): cost-optimize добавил пакетную обработку и кэширование документов, что снизило стоимость со 136,20 доллара США до 64,87 доллара США. 
  • SWE-bench Verified (примерно на 55% ниже стоимость): cost-optimize обнаружил, что конфигурация по умолчанию уже корректно использует кэширование. Экономия была достигнута за счёт установки среднего уровня усилий и ограничения вывода агента всего несколькими краткими предложениями. Медианное число шагов на задачу сократилось с 29 до 17, а количество токенов в запросах — с 75,2 млн до 33,7 млн. 

Рисунок 7. Изменение стоимости и производительности в разных бенчмарках с помощью /claude-api cost-optimize.

Начало работы

Начните с /claude-api prompt-audit, если Вы перешли на передовую модель Claude и хотите проверить свои существующие промпты в сравнении с ней. Он сканирует промпты, навыки и описания инструментов в Вашем рабочем каталоге. Это может быть код приложения, вызывающий Claude API, или конфигурация Claude Code (CLAUDE.md, навыки). Он устраняет распространённые антипаттерны, которые снижают возможности передовых моделей.

Используйте \/claude-api cost-optimize, когда Ваше приложение использует Claude API и Вам нужен аудит затрат. Он анализирует расход токенов, а затем проверяет различные рычаги: применяет аудит промптов, а также ищет способы снизить затраты с помощью кэширования промптов, пакетной обработки задач без участия пользователя или ограничения объёма вывода. Если Вы предоставите оценку, он измерит компромиссы между затраченными усилиями и выбором модели.

Наконец, используйте \/claude-api hillclimb для итеративного поиска по затратам и производительности. Получив оценку, Claude разделяет её на обучающий и тестовый наборы, а затем предлагает обновления для Вашего приложения, направленные на снижение затрат при сохранении базовой производительности. Claude читает неуспешные случаи из обучающего набора, чтобы направлять поиск, а итоговая конфигурация оценивается на отложенном тестовом наборе.

Чтобы узнать больше: 

  • Смотрите нашу документацию здесь
  • Смотрите нашу кулинарную книгу здесь

Источник

Reducing cost and improving performance with Claude Platform

https://claude.com/blog/reducing-cost-and-improving-performance-with-claude-platform

Редактор русской версии: Пётр Смывин.

Разбор подготовлен 9 сентября 2026.

Другие разборы

Все материалы
3 сентября 2026 Руководство по архитектуре эффективных торговых агентов Торговый агент представляет собой модель в стандартном агентном цикле, которая с помощью навыков и инструментов помогает покупателям и бизнесу искать, сравнивать, покупать товары, управлять каталогом, запасами, ценами и кампаниями. 3 сентября 2026 Создание коммерческих агентов на базе Claude Anthropic представила blueprint для разработки коммерческих агентов на Claude: он включает готовые реализации, шаблоны интеграций, защитные механизмы и плагин Claude Code для быстрого запуска решений в рознице, путешествиях, телекоме и билетных сервисах. 29 августа 2026 Claude for Teachers стал доступен школам и округам K–12 США как бесплатное корпоративное решение Anthropic предоставила школам и школьным округам США уровня K–12 бесплатный доступ к Claude for Teachers в формате Enterprise: учреждения могут централизованно подключать педагогов и сотрудников в рамках одной организации.

Хотите, чтобы вас рекомендовал ChatGPT?

Бесплатный аудит. Покажем, где сайт уже виден ИИ — и где теряете клиентов.

Без подписки PDF за 24 часа Краснодар · вся Россия
Получить GEO-аудит