Полный перевод статьи из блога Claude на русский. Оригинал — по ссылке.
ПОДКАСТ
ПОЛНАЯ ОЗВУЧКА СТАТЬИ
JetBrains создаёт инструменты, которыми пользуются разработчики по всему миру, от IntelliJ IDEA и PyCharm до языка программирования Kotlin, обслуживая более 12,5 миллиона активных пользователей и 88 компаний из Fortune Global 100. Владислав Танков, технический директор JetBrains, поговорил с Anthropic о том, как его команда оценивает новые модели, решает, когда использовать Claude Fable 5, и думает о хранении данных и мерах защиты при работе с передовыми моделями.
Как изменился передовой искусственный интеллект для JetBrains в 2026 году?Могу я помочь с чем-то ещё?
Я работаю в JetBrains уже 10 лет, и мы были одними из самых первых клиентов поставщиков больших языковых моделей. За последний год мы перешли от наличия скептиков в отношении искусственного интеллекта среди наших клиентов и внутри компании к пониманию, что искусственный интеллект никуда не денется. Это большое и фундаментальное изменение в технологической отрасли. Буквально каждый скептик в компании изменил своё мнение.
Как Вы оцениваете новые модели и решаете, когда их использовать?
Мы — компания, занимающаяся программированием, поэтому у нас большой конвейер оценки: крупные наборы оценочных тестов на закрытых репозиториях, включая наш монорепозиторий. Мы внимательно проверяем, соответствует ли модель своим результатам в бенчмарках в реальной работе: некоторые модели настроены так, чтобы хорошо показывать себя на публичных бенчмарках, но проваливаются на реальных задачах. С закрытым репозиторием это гораздо проще проверить. Мы также ведём рейтинговые таблицы для лучшего качества, лучшей стоимости за задачу и самой быстрой модели. Хотя Claude Fable 5 дороже в пересчёте на токен, её стоимость за задачу в некоторых случаях ниже, особенно для более сложной, долгой работы.
Как Claude Fable 5 показала себя на Ваших оценках по сравнению с предыдущими моделями?
Claude Fable 5 одновременно точнее и эффективнее предыдущих моделей. Она показала лучшую долю успешного прохождения Python в нашем наборе — 44,3% против 28,2% у Opus 4.8, что означает скачок на 16 пунктов. В прямом сравнении Claude Fable 5 решила 18 задач Python, которые Opus 4.8 пропустила, и уступила только в 2. Её ответы также более надёжны: когда её код запускался, он проходил наши тесты гораздо чаще, чем у любой модели Opus. Это важно, потому что код, который запускается, но выдаёт неправильные ответы, — самый дорогой для выявления тип ошибки.
История эффективности не менее интересна. Claude Fable 5 потребовалось примерно на 22 % меньше шагов, чем Opus 4.8, чтобы прийти к решению, поэтому он доходит до рабочего кода с меньшим количеством проб и ошибок. Он также направляет усилия туда, куда нужно. В задачах на Java Opus 4.8 неоднократно пытался подключить внешние ресурсы, которые почти никогда не помогают в нашей среде, тогда как Claude Fable 5 полностью пропускал это и работал с кодом перед собой. В целом он демонстрирует лучшие инженерные привычки.
Когда Вы используете Claude Fable 5 вместо других моделей?
Opus воспринимается как рабочая лошадка: Вы можете быть очень уверены, что он выполнит работу. К Claude Fable 5 Вы обращаетесь, когда Вам действительно нужно хорошее рассуждение, когда Вам почти нужен партнёр, и Вы сами не уверены, как сделать эту вещь. Например, один из наших технических руководителей решил реализовать компонент редактора форматированного текста, который мы пытались сделать несколько раз на протяжении многих лет, и Claude Fable 5 почти сделал это с первой попытки.
Ещё один популярный вариант использования Claude Fable 5 — длительные эксперименты с агентным программированием. Мы предоставляем агенту, работающему на Claude Fable 5, спецификации (в виде текста и изображений) и заставляем его реализовывать сложные приложения, похожие на интегрированные среды разработки. Интересно здесь то, что спецификации также могут быть сгенерированы агентом на основе существующего приложения. Объединение этих двух компонентов позволяет нам переписывать приложение с одной среды выполнения, фреймворка или языка на другой в условиях почти полного «чёрного ящика».
Как Вы подходите к вопросам безопасности и хранения данных в сегодняшних передовых моделях?Сильные стороны>
Мы не компания, которая пытается самостоятельно создать самую безопасную модель. Мы ожидаем, что тестирования методом «красной команды» и всего остального, что делается на стороне Anthropic, достаточно, чтобы считать модель безопасной. Затем мы применяем системный подход к развёртыванию, при котором можем гарантировать безопасность: создаём инфраструктуру и систему безопасности вокруг модели и обвязки, а не дорабатываем саму модель.
Безопасность также является одной из наших основных областей применения Claude Fable 5. Мы проводим тестирование методом «белого ящика» для наших собственных продуктов, чтобы находить уязвимости, и наша команда безопасности готовится к тому, что не только мы запускаем модель — люди за пределами компании будут запускать Claude Fable 5 или модели аналогичного класса, чтобы искать уязвимости во всех наших продуктах. Поскольку мы обслуживаем крупные предприятия в регулируемых отраслях, нам важно быть готовыми. Claude Fable 5 поддерживает нашу работу, а не блокирует её.
Так что это тонкий баланс: чем менее агрессивен классификатор с вашей стороны, тем больше уязвимостей кто-то найдёт в наших продуктах — включая те, о которых никто не знал.
И это не секрет: мы предпочли бы нулевое хранение данных. Но я не вижу другого способа, чтобы Вы могли понять, что было запрошено и где классификатор мог сработать неправильно. Пока проверки проводятся только для расследования самых серьёзных помеченных случаев, меня это устраивает. Я думаю, что это справедливый компромисс ради доступа к передовому интеллекту, который позволяет моей команде выполнять свою работу наилучшим образом.
Что дальше в дорожной карте JetBrains в области искусственного интеллекта? профиль
Мы ожидаем, что базовые модели, создаваемые поставщиками больших языковых моделей, будут становиться всё более мощными. Сейчас важна своего рода кабина управления для разработки программного обеспечения: пространство, в котором агенты и люди сотрудничают и где люди могут управлять процессом разработки.
Для JetBrains это большая трансформация. Мы видим возможность создать следующее поколение продуктов для всего агентного жизненного цикла разработки программного обеспечения, которое обеспечивает работу этой кабины управления. Разработчики смогут выпускать больше и лучше кода с помощью агентов, нетехнические роли будут играть более значительную роль в создании программного обеспечения, а организации получат необходимые им управление и ясность в отношении окупаемости инвестиций.
Начните работу с Claude Fable.
Источник
Securing the frontier: How JetBrains evaluates and deploys Claude Fable 5
https://claude.com/blog/how-jetbrains-evaluates-and-deploys-claude-fable-5Редактор русской версии: Пётр Смывин.
Разбор подготовлен 14 августа 2026.


