0%прочитано

Разбор публикации

Как Balyasny Asset Management оценивает и управляет Claude Fable 5 на переднем крае искусственного интеллекта

7 мин чтения Оригинал на claude.com

Полный перевод статьи из блога Claude на русский. Оригинал — по ссылке.

ПОДКАСТ

Balyasny Asset Management (BAM) — глобальная инвестиционная компания с несколькими стратегиями, управляющая активами примерно на 38 миллиардов долларов США и поддерживающая команду примерно из 2 000 инвестиционных специалистов и сотрудников. Чарли Фланаган, директор по искусственному интеллекту, рассказал Anthropic о том, как компания оценивает новые модели на тысячах реальных финансовых задач, почему она создала собственную платформу для запуска агентов и что изменилось с запуском Claude Fable 5.

Как передовой искусственный интеллект изменился для BAM в 2026 году?

2026 год стал годом, когда мы перешли от систем искусственного интеллекта, выполняющих поиск, к системам искусственного интеллекта, выполняющим работу.

Ключевое изменение заключается не только в моделях, но и в инфраструктуре вокруг них, такой как Claude Code. Она позволяет создаваемым нами решениям на основе искусственного интеллекта выполнять значительно более сложные и продолжительные задачи. Возможность задать искусственному интеллекту результат, а не подсказку, и позволить ему продолжать работать до завершения стала переломным моментом.

Практический пример — анализ арбитража при слияниях. Когда объявляется сделка, агенты теперь формируют первоначальный пакет анализа сделки. Они оценивают вероятность закрытия сделки и срок, который это займёт, извлекают ключевые экономические и юридические условия, определяют условия и контрольные этапы и выделяют области, требующие инвестиционного суждения.

Год назад эти этапы были разрознены между ручным исследованием и отдельными инструментами; у нас не было агента, который мог бы надёжно выполнять весь многоэтапный рабочий процесс до пригодного к использованию результата. Раньше эта работа занимала от трёх до пяти дней. Теперь она занимает менее одного дня. Агент работает примерно 30 минут, а перед тем, как полагаться на какой-либо существенный результат, проводится проверка человеком.

Мы используем передовые модели Anthropic's, однако большая часть инфраструктуры, включая среду выполнения, доступ к данным и механизмы контроля проверки, создаётся собственными силами в BAM.

Как Вы оценивали Claude Fable 5 перед его включением?

Несколько лет назад мы сделали одну вещь, которая принесла нам исключительно большую пользу: мы инвестировали в надёжные системы оценки. Мы тестируем новые модели на тысячах реальных финансовых задач с проверяемыми результатами в области акций, макроэкономики и сырьевых товаров, вместо того чтобы полагаться на общие бенчмарки или отдельные демонстрации. Это позволило нам принимать решения о выборе и маршрутизации моделей на основе данных, и, как я считаю, всем предприятиям следует в это инвестировать.

Мы тестируем как саму модель, так и то, как она работает в нашей агентной среде, с теми же инструментами, файлами и требованиями, что и у наших пользователей. Может ли она спланировать работу, выбрать и использовать подходящие инструменты, найти и проанализировать доказательства, восстановиться после ошибок, проверить промежуточные результаты и подготовить обоснованный итоговый материал? Мы также ищем конкретные режимы сбоев, такие как числовые ошибки, неполный охват, неподтверждённые выводы и проблемы с поиском информации.

На релевантной подвыборке Fable достигла 89,4 % против 86,1 % у предыдущей производственной модели на тысячах задач. Особенно она выделилась в сложном планировании, анализе и агентном выполнении.

Неожиданным результатом стал набор экономических задач, которые мы тестировали и которые ни одной модели до Fable никогда не удавалось успешно завершить. Изначально мы рассматривали этот результат как потенциальную проблему оценки, поскольку он представлял собой существенный скачок по сравнению с каждой моделью, которую мы тестировали. Мы повторно провели оценку, независимо проверили логику задачи и подсчёта баллов и рассмотрели результат вместе с Anthropic, прежде чем прийти к выводу, что улучшение было реальным. Это был момент «вау».

Сегодня наши инвестиционные команды используют Fable в качестве основной передовой модели для систематической работы и программирования. Мы даём им рекомендации о том, когда использовать Fable, а когда другие модели, исходя из эффективности и стоимости.

Как Вы подходите к вопросу безопасности современных передовых моделей?

Мы рассматриваем безопасность как вопрос продукта и операционной модели, а не как разовое упражнение по выбору модели. Важны не только возможности модели, но и то, к каким данным она может получать доступ, какие инструменты она может использовать, какие действия она может выполнять, что должно оставаться требующим одобрения человека и как мы узнаем, что что-то пошло не так.

Это означает внедрение средств контроля вокруг модели, а не предположение, что сама модель является средством контроля. Мы используем утверждённые границы данных, доступ с минимальными привилегиями, разрешения на уровне инструментов, ведение журналов и отслеживаемость, проверку человеком существенных результатов и чёткие пути эскалации для нестандартных случаев. Мы также тестируем состязательные сценарии и сценарии сбоев, прежде чем расширять доступ.

Эти механизмы контроля были приоритетом с первого дня, и безопасность не претерпела фундаментальных изменений с появлением Fable. Более способная модель не получает более широких полномочий лишь потому, что она может эффективнее рассуждать или планировать. Модели могут использовать только инструменты и источники данных, одобренные для данного пользователя и задачи, и они не могут предоставлять себе дополнительный доступ. Инвестиционные решения и ответственность остаются за людьми.

Какое место занимает BAMAgent?

Забегая вперёд, направление развития ведёт к более способным агентам, которые могут выполнять более длительные многоэтапные действия. Это делает управление более важным, а не менее важным. Для нас это означало создание BAMAgent, нашей внутренней платформы для безопасного развёртывания агентов в утверждённых корпоративных рабочих процессах. Она предоставляет агентам нужные им инструменты и системы, но только эти инструменты и системы. Мы создаём её уже шесть месяцев, и она поддерживает тысячи автономных агентов, работающих круглосуточно без выходных.

BAMAgent — это следующий шаг после нашей чат-платформы. Чат помогает людям воспринимать и синтезировать информацию. BAMAgent выполняет работу: многоэтапные исследования и анализ, которые могут длиться часами или днями, при этом агенты работают параллельно, и в итоге создаётся результат, который человек может проверить. Он может создавать и поддерживать пакет исследований о компании, готовиться к событию, связанному с отчётностью или макроэкономикой, либо преобразовывать новые доказательства в финансовые сценарии. Агент планирует работу, использует одобренные внутренние системы, проводит анализ, проверяет промежуточные результаты и возвращает исследовательский артефакт, модель или пакет поддержки принятия решений.

Fable — наша предпочтительная модель для этапов планирования и анализа. Ошибка на этих этапах проходит через каждый последующий результат, поэтому мы хотим, чтобы самая сильная доступная модель решала, как разбить проблему на части, какие доказательства важны и как согласовать противоречивые сигналы. Именно это позволяет агенту работать как компетентному коллеге.

Каждое предприятие должно разрабатывать стратегию перехода к модели размещённых агентов, которая позволяет управлять предприятием и обеспечивать соблюдение требований, одновременно максимально повышая полезность агентов для пользователей.

Что Claude Fable 5 сделала возможным для BAM?

Реакция была невероятно положительной. В конечном счёте людям важно, что эта технология может открыть в их повседневной работе.

В одном примере BAMAgent провёл анализ сбора налоговых убытков. Он изучил 90 000 таблиц базы данных, нашёл релевантные данные о владениях взаимных фондов и создал собственную систему взвешивания. После проверки нашей командой результат оказался более комплексным, чем тот, который дал бы традиционный подход.

Отдельно наш главный экономист настроил рабочий процесс агента, который сокращает регулярный анализ центрального банка примерно с двух дней до приблизительно 30 минут, при этом экономист сохраняет контроль за проверкой и вынесением суждений.

Fable обеспечивает рассуждение, синтез и многоэтапное решение задач. Инфраструктура BAM's предоставляет проектирование рабочих процессов, утверждённый доступ к данным и инструментам, контекст извлечения, разрешения, мониторинг и средства контроля человеческой проверки. Для результата производственного качества необходимы обе составляющие.

По мере того как модели становятся всё более мощными, что дальше в Вашей дорожной карте искусственного интеллекта?

В этом году мы переходим от людей, у которых есть инструменты, к людям, у которых есть товарищи по команде. Подобно товарищу по команде, агенты будут становиться полезнее с течением времени по мере того, как Вы работаете с ними, выполняете более сложные задачи и начинаете поручать им инициативно выполнять работу, чтобы помогать Вам.

У нас уже есть несколько команд, использующих более 300 агентов, которые постоянно проводят анализ новых данных и информации. Это помогает командам и быстрее приходить к выводам, и ничего не упускать.

Это также меняет вопрос, который мы задаём. Раньше мы создавали экспертные системы и учили людей автоматизировать процессы, которые у них уже были. Теперь мы спрашиваем, есть ли более эффективный способ достичь результата.

Пределы действительно определяются лишь нашим собственным воображением. Инструменты, данные и модели сейчас достигли уровня, при котором они могут выполнять настоящую работу часами напролёт; от нас зависит, продолжим ли мы переосмысливать возможное. Следующие 12 месяцев будут невероятно захватывающими.

Начните работу с 0Claude Fable.

Источник

Working at the frontier: How Balyasny Asset Management evaluates and governs Claude Fable 5

https://claude.com/blog/working-at-the-frontier-how-balyasny-asset-management-evaluates-and-governs-claude-fable-5

Редактор русской версии: Пётр Смывин.

Разбор подготовлен 18 сентября 2026.

Другие разборы

Все материалы
18 сентября 2026 Проекты Claude Code переработаны: от папки к управляемому диалогу В Claude Code проекты становятся средой для длительной многозадачной работы: пользователь задаёт цель и контекст, а Claude самостоятельно определяет объём задач, распределяет их между потоками, координирует выполнение, проверяет результаты и собирает итоговый результат. 17 сентября 2026 Claude Cowork и чат объединяются в единый Claude Anthropic объединяет Claude Cowork и обычный чат в единый интерфейс Claude, чтобы пользователям не приходилось выбирать отдельное место для крупных, визуальных или обычных задач. 16 сентября 2026 Claude для малого бизнеса: новые рабочие процессы, интеграции и программы обучения Claude for Small Business получил 43 готовых рабочих процесса и 27 новых интеграций, включая Shopify, Salesforce, TikTok, Atlassian, Zoom, Xero, Gusto, Square, Stripe и Zapier; сервис уже был установлен более 900 000 раз.

Хотите, чтобы вас рекомендовал ChatGPT?

Бесплатный аудит. Покажем, где сайт уже виден ИИ — и где теряете клиентов.

Без подписки PDF за 24 часа Краснодар · вся Россия
Получить GEO-аудит