Назад в ленту

Claude Opus 5 от Anthropic: почти флагманский интеллект за полцены

Модель Opus 5 обеспечивает производительность, близкую к топовой Fable 5, но при вдвое меньшей стоимости. Разбираем бенчмарки, безопасность и экономику новой ИИ-модели.

Anthropic снова в игре. В пятницу компания выпустила Claude Opus 5 — модель, которая, по их словам, даёт почти весь интеллект топовой Fable 5, но за вдвое меньшие деньги. 5 долларов за миллион входных токенов, 25 за выходные — цены те же, что у предшественника Opus 4.8. Но ставки гораздо выше. Это уже не гонка за тем, кто умнее на пике. Это гонка за тем, кто предложит лучшую экономику для ежедневного использования. И первый ход — за Anthropic.

Claude Opus 5: Новая модель Anthropic с фокусом на экономику

Голоса с полей: кто уже платит меньше?

Цифры — это хорошо, но живые отзывы от первых пользователей убеждают сильнее. Юридический AI-стартап Harvey, например, заявил, что Opus 5 достиг аналогичной производительности по сравнению с Opus 4.8 в режиме максимального рассуждения, но при этом генерировал на 26% меньше токенов. Меньше токенов — меньше денег, больше скорости. В Fundamental Research Lab ситуация еще слаще. На сложных задачах финансового моделирования точность Opus 5 оказалась на 9 процентных пунктов выше, и все это при использовании примерно на треть меньше шагов, вызовов инструментов и на 60% меньше времени. Шестьдесят процентов! Это не эволюция, это революция в эффективности. Генеральный директор Zapier Уэйд Фостер и вовсе расщедрился на похвалу: его Opus 5 возглавил лидерборд AutomationBench, выполнив полный рабочий процесс по предотвращению оттока клиентов с точностью 100%. «Предыдущие модели не проходили, Opus 5 сделал это на все сто», — резюмировал Фостер. Скотт Ву из Cognition (создатели агента Devin) подвел черту: «Claude Opus 5 приближается к производительности Fable при вдвое меньшей стоимости». Особенно силен он в отладке и анализе первопричин — том самом грязном деле, где многие спотыкаются.

Коммерческий контекст: почему это важно прямо сейчас

Стратегия Anthropic выглядит логично, если понимать, на какие деньги они замахнулись. Оценка компании — $380 млрд (да, вы не ослышались), прогнозируемая выручка на 2026 год — $20-26 млрд, а за спиной — чудовищные инфраструктурные контракты, включая сделку с Azure на $30 млрд. Все это окупится только в том случае, если корпоративные клиенты будут наращивать объемы использования. А для этого нужно, чтобы каждый токен был оправдан. Удерживая цену на уровне Opus 4.8 и удваивая производительность, Anthropic фактически делает скидку за единицу ума. Каждая задача, которая была экономически невыгодна при старой цене, теперь становится рентабельной. А каждая рентабельная задача — это рекуррентная токенная выручка. Гениальная математика: ты платишь столько же, но клиент получает вдвое больше и остается с тобой навсегда.

Производительность и бенчмарки: Сравнение с конкурентами

Anthropic, похоже, решила устроить аукцион, где ставки идут не на сырой интеллект, а на эффективность с ножом в кармане. Claude Opus 5 выходит на ринг и сразу же начинает крушить таблицы лидеров. Компания заявляет, что модель установила новые рекорды на бенчмарках кодинга и работы со знаниями — Frontier-Bench и GDPval-AA встали и аплодируют стоя. Но самое интересное кроется в цифрах, а они, знаете ли, умеют быть красноречивыми.

На Frontier-Bench v0.1, агентном терминальном тесте для кода, Opus 5 набрала 43,3%. Это более чем вдвое выше, чем у предшественницы Opus 4.8 (жалкие 18,7%), и заметно обгоняет номинально топовую Fable 5 (33,7%). И да, при этом каждая задача обходится дешевле — что называется, и швец, и жнец, и на дуде игрец. На тесте ARC-AGI 3, где оценивается умение решать совершенно незнакомые проблемы, новая модель показала результат в три раза выше, чем у любой другой конкурирующей системы. А на OSWorld 2.0 (бенчмарк использования компьютера) Opus 5 превосходит лучший результат той же Fable 5 при затратах чуть больше трети от оригинала. Согласитесь, звучит как грабеж среди бела дня.

Честный разговор про слабые места

Но не спешите хоронить конкурентов. Anthropic в своем репертуаре — компания с редкой для индустрии честностью признаёт, где Opus 5 пока пасует. Модель отстаёт от Mythos 5 (да, есть и такой игрок) на задачах кибербезопасности и биологических исследованиях, а какая-то модель из семейства OpenAI всё еще удерживает корону на одном из агентных бенчмарков кодинга. Никакого мошенничества с цифрами — просто факты.

Представитель Anthropic объяснил эту картину с убийственной прямотой: «Эвалы, в которых выигрывает Opus 5 — это ограниченные задачи с конкретным результатом, где она самая сильная. Что эти эвалы не измеряют — это продолжительность. Один из способов выразить это: Opus 5 — лучший инструмент для задач, которые могут увидеть бенчмарки, а Fable 5 — это то, к чему вы обращаетесь, когда задача выходит за рамки бенчмарка».

Иными словами, Fable 5 остается тяжелой артиллерией для самых долгих, автономных операций. Её стихия — многочасовые или даже многодневные проекты, где нужно сохранять связность сотен шагов с плотным исходным материалом. Opus 5 же — точный и быстрый скальпель для рутинных задач, которые можно упаковать в чёткие границы. Это противопоставление — ограниченные задачи против долгосрочной автономии — очень похоже на ту самую ось координат, по которой в 2026 году будут делить рынок все крупные модели. И если это так, то Opus 5 пришла не просто побить рекорды, а перекроить саму логику, по которой мы выбираем «рабочую лошадку».

Безопасность, само-верификация и корпоративные сценарии

Главное, что Anthropic продаёт вместе с Opus 5 — не просто цифры, а историю поведения. Модель, по заявлению компании, не тупо генерирует ответ, а верифицирует собственные результаты и итеративно дорабатывает их до победного конца. Внутренние тесты полны примеров, которые звучат как притчи о машинном упрямстве.

В одной из задач Frontier-Bench модели дали чертёж детали, который она не могла прочитать штатными средствами. Вместо того чтобы сдаться, Opus 5 написала собственный пайплайн компьютерного зрения, извлекла геометрию из сырых пикселей и восстановила 3D-модель. Ни одна конкурирующая модель не решила эту задачу за пять попыток. В другом случае модели подкинули реальный баг из популярного менеджера пакетов с открытым исходным кодом. Opus 5 не просто нашла первопричину, но и исправила крайний случай, который пропустило само сообщество. Конкурент же залатал только симптом и доложил о победе. Третий пример — инженер трейдинговой фирмы попросил модель написать парсер рыночных данных для новой биржи, и когда оказалось, что живого фида для валидации нет, Opus 5 сама построила тестовый харнес и проверила свой код.

В реальных проектах модель ведёт себя так же. Кристиан Ривера, штатный инженер Stripe, дал ей «роль начальника штаба над дев-средами» на выходные. Результат: «она построила собственный монитор, управляла каждым боксом и привлекала меня только для принятия решений». Для предприятий это именно то, что нужно — модель, которая проверяет себя, а не требует постоянного надзора со стороны человека.

Безопасность: меньше возможностей для злоупотреблений

Anthropic не только гонится за производительностью, но и усложняет систему безопасности. Автоматический поведенческий аудит показал, что Opus 5 — самая согласованная модель компании с общим показателем «некорректного поведения» всего 2,3. Это ниже, чем у Opus 4.8, Sonnet 5 или даже флагманской Fable 5. У неё самая низкая частота обманного поведения и наименьшая восприимчивость к попыткам обмануть.

Примечательно, что Anthropic намеренно не обучала Opus 5 на задачах кибербезопасности — ни на поиске уязвимостей, ни на их эксплуатации. Но за счёт общего роста способностей модель всё равно улучшилась в этой области. На внутреннем бенчмарке OSS-Fuzz она почти сравнялась с конкурирующей Mythos 5 по поиску уязвимостей: 79,4% против 80%. А вот в эксплуатации разрыв колоссальный: Opus 5 успешно разработала эксплойты лишь для 4 уязвимостей против 13 у Mythos 5. Такая асимметрия — сильна в защитном обнаружении, слаба в атакующей эксплуатации — выглядит намеренной. Ожидается, что классификаторы кибербезопасности Opus 5 будут срабатывать примерно на 85% реже, чем у Fable 5.

Когда классификатор всё же срабатывает, запросы в Claude.ai, Claude Code и Claude Cowork по умолчанию переадресуются на менее способную модель Opus 4.8. Представитель Anthropic объяснил логику: «Модель, на которую происходит откат, имеет более низкий уровень способностей, что снижает риск вредоносного использования». Пользователь при этом видит уведомление в чате.

В биологии подход иной. Opus 5 стала самой способной общедоступной моделью Anthropic для научных исследований — на 10,2 процентных пункта выше Opus 4.8 на внутреннем бенчмарке химии. Но для долгосрочных открытых работ, таких как автономные кампании по дизайну лекарств, Mythos 5 по-прежнему сильнее.

Новые фишки для разработчиков

Вместе с моделью вышли и технические нововведения. Fast-режим работает примерно в 2,5 раза быстрее стандартного, но стоит вдвое дороже. На API появилась автоматическая маршрутизация отката. А те, кто пишет агентов, оценят возможность менять инструменты в середине разговора без инвалидации кэша промптов — мелочь, но экономит время и деньги.

Claude Opus 5 — это не очередной «самый умный» ИИ. Это прагматичный расчёт на то, что бизнесу нужен не космический интеллект по цене спутника, а надёжный, самопроверяемый и доступный инструмент для рутинных, но сложных задач. Anthropic ставит на то, что настоящие деньги лежат не на переднем крае возможностей, а чуть позади — там, где очень хорошая модель может работать каждый день, за полцены. Сработает ли — покажут масштабные корпоративные внедрения.

Справка по теме (FAQ)
Сколько стоит Claude Opus 5?
Модель стоит $5 за миллион входных токенов и $25 за миллион выходных — те же цены, что у предшественника Opus 4.8.
Что такое Fast-режим в Opus 5?
Fast-режим позволяет модели работать примерно в 2,5 раза быстрее стандартного режима, но при этом стоит вдвое дороже.
Почему Opus 5 считается безопаснее Fable 5?
Автоматический аудит показал самый низкий показатель «некорректного поведения» (2,3) среди всех моделей Anthropic. Кроме того, классификаторы кибербезопасности срабатывают на 85% реже, а при срабатывании запросы перенаправляются на менее способную Opus 4.8.
Может ли Opus 5 использоваться для научных исследований?
Да, модель стала самой способной общедоступной моделью Anthropic для научных исследований, особенно в химии (на 10,2 процентных пункта выше Opus 4.8). Однако для долгосрочных автономных задач, например, дизайна лекарств, лучше подходит Mythos 5.