Перейти к содержимому
Claude Opus 5: новая флагманская AI-модель Anthropic для программирования, автоматизации и сложных агентных задач
12 мин чтения

Claude Opus 5: новая флагманская AI-модель Anthropic для программирования, автоматизации и сложных агентных задач

anthropicclaude-opus-5ai-modelsagentic-aiai-automation
ПродуктАнонсы

Claude Opus 5: что нового в флагманской модели Anthropic

24 июл. 2026

Если коротко: Claude Opus 5 уже доступен. Это более вдумчивая, инициативная и заметно более практичная модель, которая по уровню рассуждений подбирается к Claude Fable 5, но обходится примерно вдвое дешевле. Для команд, которые строят AI-агентов, автоматизацию и сложные корпоративные сценарии, новость, прямо скажем, не из проходных.

По ряду тестов на программирование и интеллектуальную работу — включая Frontier-Bench и GDPval-AA — Opus 5 выходит в лидеры. При этом в кибербезопасности, особенно в наступательных сценариях, модель всё ещё уступает Mythos 5. И это, вероятно, сделано не случайно.

Для повседневной эксплуатации Opus 5 выглядит особенно сильной: модель эффективнее расходует ресурсы, лучше держит длинный контекст и аккуратнее доводит задачу до конца. Сейчас это модель по умолчанию в Claude Max и наиболее мощная модель в Claude Pro. А если вашей команде нужна разработка AI-агентов и автоматизация, подобные характеристики уже не просто приятный бонус, а рабочая необходимость.

Производительность, стоимость и реальная польза

Opus 5 даёт заметный прирост производительности без увеличения цены относительно Opus 4.8. Проще говоря, за те же деньги модель делает больше. Визуализации в этом разделе показывают, как меняется результат в зависимости от настройки effort: её можно смещать либо в сторону максимального качества рассуждений, либо в сторону экономии токенов и более быстрой отдачи.

Особенно хорошо Opus 5 проявляет себя в software engineering — и не на словах, а в задачах, где обычно быстро вскрывается вся правда. В Frontier-Bench v0.1 модель обходит остальных участников и более чем вдвое улучшает результат Opus 4.8, причём с меньшей стоимостью на одну задачу. В CursorBench 3.2 на режиме max effort она отстаёт от пикового результата Fable 5 всего примерно на 0,5%, но при этом стоит вдвое дешевле на задачу. Неплохой расклад, мягко говоря.

Если смотреть на фиксированный бюджет, картина тоже в пользу Opus 5: на уровнях high, xhigh и max effort модель показывает более высокую отдачу, чем конкуренты. Для компаний, которые проектируют архитектуру AI-агентов и считают стоимость каждого запуска, это уже не маркетинговая деталь, а вполне прикладная экономика.

Frontier-Bench v0.1CursorBenchAA Coding Agent Index

Похожие выводы видны и в задачах на рассуждение, автоматизацию и решение новых проблем:

  • В ARC-AGI 3, где модель должна справляться с незнакомыми задачами, Opus 5 показывает результат примерно втрое выше, чем ближайший преследователь.
  • В Zapier AutomationBench, оценивающем выполнение бизнес-процессов end-to-end, доля успешно завершённых задач у Opus 5 примерно в 1,5 раза выше, чем у следующей лучшей модели при той же стоимости. Причём даже на минимальном effort она проходит больше сценариев, чем остальные.
  • В OSWorld 2.0, бенчмарке для computer use, модель лидирует на всех сопоставимых уровнях затрат и превосходит лучший результат Fable 5 при стоимости чуть больше трети от него.

И это не единичные всплески. Opus 5 также показывает лучшие или одни из лучших результатов в ряде смежных тестов — от GDPval-AA v2 до DeepSearchQA. Когда модель стабильно сильна сразу в нескольких классах задач, это обычно хороший признак для корпоративного внедрения, особенно если речь идёт про мультиагентные системы, RAG и долгие рабочие цепочки, а не про разовый красивый демо-ролик.

ARC-AGI 3GDPval-AA v2OSWorld 2.0HLEAutomationBenchDeepSearchQA

Отдельно Anthropic отмечает прогресс в научных исследованиях. По сравнению с Opus 4.8 модель улучшилась во всех внутренних оценках по life sciences: структурная биология, органическая химия, биоинформатика. Самые заметные сдвиги — в задачах вывода молекулярных структур по спектроскопическим данным и в анализе белков, где важно понять, как изменения в последовательности влияют на функцию. Тут уже не до общих слов: прирост измеряется конкретными процентными пунктами.

Есть и ещё одна любопытная деталь: Opus 5 стала сильнее в визуальных результатах. Не просто «умеет картинки», а лучше строит интерактивные и наглядные артефакты. Для продуктовых команд, которые собирают интерфейсы, обучающие среды или агентные панели управления, это может оказаться весьма кстати.

Аэродинамическая трубаАртефакт клетки
Opus 5 визуализировала поток воздуха над аэродинамическими и, скажем так, не слишком аэродинамичными объектами. Попробовать разные настройки в аэродинамической трубе можно здесь.

Как Claude Opus 5 ведёт себя в работе

Сухие бенчмарки — это хорошо. Но важнее другое: как модель действует, когда задача неидеальна, данных не хватает, а человек не расписал всё по шагам. И вот тут Opus 5, похоже, действительно прибавила. Она лучше перепроверяет себя, аккуратнее итерирует и реже останавливается на первом более-менее правдоподобном ответе. Вроде мелочь. На деле — огромная разница.

Во время раннего доступа Anthropic и её пользователи увидели несколько показательных сценариев:

  • В одной из задач Frontier-Bench модель получила изображение детали машины и должна была написать код для её восстановления в виде 3D-модели FreeCAD. При этом прямого просмотра изображения ей намеренно не дали. В ответ Opus 5 собрала собственный pipeline computer vision, извлекла геометрию из сырых пикселей и реконструировала деталь. Причём не один раз, а повторяемо. Конкурирующие модели в той же конфигурации после пяти попыток задачу не закрыли.
  • При разборе реального бага в популярном open-source package manager модель нашла корневую причину и исправила сложный edge case, который пропустил патч сообщества. Конкурирующая система устранила лишь внешний симптом и бодро отчиталась, что всё готово. Ну, бывает.
  • Инженер из трейдинговой компании использовал Opus 5, чтобы за одну сессию собрать market data feed для новой биржи. Предыдущие модели не справлялись даже с подробным планом. Не найдя live feed для проверки, Opus 5 сама создала test harness и через него провалидировала корректность парсинга данных.

Такое поведение особенно важно там, где строятся мультиагентные системы: один агент ищет данные, другой пишет код, третий проверяет результат, четвёртый ведёт журнал решений. Если базовая модель не умеет держать нить и не любит самопроверку, вся конструкция начинает скрипеть. А иногда и разваливаться — не сразу, но уверенно.

Ниже — отзывы компаний раннего доступа. Их много, но общий мотив повторяется довольно упрямо: Opus 5 ближе к уровню Fable 5 по качеству рассуждений, при этом заметно экономичнее и стабильнее в длинных, многошаговых сценариях.

logo
В FrontierCode 1.1 Claude Opus 5 приближается к уровню Fable при вдвое меньшей стоимости. В Devin модель особенно сильна в сложных задачах отладки и анализа первопричин.
logo
Claude Opus 5 даёт интеллект, близкий к Fable 5, при скорости и стоимости линейки Opus. В CursorBench она лишь немного уступает Fable 5 и демонстрирует схожие поведенческие качества.
logo
Claude Opus 5 возглавила лидерборд Zapier AutomationBench, не расходуя больше токенов, чем предыдущие модели Claude. Она выполнила полный сценарий предотвращения оттока: выявила рискованные аккаунты, уведомила владельца и подготовила summary для retention ops. Предыдущие модели этот тест не проходили. Opus 5 — прошла на 100%.
logo
В задачах геномного анализа Claude Opus 5 ведёт себя скорее как аккуратный исследователь: выбирает корректные статистические тесты, исключает confounders, перепроверяет выводы независимыми методами и не теряет фокус в длинных многошаговых анализах.
logo
Во внутренних evals компании Claude Opus 5 опередила все предыдущие модели семейства. Она не только лучше решает самые сложные agentic coding-задачи, но и делает это стабильнее — с меньшим разбросом между запусками.
logo
Это крупнейший скачок в линейке Opus со времён 4.5. Особенно заметен прогресс во фронтенде: анимации, игры и 3D-работы стали ощутимо сильнее.
logo
Для открытой аналитической работы, которую выполняет агент компании, это явное улучшение по сравнению с Opus 4.8. Наибольший прирост заметен именно в сложных и слабо формализованных задачах.
logo
В финансово-исследовательских workflow Claude Opus 5 особенно сильна в численном рассуждении, работе с таблицами и более точном критическом анализе.
logo
Box сообщает, что Opus 5 превосходит Opus 4.8 на 8% и даёт заметный прирост в анализе данных и due diligence — сценариях, на которые ежедневно опираются компании из технологического, медицинского и государственного секторов.
logo
По сравнению с Opus 4.8 это уже скачок поколения: за одни выходные модель фактически выступила в роли chief of staff для dev environments — построила мониторинг, управляла окружениями и подключала человека только там, где требовалось суждение.
logo
Модель внесла крупные изменения в codebase исследовательского ассистента компании, адаптировалась к обратной связи по ходу agentic workflow и объясняла свои шаги яснее, чем другие протестированные модели.
logo
В сложных задачах финансового моделирования Claude Opus 5 заметно превосходит Opus 4.8 и по точности, и по эффективности: выше нижняя граница качества, меньше turns и tool calls, меньше времени на выполнение.
logo
Claude Opus 5 проверяет свою работу почти как живой frontend-разработчик: открывает страницы в браузере, смотрит desktop и mobile, замечает скрытые элементы и исправляет проблемы до возврата результата.
logo
В legal agents Opus 5 даёт явный прирост по сравнению с предыдущими моделями Opus, особенно в корпоративном управлении и арбитраже, при этом сохраняет качество даже на более низких уровнях reasoning.
logo
На длинных задачах — например, при создании и доработке полной презентации — компания увидела самый явный шаг вперёд: лучшее визуальное понимание, более чистое форматирование и меньше проблем со слайдами.
logo
При передаче PR модель не спешит публиковать изменения: проверяет ветки, сверяет шаблоны и думает о последствиях для тестов. Старые модели, как правило, торопились и спотыкались на проверках.
logo
Во время обсуждения реархитектуры Claude Opus 5 не просто согласилась с предложенным дизайном, а аргументированно возразила, сузила проблему до одного ключевого вопроса и предложила компромиссное решение.
logo
В first-turn redlines модель показала лучший результат среди всех протестированных систем, почти вдвое превзойдя Opus 4.8. В NDA она доходит до качественного redline быстрее и за меньшее число проходов.
logo
Claude Opus 5 пишет чистые и компактные diffs, не раздувает код мёртвыми фрагментами и лучше замечает риски, специфичные для конкретной codebase.
logo
Компания планирует переносить часть use cases в свою унифицированную агентную платформу Cosmos и активнее использовать Opus 5 для code review.
logo
Особенно выделяется качество суждений: модель дольше думает до первого действия, ловит логические ошибки ещё на этапе планирования и объясняет, почему решение верно, а не только почему оно сработало.
logo
На trading benchmark компании Claude Opus 5 стала самой сильной моделью Opus, используя примерно одну седьмую reasoning-токенов и менее половины latency по сравнению с Opus 4.8.
logo
Claude Opus 5 позволяет monitoring agents управлять частью собственной памяти в продакшне, делая их автономнее и надёжнее на длинных горизонтах. Это уже напрямую перекликается с темами агентной памяти и RAG.
logo
Claude Opus 5 — сильная agentic coding-модель для длительной многошаговой работы: она глубже понимает codebase, лучше удерживает контекст и эффективнее фиксирует требования для новых функций и исправления багов.

Alignment, безопасность и управляемость

Alignment. По данным предрелизного тестирования Anthropic, Opus 5 — наиболее согласованная с целями компании модель на текущий момент. В автоматизированном поведенческом аудите она лучше следует Конституции Claude, чем Opus 4.8, Sonnet 5 и Fable 5, реже демонстрирует обманное поведение и слабее поддаётся попыткам склонить её к misuse. Звучит сухо, да. Но для enterprise-среды это, пожалуй, один из самых важных пунктов.

В автоматизированном поведенческом аудите Opus 5 получает 2,3 по совокупному показателю misaligned behavior — это лучший, то есть самый низкий, результат среди недавних моделей Anthropic.

Безопасность. При этом Opus 5 не выводит компанию на новый передний край по рискованным dual-use-возможностям. В совместных оценках с партнёрами из частного и государственного секторов Anthropic пришла к выводу, что в биологических исследованиях и offensive cybersecurity модель всё ещё уступает Mythos 5. Подробности приведены в System Card.

Как и в случае с Opus 4.8, модель намеренно не обучали специально на киберзадачах. Тем не менее общий рост способностей привёл к тому, что Opus 5 стала заметно лучше в поиске уязвимостей. Но вот в эксплуатации этих уязвимостей — то есть в превращении находок в реальные киберугрозы — она всё ещё существенно слабее Mythos 5. И, если честно, для многих компаний это скорее плюс, чем минус.

Это видно, например, по результатам в OSS-Fuzz — внутренней оценке Anthropic, где проверяется, насколько хорошо модель может сначала обнаружить, а затем эксплуатировать уязвимость без серьёзной помощи человека. Opus 5 и Mythos 5 близки по части обнаружения, но в создании эксплойтов Opus 5 заметно отстаёт.

В OSS-Fuzz Opus 5 близка к Mythos 5 по выявлению уязвимостей ПО, но заметно слабее в разработке эксплойтов.

Защитные механизмы в Claude Opus 5

Guardrails для Opus 5 настроены так, чтобы не ломать полезные сценарии в кибербезопасности и биологии, но при этом ограничивать действительно рискованные действия. В целом подход похож на Opus 4.8, хотя для узкого класса cyber-задач ограничения стали строже.

Кибербезопасность. Классификаторы для cyber-сценариев здесь менее жёсткие, чем у Fable 5, но всё равно блокируют бинарный поиск уязвимостей, penetration testing и генерацию эксплойтов. При этом модель может помогать с анализом исходного кода и поиском потенциальных проблем безопасности. Для компаний, которым нужна безопасность AI-агентов и контролируемое внедрение AI в чувствительные процессы, это довольно разумный компромисс.

По оценке Anthropic, такие классификаторы будут срабатывать примерно на 85% реже, чем в случае Fable 5. В Claude.ai, Claude Code и Claude Cowork помеченные запросы по умолчанию будут переводиться на Opus 4.8. Такой же fallback можно включить и в API.

Программа Cyber Verification Program упрощает доступ к сценариям, которые иначе были бы ограничены защитными механизмами. Корпоративные клиенты и исследователи, уже участвующие в программе, получают доступ к версии Opus 5 с менее строгими ограничениями.

Биология. Поскольку набор защитных механизмов здесь близок к Opus 4.8, новая модель становится самой мощной общедоступной системой Anthropic для научных исследований. При этом у неё всё ещё есть важные ограничения в длительных автономных исследовательских сценариях — именно там, где риски особенно чувствительны. Запросы по биологии, которые блокируются на Fable 5, теперь будут маршрутизироваться в Opus 5, а не в Opus 4.8.

Для российских компаний, работающих в регулируемых отраслях, здесь важен ещё один слой — не только безопасность, но и AI compliance и соответствие требованиям. Без этого даже сильная модель может так и остаться красивой игрушкой на пилоте. Неприятно, но факт.

С чего начать

Claude Opus 5 уже доступен на всех платформах по цене 5 долларов за миллион входных токенов и 25 долларов за миллион выходных токенов — то есть по той же цене, что и Opus 4.8. Разработчики могут подключать модель через Claude API под идентификатором claude-opus-5.

Также доступен режим Fast mode: в нём модель работает примерно в 2,5 раза быстрее стандартного режима. Как и у Opus 4.8, Fast mode стоит вдвое дороже базовой цены на Claude Platform и доступен через usage credits в Claude Code.

Одновременно с запуском Opus 5 Anthropic выпускает два обновления в beta:

  • Изменение инструментов в середине диалога на Claude Platform. Теперь разработчики могут менять набор доступных инструментов прямо в рамках одной сессии, не сбрасывая prompt cache.
  • Автоматические fallback в API. Если запрос помечается классификаторами безопасности в Opus 5 или Fable 5, его можно автоматически перенаправить на другую модель. При включённом fallback запросы идут к лучшей доступной модели, а не просто блокируются.

Как и предыдущие модели Opus, Opus 5 не вводит дополнительных требований по хранению данных для общего доступа.

Дополнительные рекомендации по эффективной работе с моделью доступны в руководстве по prompting. И да, чтобы выжать из таких моделей максимум, одного хорошего промпта обычно мало — нужна нормальная агентная архитектура, память, маршрутизация, контроль инструментов и внятные правила безопасности. Иначе всё это богатство работает вполсилы. А то и хуже.

Сноски

Frontier-Bench v0.1, график Effort: результаты получены во внутреннем запуске Frontier-Bench v0.1 с использованием harness mini-SWE-agent и backend GKE; приведена средняя reward по 5 попыткам на задачу. Opus 4.8 использовалась как fallback при срабатывании safety-classifier для Opus 5 и Fable 5.

Похожие материалы

Позиция компании по моделям с открытыми весами

Подробнее

Cognizant и Anthropic расширяют партнёрство, чтобы предоставить Claude корпоративным клиентам

Подробнее

Исследовательская повестка для Economic Futures Research Fund

Anthropic делится исследовательской повесткой для Anthropic Economic Futures Research Fund.

Подробнее