Claude Opus 5 вышла с уровнем Fable 5 за половину цены
Производительность Opus 5
Claude Opus 5 заметно превосходит Opus 4.8 при той же стоимости. Пользователь может менять уровень усилий модели: повышать качество рассуждений или экономить токены, чтобы получать ответы быстрее и дешевле.
На задачах по программированию Opus 5 показывает особенно высокие результаты. В Frontier-Bench v0.1 модель обошла всех конкурентов, более чем вдвое превзошла Opus 4.8 по эффективности и при этом обходилась дешевле в расчёте на одну задачу.
На CursorBench 3.2 при максимальном уровне усилий Opus 5 отстала от пикового результата Fable 5 менее чем на 0,5%, потратив вдвое меньше на одну задачу. При высоком, очень высоком и максимальном уровнях усилий она также показала лучшую производительность при заданной стоимости среди остальных моделей.
Источник: anthropic.com
Компания сообщает о похожих результатах в задачах на интеллектуальную работу и решение новых проблем.
Источник: anthropic.com
Источник: anthropic.com
Источник: anthropic.com
Источник: anthropic.com
Источник: anthropic.com
Источник: anthropic.com
Источник: anthropic.com
Научные задачи
Opus 5 стала эффективнее Opus 4.8 в научных исследованиях. На всех тестах по естественным наукам она показала более высокие результаты. Эти тесты охватывают структурную биологию, органическую химию и биоинформатику.
Наиболее заметный прирост пришёлся на задачи по органической химии — например, определение молекулярной структуры по данным спектроскопии. На внутреннем бенчмарке Opus 5 набрала на 10,2 процентного пункта больше Opus 4.8. В задачах о белках, включая прогноз влияния изменений аминокислотной последовательности на функции белка, преимущество составило 7,7 процентного пункта.
Работа с изображениями
Opus 5 также стала заметно лучше создавать визуальные материалы.
Модель тщательнее проверяет собственную работу и продолжает итерации, пока не добьётся результата. В ходе оценок и раннего доступа разработчики и пользователи обнаружили множество примеров самостоятельности и аккуратности Opus 5.
Компания также приводит дополнительные отзывы клиентов, участвовавших в раннем доступе.
Согласованность и безопасность
Во время подготовки к выпуску автоматический аудит поведения назвал Opus 5 наиболее согласованной моделью компании на тот момент. Она лучше соблюдает Конституцию Claude, чем Opus 4.8, Sonnet 5 и Fable 5, реже демонстрирует обманное поведение и меньше поддаётся уловкам, которые могут привести к неправильному использованию.
Кроме того, Opus 5 показала лучшие результаты по предотвращению безрассудных действий с последствиями, которые сложно обратить.
В нашем автоматизированном поведенческом аудите Opus 5 набирает 2,3 балла по показателю общего несогласованного поведения — это самый низкий результат среди наших недавних моделей
Источник: anthropic.com
Модель не расширяет передовые возможности, связанные с опасными задачами двойного назначения. В строгих оценках, проведённых вместе с частными компаниями и государственными партнёрами, Opus 5 уступила Mythos 5 и в биологических исследованиях, и в наступательной кибербезопасности.
Как и Opus 4.8, Opus 5 намеренно не обучали на задачах по кибербезопасности. Несмотря на это, благодаря общему росту возможностей она заметно улучшила результаты в этой области и почти приблизилась к Mythos 5 в поиске уязвимостей. Однако в превращении найденных уязвимостей в рабочие программы для их эксплуатации модель по-прежнему существенно отстаёт от Mythos 5.
Это проверяли с помощью OSS-Fuzz — разработанного компанией теста, который показывает, насколько хорошо модель умеет находить и затем использовать уязвимости без значительной помощи человека. Mythos 5 и Opus 5 с похожим успехом находят уязвимости, но в создании программ для их эксплуатации Opus 5 набрала значительно меньше.
В OSS-Fuzz, одной из наших оценок кибербезопасности, Opus 5 почти не уступает Mythos 5 в выявлении уязвимостей в программном обеспечении (слева), но значительно менее успешен в разработке эксплойтов для них (справа)
Источник: anthropic.com
Защитные механизмы Claude Opus 5 рассчитаны на полезное применение модели в кибербезопасности и биологии. В основном они повторяют настройки Opus 4.8, но для узкого набора киберзадач добавлены более строгие ограничения.
Кибербезопасность
Классификаторы кибербезопасности Opus 5 менее ограничительны, чем у Fable 5. Модель может искать уязвимости в исходном коде, но блокирует сканирование уязвимостей на основе бинарных файлов, тестирование на проникновение и создание программ для эксплуатации уязвимостей — такие действия чаще связаны со злоумышленниками.
По результатам тестов, классификаторы Opus 5 должны срабатывать примерно на 85% реже, чем классификаторы Fable 5. В Claude.ai, Claude Code и Claude Cowork заблокированные запросы по умолчанию передаются Opus 4.8. Такой переход на Opus 4.8 можно включить и в API.
Программа проверки кибербезопасности помогает компаниям и исследователям проводить работы по кибербезопасности, которые иначе ограничивали бы защитные механизмы модели. Участники этой программы уже получили доступ к версии Opus 5 с менее строгими ограничениями.
Биология
Поскольку набор защитных механизмов Opus 5 похож на набор Opus 4.8, новая модель стала самой способной общедоступной моделью компании для научных исследований.
При этом у неё сохраняются ограничения в длительных автономных исследованиях. Именно в таких задачах, по оценке разработчиков, биологические риски ИИ могут быть наиболее существенными. Mythos 5 остаётся более сильной моделью для этого типа биологической работы.
После запуска запросы по биологии, которые блокировались для Fable 5, теперь будут направляться в Opus 5, а не в Opus 4.8.
Доступность и цена
Claude Opus 5 доступна на всех платформах. Стоимость совпадает с Opus 4.8 и составляет $5 за миллион входных токенов и $25 за миллион выходных. Разработчики могут использовать модель с идентификатором `claude-opus-5` через Claude API.
Для модели предусмотрен быстрый режим: он работает примерно в 2,5 раза быстрее стандартного. Как и у Opus 4.8, на Claude Platform и через кредиты использования в Claude Code быстрый режим стоит вдвое дороже базовой цены Opus 5.
Одновременно компания выпустила два обновления в предварительной версии.
Как и предыдущие модели Opus, Opus 5 не требует хранения данных при обычном доступе.
Другие инициативы
Компания открыла исследовательскую предварительную версию стандарта оборудования для моделей — «Стандарт оборудования моделей» (MHS). Это общая спецификация, которая должна позволить ИИ-агентам безопасно управлять физическими устройствами. На первом этапе доступ получит ограниченная группа научных лабораторий и передовых производителей.
С сегодняшнего дня 10 000 учёных по всему миру смогут бесплатно начать пользоваться Claude. Проверенные руководители научных групп получают право на тариф Claude Team, после чего могут добавить участников своей команды: стандартные места предоставляются бесплатно, а премиальные места стоят $15 в месяц. Такая возможность действует до года.
Также компания запускает грантовую программу на $5 млн для независимых исследований влияния ИИ на благополучие пользователей.
Ежедневные новости об ИИ
Каждый день отбираем важные новости об ИИ, роботах и метавселенных и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.
Только важное — каждый день
В Telegram