Anthropic утверждает, что Opus 5.5 превосходит не только Fable 5.1, но и другую прежнюю флагманскую модель Mythos 5.1, хотя обе появились всего несколько недель назад.
Цена Opus 5.5 через API снизилась на 20% относительно Opus 5:
По оценке Anthropic, типичные задачи обходятся примерно на 40% дешевле: модель использует меньше токенов для завершения работы.
Стоимость записи в кэш также уменьшилась на 20% — с $6,25 до $5 за миллион токенов. Чтение из кэша подешевело сильнее: с $0,50 до $0,20 за миллион токенов.
Модель показала одни из самых высоких результатов среди моделей Anthropic в нескольких направлениях:
Результаты Opus 5.5 в основном выше показателей Fable 5.1, хотя API у Fable 5.1 стоит на 150% дороже.
Параллельно поставщики передовых моделей всё чаще конкурируют не только баллами в бенчмарках, а количеством полезной работы, выполненной за один доллар.
Grok 4.7 Fast (Cursor) — более 256 000 входных токенов, до 500 000
В тот же день OpenAI выпустила GPT-6 Sol и GPT-6 Luna — две более дешёвые модели семейства GPT-6. Sol стоит $2 за миллион входных токенов и $10 за миллион выходных, то есть ровно вдвое дешевле базовых тарифов Opus 5.5.
Luna предлагает тариф $0,10/$0,50 — на 97,5% ниже Opus 5.5 и для входных, и для выходных токенов.
Одновременный запуск двух линеек обостряет вопрос для корпоративных клиентов: важнее уже не то, у какого поставщика есть одна самая способная модель, а сколько полезной автономной работы она выполнит за определённую сумму.
Opus 5.5 делает ставку на программирование
Главные заявления Anthropic связаны с задачами разработки, в которых агент должен долго работать с кодовой базой, а не отвечать на отдельные вопросы по программированию.
В Terminal-Bench 4.0 Opus 5.5 получил 66,4% против 55,8% у Fable 5.1 и 52,3% у Opus 5. В FrontierCode v1.1 Main результат составил 54,4% против 50,3% у Fable 5.1 и 48,0% у Opus 5. В CursorBench 4.0 Opus 5.5 набрал 57,8%, тогда как Fable 5.1 и Opus 5 получили 51,8% и 46,6% соответственно.
| Бенчмарк | Opus 5.5 | Fable 5.1 | Opus 5 |
|---|---:|---:|---:|
| Terminal-Bench 4.0 | 66,4% | 55,8% | 52,3% |
| FrontierCode v1.1 Main | 54,4% | 50,3% | 48,0% |
| CursorBench 4.0 | 57,8% | 51,8% | 46,6% |
При этом Opus 5.5 показала одни из самых высоких результатов, о которых Anthropic сообщала для своих моделей, — в задачах с ИИ-агентами, профессиональной работе со знаниями, а также научном и междисциплинарном рассуждении. По большинству приведённых показателей новая модель опережает Fable 5.1, но базовые тарифы её API на 60% ниже.
Anthropic также приводит примеры крупных задач из реальной разработки. Один из ранних тестировщиков выполнил миграцию кодовой базы объёмом 680 000 строк менее чем за день. Другой использовал Opus 5.5 для аудита и исправления проекта на 200 000 строк менее чем за три часа. Opus 5 справилась с той же задачей более чем за 20 часов и использовала в 2,5 раза больше токенов.
Во внутреннем эксперименте Anthropic переносила HAProxy с C на Rust. Обе модели — Opus 5.5 и Fable 5.1 — прошли почти все регрессионные тесты проекта, но Opus 5.5 завершила работу за 9,5 часа против 12 часов у Fable 5.1 и обошлась на 51% дешевле.
Директор по продукту GitHub Марио Родригес сообщил в заявлении, переданном Anthropic, что Opus 5.5 использовала «одни из самых низких показателей по числу токенов и шагов» среди моделей, которые GitHub проверял в Copilot CLI и VS Code. При этом она решала больше терминальных задач, чем Opus 5, менее чем за половину числа шагов.
Другие ранние тестировщики — Lovable, Spotify и Optiver — также сообщили о снижении количества обращений к модели, выходных токенов или времени выполнения.
Эти результаты выбраны самими поставщиками и клиентами, а не получены в независимых оценках. Однако они показывают, на какую операционную метрику Anthropic предлагает смотреть корпоративным заказчикам: сколько координации, повторных попыток и токенов требуется до фактического завершения работы.
GPT-6 Sol меняет сравнение цен
OpenAI продвигает тот же подход с GPT-6 Sol и Luna, но предлагает значительно более низкие базовые тарифы API.
Sol стоит $2/$10 за миллион входных и выходных токенов и предназначена для регулярных сложных задач:
Luna с тарифом $0,10/$0,50 рассчитана на массовые операции:
Флагманская GPT-6 Astra остаётся предназначенной для задач, где максимальная способность важнее стоимости.
Поэтому именно Sol становится главным ценовым конкурентом Opus 5.5: её тарифы на незакэшированные токены ровно на 50% ниже.
Кэширование сокращает часть разрыва. OpenAI заявляет, что GPT-6 даёт скидку 90% на чтение закэшированных входных данных. Это означает тариф $0,20 за миллион закэшированных токенов Sol — такую же номинальную цену чтения из кэша Anthropic указывает для Opus 5.5. Для Luna соответствующий тариф составляет всего $0,01 за миллион токенов.
OpenAI также заявляет, что GPT-6 может сохранять закэшированный контекст, когда разработчик меняет глубину рассуждения или включает и отключает инструменты. Это потенциально повышает повторное использование кэша в длительных задачах ИИ-агентов.
Однако сами тарифы не показывают полную стоимость задачи. Более дешёвая модель может оказаться дороже, если ей требуется больше вызовов, она генерирует больше токенов или часто ошибается и вынуждает систему повторять попытки.
Пока нет полноценного публичного сравнения GPT-6 Sol и Claude Opus 5.5 на основных бенчмарках для ИИ-агентов, проведённого в одной и той же среде.
OpenAI сообщает, что GPT-6 Sol при максимальной глубине рассуждения получила 33,2% в AutomationBench 1.0.6, а стоимость одной задачи составила $0,27. Anthropic, в свою очередь, приводит раннюю оценку Opus 5.5 в Zapier: 40,0%.
На первый взгляд, эти числа говорят в пользу Opus 5.5 по доле завершённых задач, тогда как Sol предлагает гораздо более низкую цену.
Но OpenAI отмечает, что результаты конкурентов в её релизе взяты из публичных отчётов, а не получены в той же среде оценки. Поэтому сравнивать 33,2% и 40,0% как контролируемый прямой поединок нельзя.
OpenAI также заявляет, что Sol при максимальной глубине рассуждения способна сравниться с Claude Fable 5.1 в FrontierCode 1.1 Main при гораздо меньшей стоимости. В собственном релизе Anthropic ставит Opus 5.5 выше Fable 5.1 в FrontierCode. При этом ни одна из компаний не опубликовала общий прогон Opus 5.5 и Sol в одной среде и с одинаковыми настройками.
Luna меньше соперничает с Opus напрямую и скорее становится вариантом для маршрутизации задач. OpenAI сообщает, что Luna получила 66,6% в DeepSWE v1.1 при максимальной глубине рассуждения. По словам компании, она достигает результатов, сопоставимых с более старыми конфигурациями Claude высокого класса, но стоимость одной задачи у неё намного ниже.
Для корпоративных систем это создаёт ещё один вариант: не отправлять каждый шаг работы ИИ-агента к модели с тарифами уровня передовых моделей.
Профессиональная работа строится по той же схеме
Anthropic также позиционирует Opus 5.5 для финансового анализа, исследований, подготовки документов и других профессиональных процессов.
В GDPval-AA v2.1 — бенчмарке рабочих задач из 44 профессий — Opus 5.5 получила 1846 Elo против 1735 у Fable 5.1 и 1708 у Opus 5.
Во внутренней исследовательской проверке автоматическая система отклоняла любой отчёт с выдуманной цифрой или цитатой. Anthropic сообщает, что 16 из 18 отчётов Opus 5.5 преодолели установленный порог качества при разных настройках глубины работы. Fable 5.1 и Opus 5 не преодолели его ни в одной попытке.
Поскольку этот тест разработала сама Anthropic, его следует считать дополнительным подтверждением, а не независимым бенчмарком.
Это различие важно на фоне того, что поставщики всё чаще говорят об экономике выполнения задач. Запуск GPT-6 Sol также сосредоточен на профессиональных процессах и стоимости успешно выполненной задачи, а не только на отдельных показателях способностей. OpenAI утверждает, что Sol при максимальной глубине рассуждения может превзойти GPT-6 Astra с низкой глубиной в AutomationBench и при этом стоить существенно дешевле за один запуск.
Формируется подход с маршрутизацией моделей, а не с переходом всей системы на одну модель:
Для разработчиков снизили цены, но изменили поведение
Claude Opus 5.5 получила контекстное окно на 1 миллион токенов, поддерживает до 128 000 выходных токенов в синхронном режиме и использует идентификатор API-модели claude-opus-5-5.
Anthropic также поддерживает ответы объёмом до 300 000 токенов через API Message Batches в конфигурации с бета-статусом.
Однако Opus 5.5 нельзя считать полной заменой Opus 5 для любого приложения.
Адаптивное рассуждение теперь включено всегда. Разработчики управляют его глубиной через параметр effort, а не отключают рассуждение полностью.
Другие изменения затрагивают работу приложений:
computer_20251124 отклоняется в Claude API и Google Cloud;Для производственных систем с ИИ-агентами это влияет на маршрутизацию инструментов, сохранённое состояние диалогов, регрессионные тесты и пользовательские интерфейсы.
Настройки безопасности меняют работу системы
Anthropic дополнила рост способностей Opus 5.5 дополнительными ограничениями в областях кибербезопасности, биологии и дистилляции моделей.
Некоторые запросы по кибербезопасности могут автоматически перенаправляться к Opus 4.8. Ограничения для чувствительных биологических задач также могут приводить к переходу на другую модель. Anthropic сообщает, что проверенные организации смогут получить более широкий доступ через её программы верификации.
Компания утверждает, что Opus 5.5 превзошла недавние модели Claude почти по всем показателям в автоматизированном поведенческом аудите примерно из 2 000 сценариев.
В новой проверке на устойчивость ограничений Opus 5.5 примерно на 85% реже пыталась обойти установленные границы, чем Opus 5 или Claude Mythos 5.1. При этом Anthropic предупреждает: надёжно обнаруживать каждую ошибку до развертывания системы по-прежнему невозможно.
OpenAI также подчёркивает улучшения согласованности Sol и Luna. Компания сообщает о снижении числа случаев, когда модели вводят в заблуждение, заявляя о завершённой работе по программированию, а также о сокращении других нежелательных действий ИИ-агентов.
OpenAI отдельно отмечает, что эти проверки намеренно построены как атаки на систему и не должны восприниматься как частота ошибок при обычном использовании.
Конкуренция смещается к стоимости готовой задачи
Claude Opus 5.5 доступна через API Anthropic, а также в экосистемах AWS, Google Cloud и Microsoft.
GPT-6 Sol и Luna доступны через API OpenAI с идентификаторами gpt-6-sol и gpt-6-luna. Их также постепенно распространяют через ChatGPT Work и Codex.
После одновременного запуска во вторник рынок выглядит сложнее, чем таблица лидеров по бенчмаркам.
Anthropic заметно снизила стоимость передовых возможностей Claude: Opus 5.5 превосходит прежнюю флагманскую модель общего доступа по большинству опубликованных компанией бенчмарков и стоит на 60% дешевле за базовый API-токен.
OpenAI отвечает на другом уровне цен: Sol стоит вдвое дешевле Opus 5.5 по незакэшированным токенам, а Luna создаёт ещё более дешёвый уровень для задач, которым не требуется рассуждение на уровне флагманских моделей.
Пока обе новые модели не пройдут контролируемые проверки в одной среде, сводить выбор к единственному победителю по соотношению цены и результата преждевременно.
Для корпоративных команд более полезным сравнением становится внутренняя проверка на собственных задачах:
Война моделей теперь идёт не только за самый высокий балл. Всё большее значение имеет количество завершённой работы, которое передовая модель может обеспечить за каждый потраченный доллар.
Читайте также
Как получить свою долю в компенсации Apple на $250 млн по делу Siri
Говорить необязательно: Jev показывает ценность моделей принятия решений
Насколько безопасно жить рядом с дата-центром? Возможные риски
Tokenmaxxing: опасный новый тренд, который бизнесу пора остановить
Оптический проект MIT подстёгивает ловкость роботов
Не дайте блеску генеративного ИИ заслонить лёгкие победы предсказательного ИИ
От дашбордов к решениям: ИИ меняет правила игры в SaaS
ИИ помогает метаосознанности следить за осознанностью и сдерживать бездумность
Грузовик-робот уверяет: его ИИ ездит по шоссе без предварительного обучения
Агентный ИИ может найти свой идеальный полигон в женском спорте
Дочь Робина Уильямса в ужасе от ИИ-роликов о нём с теориями заговора спустя годы после смерти
Claude Opus 5.5 не уступает Fable 5.1, дешевле и обещает меньше «клау́довского» текста
DraftKings использует ИИ, чтобы выявлять зависимых игроков и подсаживать их
Как UK AISI и EvalEval делают результаты бенчмарков воспроизводимыми
AstroForge передаёт ИИ управление своим следующим космическим аппаратом
Джордж Осборн из OpenAI: противники дата-центров тормозят развитие Британии
Rabbit возвращается — теперь с приложением ИИ-агента
OpenAI призывает к международным стандартам для ИИ, способного к самоулучшению
Трамп в ООН: США теперь называют ИИ «сверхинтеллектом» во всех официальных документах
IPO Nscale вновь проверит готовность Уолл-стрит к концентрированным ставкам на ИИ
Ежедневные новости об ИИ
Каждый день отбираем важные новости об ИИ и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.
Только важное — каждый день
В Telegram