i
Новости
Новости · 2026-09-28

Anthropic выпустила Claude Sonnet 5.5: задачи обходятся на 30% дешевле благодаря большей скорости и меньшему числу обращений к инструментам

@neuronium_ai @neuronium_ai

Anthropic представила Claude Sonnet 5.5 — более быструю и экономичную версию своей основной модели среднего уровня. В нескольких тестах она почти сравнялась с флагманской Opus 5.5, выпущенной неделей ранее. Sonnet 5.5 генерирует ответы более чем на 30% быстрее предшественницы и, по оценке компании, может сократить стоимость выполнения задачи до 30% за счёт меньшего числа токенов и обращений к инструментам. Цена API не изменилась: $2 за миллион входных и $10 за миллион выходных токенов.

Обложка: Anthropic выпустила Claude Sonnet 5.5: задачи обходятся на 30% дешевле благодаря большей скорости и меньшему числу обращений к инструментам

Sonnet приблизилась к Opus в тестах

Anthropic рекомендует Sonnet 5.5 для повседневной работы с понятными задачами: отладки программ, написания кода и документов, подготовки презентаций и таблиц, а также создания и доработки интерфейсов. Opus 5.5 компания по-прежнему считает более подходящей для неоднозначной работы, где нужны длительные рассуждения и суждения.

Однако результаты собственных тестов Anthropic показывают, что в ряде задач разрыв между моделями заметно сократился.

В GDPval-AA, где оценивают выполнение задач из реальных профессий, Sonnet 5.5 набрала 1844 балла — почти столько же, сколько Opus 5.5 с результатом 1846. Sonnet 5 получила 1449 баллов. В AA-Briefcase новая модель набрала 1811 баллов против 1822 у Opus 5.5.

В проверке работы с компьютером OSWorld 2.1 результат Sonnet 5.5 составил 80,1%. У Opus 5.5 — 81,8%, у Sonnet 5 — 57%. В тесте распознавания диаграмм Chartography новая модель набрала 61,6%, Opus 5.5 — 64,4%, а Sonnet 5 — 15,6%.

Особенно сильные результаты модель показала в программировании. В бенчмарке Terminal-Bench 4.0 Sonnet 5.5 набрала 70,6% при указанных настройках, Opus 5.5 — 66,4%, а Sonnet 5 — 10,3%. В CursorBench 4.0 у Sonnet 5.5 — 55,5%, немного меньше, чем у Opus 5.5 с 57,8%.

Бенчмарки не обязательно точно предсказывают работу модели во всех производственных задачах. Anthropic подчёркивает, что Opus 5.5 всё ещё заметно лучше справляется со сложной работой без чётко заданного результата.

При этом для компаний может оказаться важнее стоимость выполнения задачи, чем место модели в рейтинге. По данным Anthropic, в нескольких проверках Sonnet 5.5 с низким или средним уровнем усилий превзошла лучший результат Sonnet 5 примерно за десятую часть стоимости. В FrontierCode Sonnet 5.5 с высоким уровнем усилий набрала примерно на 10 баллов больше, чем Sonnet 5 с такой же настройкой, и обошлась примерно в пятнадцать раз дешевле на задачу.

В Claude Code и потребительских приложениях Anthropic по умолчанию будет включён средний уровень усилий, а в Claude Platform — высокий. Низкие настройки сокращают задержку и расход токенов, но уменьшают глубину рассуждений. Высокие дают модели больше времени на проверку и доработку результата.

Клиенты сообщают о меньшем числе шагов

Anthropic также передала VentureBeat результаты ранних испытаний у клиентов. Они показывают, как заявленная экономия может проявиться в корпоративных процессах.

В Box вице-президент по продуктам ИИ Яшодха Бхавнани рассказала, что Sonnet 5.5 повторно проверяла исходные документы и находила ошибки, которые пропускала предыдущая модель. По её словам, новая версия была в 2,4 раза быстрее, точнее и использовала на 12% меньше токенов.

Zendesk проверила модель на сотнях обращений в поддержку — от подготовки ответов клиентам до решений об эскалации. Директор по ИИ Абхинай Катурия сообщил, что обработка заявок ускорилась на 20%, а неверных решений стало меньше, чем у моделей Claude, которые компания использует в рабочей среде.

Похожую картину увидели в Slack. Главный инженер Кёртис Аллен рассказал, что Sonnet 5.5 превзошла Sonnet 5 почти во всех внутренних проверках Slackbot без изменений промтов. При этом ей потребовалось меньше шагов и примерно на 14% меньше выходных токенов.

Для агентов, выполняющих задачи по программированию, сокращение числа шагов может быть особенно полезно. Сооснователь и технический директор Lovable Фабиан Хедин сообщил, что в испытаниях Sonnet 5.5 требовала примерно на треть меньше обращений к инструментам и примерно вдвое меньше запусков командной оболочки.

В Base44 проверили 118 реальных сборок приложений. Sonnet 5.5 достигала результатов, сравнимых с Opus 5, в среднем за 3,6 итерации на сборку. Opus 5 потребовалось 7,7 итерации. Среди сравниваемых моделей Sonnet 5.5 также допускала меньше всего неудачных обращений к инструментам.

Эти результаты показывают, почему одной цены токенов недостаточно для оценки расходов на ИИ-агентов. Каждый лишний вызов инструмента, неудачное действие и повторная попытка увеличивают задержку и затраты на инфраструктуру, а также создают дополнительную возможность для сбоя в автоматизированном процессе.

Цены на модели среднего уровня сближаются

Sonnet 5.5 вышла на рынок, где усиливается конкуренция между моделями дешевле самых дорогих передовых систем.

На прошлой неделе OpenAI выпустила GPT-6 Sol. Стандартная цена её API сейчас такая же, как у Sonnet 5.5: $2 за миллион входных и $10 за миллион выходных токенов. Кэшированные входные токены стоят $0,20 за миллион, запись в кэш — $2,50. OpenAI позиционирует Sol для сложных задач программирования и работы ИИ-агентов. Размер контекстного окна — 1,05 млн токенов.

Google предлагает Gemini 3.8 Flash дешевле обеих моделей. До конца 2026 года вводная цена составляет $0,75 за миллион входных и $3,75 за миллион выходных токенов. Google сообщила, что с 1 января 2027 года стандартные цены вырастут соответственно до $1,50 и $7,50.

Недавно китайская электронная компания и быстро растущая лаборатория ИИ Xiaomi выпустила передовую модель MiMo-V2.6-Pro и модель среднего уровня Flash под разрешительной лицензией MIT, удобной для корпоративного использования. Разработчики и компании могут бесплатно скачать модели и настраивать их под свои задачи. При использовании через API они также остаются среди более доступных моделей.

В перечне моделей указана и Grok 4.7 Fast (Cursor): более 256 тысяч входных токенов, до 500 тысяч.

Anthropic не пытается выиграть конкуренцию одной лишь низкой ценой токенов. Компания делает ставку на общую эффективность: если модель решает задачу с меньшим числом шагов рассуждения, токенов и обращений к инструментам, её использование может обойтись дешевле даже при прежней цене за токен.

Это отличается от подхода при запуске Sonnet 5. В июне Anthropic представила её по вводной цене $2 за миллион входных и $10 за миллион выходных токенов. В августе компания закрепила эти тарифы, отказавшись от ранее запланированного повышения до $3 и $15.

Улучшенные возможности в кибербезопасности сопровождаются ограничениями

Вместе с ростом возможностей появилась и новая мера безопасности. Sonnet 5.5 — первая модель линейки Sonnet, при запуске которой Anthropic использует ограничения в сфере кибербезопасности, созданные по образцу защитных мер для моделей компании с самыми широкими возможностями.

По словам Anthropic, обычная разработка программ и устранение уязвимостей должны работать как прежде. Но на некоторые запросы с повышенным риском модель автоматически переключится на Sonnet 5. Компания планирует расширить программу Cyber Verification Program: проверенные специалисты по защите смогут получить доступ к более продвинутым возможностям Sonnet 5.5, Opus 5.5 и моделей Mythos.

Anthropic также вводит меры против так называемых атак по дистилляции модели. При такой атаке пытаются воспроизвести возможности модели, отправляя ей запросы в промышленном масштабе. Критики отмечают, что многие современные открытые большие языковые модели обучаются на данных, созданных другими. Они также указывают, что Anthropic сама использовала большие объёмы материалов, защищённых авторским правом, не получив явного согласия или оплаты от многих авторов и правообладателей. Поэтому, по мнению критиков, компании трудно с этической или моральной точки зрения утверждать, что создание новой модели на основе ответов её собственной модели преступно или неправомерно.

Sonnet 5.5 — первая модель Sonnet с классификаторами, которые должны блокировать извлечение её рассуждений. Кроме того, Anthropic расширяет систему «сохранённого мышления», чтобы рассуждения нельзя было отделить от учётной записи, в которой они были созданы. Защитные меры для биологических запросов остались такими же, как у Sonnet 5.

Модель доступна через основные облака

Claude Sonnet 5.5 будет доступна напрямую у Anthropic, а также через Amazon Web Services, Google Cloud и Microsoft Azure. Для неё предусмотрена поддержка режима нулевого хранения данных. Разработчики могут работать с моделью через Claude Platform, указав идентификатор claude-sonnet-5-5.

В ближайшие недели Anthropic планирует выпустить Claude Haiku 5.5, предназначенную для больших объёмов запросов и задач, где особенно важна низкая стоимость.

Для корпоративных разработчиков Sonnet 5.5 может оказаться важнее остальных моделей семейства: API-тарифы не снизились, но Anthropic стремится приблизить средний уровень к премиальному, чтобы для многих задач компаниям не требовалась более дорогая модель.

ИИ-агенты OpenAI использовали учебную игру Google по кибербезопасности, чтобы собрать торговые данные ООН Мужчина заявил, что ИИ Muse от Meta раскрыл незнакомцам его домашний адрес Meta запускает ИИ-платформу для бизнеса и поручает её главе MongoDB Nvidia представила платформу для защиты от ИИ-агентов и выкупит акции ещё на $150 млрд Психолог из Гарварда призвал сосредоточиться на практической безопасности ИИ, а не на риторике конца света Крестные отцы ИИ предупреждают о возможном «взрыве интеллекта», который выйдет из-под контроля Meta хочет монетизировать Muse, продавая компаниям ИИ-сервисы Помните трёх братьев, которые скупают проблемные новостные сайты и превращают их в фабрики ИИ-контента? У одного из них обнаружились обширные связи с Гислейн Максвелл Modulate привлекла $25 млн на модели анализа голоса и аналитическую платформу Решать величайшие математические задачи было искусством. А потом пришёл ИИ Каждая ИИ-лаборатория считает себя ответственной — и, по словам исследователя безопасности Райана Гринблатта, именно это подпитывает гонку вооружений в ИИ Преподаватели компании Эуэна Блэра рассказали о «невыносимом стрессе» из-за оценок их работы с помощью ИИ OpenAI приостановила обучение самых мощных моделей после того, как агенты атаковали правительственные сайты Nvidia отвечает на угрозу вышедших из-под контроля агентов открытой системой защиты ИИ Суд в Ухане включил затраты на производство ИИ в расчёт ущерба по делам о нарушении авторских прав Лидеры ИИ десятилетиями знали об угрозе вымирания человечества ИИ-агенты вот-вот заполонят рабочие команды — никто к этому не готов Следующий этап развития ИИ — учиться на ваших сомнительных игровых навыках Кто ответит, если ИИ-агенты выйдут из-под контроля? Anthropic не придёт на слушания в сенате об ИИ и дата-центрах после взлома OpenAI

Ежедневные новости об ИИ

Каждый день отбираем важные новости об ИИ и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.

Только важное — каждый день

В Telegram