i
ДАТАИСТ
Новости · 2026-09-11

DeepSeek-V4.1-Flash вышла: $0,003 за 1 млн кэшированных входных токенов вне пика и результаты выше GPT-5.6 Sol и Claude Opus 5

@neuronium_ai @neuronium_ai

DeepSeek выпустила DeepSeek-V4.1-Flash — модель с 552 млрд параметров в архитектуре смеси экспертов, встроенным зрением и контекстом на 1 млн токенов. В непиковые часы миллион входных токенов при попадании в кэш стоит $0,003, а выходных — $0,60. Модель рассчитана на повторную работу с большими контекстами: репозиториями, описаниями инструментов, системными промтами и историей диалога. В тестах DeepSeek-V4.1-Flash сравнялась или обошла некоторые передовые модели, но её результаты зависят от режима рассуждения и типа рабочей нагрузки.

Обложка: DeepSeek-V4.1-Flash вышла: $0,003 за 1 млн кэшированных входных токенов вне пика и результаты выше GPT-5.6 Sol и Claude Opus 5

DeepSeek заявила о запуске DeepSeek-V4.1-Flash прошлой ночью. Модель получила основу на 552 млрд параметров в архитектуре смеси экспертов, встроенную поддержку изображений и контекстное окно на 1 млн токенов. Архитектура должна удешевить многократное чтение больших контекстов.

Для разработчиков, которые оценивают модель для агентов для программирования и других длительных процессов, одного базового тарифа API недостаточно.

В непиковые часы DeepSeek берёт:

$0,003 за 1 млн входных токенов при попадании в кэш;
$0,15 за 1 млн входных токенов при промахе кэша;
$0,60 за 1 млн выходных токенов.

В часы пик все эти цены удваиваются.

Разница важна для ИИ-агента, который снова и снова работает с одним репозиторием, описаниями инструментов, системными промтами или историей разговора. В таком случае он может перечитывать гораздо больше сохранённого контекста, чем нового. Сама DeepSeek отмечает, что оплата попаданий в кэш может составлять значительную часть расходов на ИИ-агентов.

Окно пиковой нагрузки у DeepSeek действует с понедельника по пятницу с 01:00 до 04:00 и с 06:00 до 10:00 по всемирному координированному времени. Остальные часы считаются непиковыми. Для задач, которые можно запускать по расписанию, время выполнения становится ещё одним способом контролировать расходы.

Это позволяет рассматривать V4.1-Flash как пример проблемы, которую, согласно исследованию VentureBeat, многие компании до сих пор не могут точно оценить.

В июльском обзоре VentureBeat Pulse Research, проведённом среди 170 компаний с числом сотрудников более 100, только 47% респондентов заявили, что строго отслеживают стоимость вычислений для ИИ и окупаемость таких расходов. Значит, 53% этого не делают. Ещё 12% компаний пока не занимались ограничениями памяти при инференсе, включая объём кэша KV, а 7% вообще не знали об этом ограничении. Даже среди организаций, которые уже используют ИИ в производственном масштабе, доля ведущих строгий учёт расходов составила лишь 56%.

Для разработчиков вывод простой: сравнение моделей только по цене некэшированных входных данных может скрыть один из наиболее быстро растущих компонентов экономики ИИ-агентов.

$0,0031 млн кэшированных входных токенов
$0,151 млн некэшированных входных токенов
$0,601 млн выходных токенов

Цена меняет сравнение

Непиковый тариф DeepSeek для входных данных из кэша необычно низок по сравнению с передовыми API, с которыми компания сопоставляет V4.1-Flash.

OpenAI указывает для GPT-5.6 Sol цену $4 за 1 млн обычных входных токенов, $0,40 за 1 млн кэшированных входных токенов и $20 за 1 млн выходных. Anthropic берёт $5 за стандартные входные токены, $0,50 за попадание в кэш Claude Opus 5 и $25 за выходные токены. У Kimi K3 от Moonshot ИИ тариф составляет $3 за 1 млн входных токенов при промахе кэша, $0,30 при попадании и $15 за выходные токены.

Сравнение не полностью равноценно: самые низкие тарифы DeepSeek действуют только в непиковые часы. Но даже в часы пик V4.1-Flash стоит всего $0,006 за 1 млн кэшированных входных токенов, $0,30 за 1 млн некэшированных входных токенов и $1,20 за 1 млн выходных токенов.

Рассмотрим упрощённый расчёт. ИИ-агент сохраняет повторно используемый префикс на 500 000 токенов и обращается к нему в 100 запросах. Это 50 млн кэшированных входных токенов. Если не учитывать плату за запись в кэш, новый некэшированный контекст и выходные данные, такие чтения будут стоить около $0,15 у V4.1-Flash в непиковые часы. Для сравнения, у Kimi K3 они обойдутся в $15, у GPT-5.6 Sol — в $20, а у Claude Opus 5 — в $25 по опубликованным тарифам чтения из кэша.

В реальных задачах идеального повторного использования кэша не будет. Общая цена зависит от длины ответа, токенов рассуждения, повторных запусков, вызовов инструментов и доли успешно выполненных задач. Поэтому разработчикам стоит измерять долю попаданий в кэш и стоимость завершённой задачи, а не просто умножать общее число промтовых токенов на рекламную цену входных данных.

DeepSeek-V4.1-Flash теперь находится почти у самого нижнего края мирового рынка платных API и при этом выглядит способнее, чем можно ожидать от такого ценового уровня.

При тарифе $0,15 за входные и $0,60 за выходные токены — всего $0,75 за 1 млн токенов в непиковые часы — модель уступает в текущей таблице только Muse Spark уровня Contributor от Meta и MiMo-V2.5 Flash. Даже пиковая цена $0,30 за входные и $1,20 за выходные токены, то есть $1,50 суммарно, позволяет ей сравняться с MiniMax-M3 и промотарифом LongCat. Это значительно ниже среднего сегмента с ценами около $4,50–$8 и намного ниже передовых моделей премиум-класса, включая Claude Fable/Mythos 5.1, GPT-6 Astra и GPT-5.6 Sol в быстром режиме.

Стратегия DeepSeek заключается не только в выпуске дешёвой «быстрой» модели. Компания превращает V4.1-Flash в основной центр своей линейки API. В документации сказано, что запросы к прежней V4 Flash теперь обслуживаются через V4.1-Flash. Также DeepSeek утверждает, что V4.1 Flash «полностью превзошла V4 Pro по производительности, стоимости, скорости и общему времени». После 14 сентября 2026 года запросы к V4 Pro будут направляться на V4.1 Flash — до выхода будущей V4.1 Pro.

Данные VentureBeat Pulse показывают, что системы измерений компаний не успевают за этой экономикой. Только 31% опрошенных назвали стоимость 1 млн токенов одним из основных показателей успеха инфраструктуры. На первом месте оказались доступность и надёжность — 51%, затем производительность разработчиков и скорость развёртывания — 39%. Общую стоимость владения в числе главных критериев выбора указали лишь 22%.

Технический отчёт DeepSeek объясняет, что стоит за экономикой попаданий в кэш. Компания утверждает, что глобальный кэш KV хранится в постоянном кэше не менее 72 часов. Краткоживущий кэш KV механизма внимания со скользящим окном, напротив, размещается в распределённом пуле памяти, на который выделяют 10% оперативной памяти серверов. Срок его хранения измеряется минутами. Если долгоживущий глобальный кэш сохранился, а состояние внимания со скользящим окном — нет, V4.1-Flash восстанавливает недостающие данные, повторно обрабатывая только последнее окно внимания, а не всю историю.

V4.1-Flash уменьшает кэш, а не модель

Архитектурное различие тоже имеет значение. V4.1-Flash использует то, что DeepSeek называет архитектурой Causal Encoder-Decoder: 40 слоёв Transformer разделены на причинный кодировщик из 20 слоёв и декодер из 20 слоёв. При чтении входных данных, то есть на этапе предварительного заполнения, активируются 8 млрд параметров на токен. При генерации ответа — 16 млрд.

Поэтому модель нельзя описывать как систему с 8 млрд активных параметров на всём пути инференса: 8 млрд активируются на этапе предварительного заполнения, а 16 млрд — на этапе декодирования.

В архитектуре также используются Compressed Sparse Attention 2, иерархическая разреженная индексация и кэширование KV в формате FP4. По данным DeepSeek, эти методы уменьшают глобальный кэш KV до 890 байт на токен — примерно до четверти размера кэша V4-Flash. Требования к хранению постоянного кэша снижаются примерно до одной восьмой.

Для ИИ-агентов, которые работают с большим количеством входных данных, это может заметно улучшить обслуживание. Агент для программирования, постоянно перечитывающий репозиторий, как раз относится к задачам, где эффективность предварительного заполнения и кэша KV способна определять расходы.

Однако слово «Flash» больше не означает небольшую модель. Предыдущая V4-Flash имела основу на 284 млрд параметров и активировала 13 млрд. В V4.1-Flash основа выросла до 552 млрд параметров — примерно на 94%. Число активных параметров при предварительном заполнении снизилось с 13 млрд до 8 млрд, но при генерации выросло с 13 млрд до 16 млрд.

Кроме того, 552 млрд — это только основа модели. В техническом отчёте DeepSeek отдельно указаны ещё 196 млрд параметров в модулях условной памяти Engram, к которым обращаются разреженно.

Такой компромисс вызвал скептическую реакцию разработчиков. Один из участников обсуждения запуска на Hacker News усомнился, что модель с 552 млрд параметров всё ещё можно считать «быстрой». По его мнению, намного больший общий размер заметно усложняет локальное развёртывание, даже если разреженная активация и архитектура кэша повышают эффективность обслуживания.

Эта критика уточняет, а не отменяет заявление DeepSeek об эффективности.

V4.1-Flash не компактнее V4-Flash по общему числу весов. Модель рассчитана на меньший объём вычислений при обработке токенов и существенно меньший расход памяти для хранения длинных контекстов. Для клиентов, которые получают инференс через DeepSeek, это может означать более низкие цены API. Для команд, планирующих самостоятельно размещать веса по лицензии MIT, рост с 284 млрд до 552 млрд параметров делает требования к оборудованию заметно менее удобными.

Технический отчёт содержит аргумент против утверждения, что модель просто стала больше. DeepSeek заявляет, что архитектура CED примерно вдвое сокращает вычисления на этапе предварительного заполнения для достаточно длинных последовательностей. При этом количество операций с плавающей точкой для декодирования одного токена увеличивается примерно на 25%, когда длина контекста возрастает в 256 раз — с 4 000 токенов до 1 млн. Иными словами, V4.1-Flash больше по числу весов, но объём работы при росте контекста увеличивается гораздо медленнее.

Есть и оговорка. DeepSeek прямо говорит, что новая архитектура создаёт границы надёжности, которые компания пока не описала полностью. Возможные ошибки разреженного выбора в CSA2 и приблизительное восстановление состояния в механизме SWA Bounded Replay могут ухудшать способности модели в непроверенных редких кейсах. Особенно это касается разреженного поиска по очень длинным контекстам и восстановления после перезапуска кэша. DeepSeek утверждает, что в собственных тестах не наблюдала систематического ухудшения, но планирует дополнительные стресс-тесты.

В релизе DeepSeek также сказано, что организациям, заинтересованным в крупномасштабном развёртывании, стоит связаться с компанией, если у них есть ресурсы примерно на 2 000 GPU и кластер хранения данных.

Результаты зависят от типа задачи

DeepSeek сообщает, что V4.1-Flash набрала 74,2 балла в DeepSWE v1.1. Это немного выше показателя Claude Opus 5 — 74,0, и GPT-5.6 Sol — 73,0. Кроме того, DeepSeek приводит для V4.1-Flash результаты 88,1 в CyberGym и 54,8 в AutomationBench.

Эти оценки проводила сама DeepSeek, и превосходство не распространяется на все тесты. Claude Opus 5 опережает V4.1-Flash в Terminal-Bench 3.0 со счётом 43,3 против 30,0 и в Terminal-Bench 4.0 со счётом 51,8 против 31,2. В таблице DeepSeek GPT-5.6 Sol лидирует в GPQA Diamond и SEC-Bench Pro.

В высоких результатах есть ещё одна переменная стоимости — усилие рассуждения. Для сравнительной таблицы DeepSeek использовала максимальное значение 100. В собственных тестах компании повышение усилия с 25 до 100 увеличило результат DeepSWE v1.1 с 66,0% до 74,2%, а Terminal-Bench 2.1 — с 82,4% до 90,6%. При этом модель использовала примерно в 2,5 раза больше выходных токенов.

DeepSeek отмечает, что основной прирост получается на ранних этапах. Значения усилия от 60 до 80 дают большую часть точности максимального режима при менее чем половине бюджета токенов. Последний переход к 100 увеличивает длину траекторий ИИ-агента в 1,6–1,8 раза, но даёт сравнительно небольшой прирост.

Для разработчиков это ещё один выбор при настройке маршрутизации. В публичном API DeepSeek доступны режимы low, high и max, которым соответствуют значения усилия рассуждения 50, 75 и 100. Команда, оптимизирующая стоимость успешно выполненной задачи, может обнаружить, что оптимальный режим находится не на максимальном уровне, использованном в таблицах лидеров.

Первые сторонние данные, переданные VentureBeat, также говорят скорее о соотношении цены и качества, чем о безусловном превосходстве по интеллекту.

OpenDesign заявила, что V4.1-Flash достигла 98% показателя качества GPT-6 Astra при 1,4% его стоимости на собственном наборе повседневных дизайнерских запросов. Это узкая сторонняя проверка, а не общая оценка модели, но она поддерживает идею измерять объём успешно выполненной работы на доллар, а не только место в бенчмарке.

Есть и ещё одна особенность для производственных систем. DeepSeek вывела из эксплуатации V4-Flash и V4-Flash-Vision-Exp, временно направив существующие идентификаторы этих моделей на V4.1-Flash. Кроме того, с 14 сентября запросы к deepseek-v4-pro будут направляться на V4.1-Flash до выхода V4.1-Pro.

Разработчики на Hacker News отдельно раскритиковали эту политику. По их мнению, замена модели за существующим производственным идентификатором может сделать недействительными регрессионные тесты, даже если новая модель формально лучше или дешевле. Для команд с тщательно настроенными промтами и поведением ИИ-агентов переход на другую модель остаётся отдельной задачей для тестирования.

Релиз на фоне расширения бизнеса

Запуск V4.1-Flash произошёл на фоне расширения коммерческих планов DeepSeek. На этой неделе Reuters сообщил, что компания привлекла CITIC Securities для подготовки к возможному размещению акций на шанхайской площадке STAR Market. Reuters также написал, что текущий раунд финансирования может оценить DeepSeek в сумму до 500 млрд юаней, или примерно $75 млрд.

На этом фоне выпуск выглядит не столько попыткой победить во всех бенчмарках, сколько способом снизить стоимость масштабного запуска способных моделей.

Для разработчиков вопрос теперь звучит конкретнее, чем просто «выпустила ли DeepSeek ещё одного дешёвого конкурента передовых моделей». Нужно проверить, достаточно ли рабочая нагрузка зависит от входных данных, повторяемости и кэширования, чтобы использовать путь предварительного заполнения с 8 млрд параметров и гораздо меньший кэш KV. Затем следует сопоставить эту экономию с почти вдвое большим размером модели и путём декодирования, где активируются 16 млрд параметров.

Технический отчёт добавляет ещё одну переменную: даёт ли максимальное усилие рассуждения достаточно преимуществ, чтобы оправдать примерно 2,5-кратный расход выходных токенов, или средний режим обеспечивает лучшую стоимость завершённой задачи.

Для разработчиков ИИ-агентов важен не только показатель интеллекта на токен. Важнее объём завершённой работы на кэшированный токен, секунду и доллар.

Ежедневные новости об ИИ

Каждый день отбираем важные новости об ИИ и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.

Только важное — каждый день

В Telegram