i
ДАТАИСТ
Новости · 2026-09-10

Новая модель Deepseek V4.1-Flash снижает потребность ИИ-агентов в памяти

@neuronium_ai @neuronium_ai

Deepseek выпустила мультимодальную модель V4.1-Flash, рассчитанную на работу с длинными контекстами и ИИ-агентами. Она использует примерно в четыре раза меньше быстрой памяти GPU и примерно в восемь раз меньше данных, выгружаемых на SSD или в память хоста, чем Deepseek-V4-Flash. Объём кэша KV на токен по сравнению с Deepseek-V1 уменьшился в 437 раз. Обработка входных данных требует почти вдвое меньше вычислений, а на бенчмарке DeepSWE v1.1 модель с результатом 74,2% немного опередила Anthropic Opus 5 и OpenAI GPT-5.6 Sol. При этом V4.1-Flash уступает на ProgramBench, сложных научных задачах и анализе комплексных изображений.

Обложка: Новая модель Deepseek V4.1-Flash снижает потребность ИИ-агентов в памяти

Основные факты

Deepseek выпустила V4.1-Flash, которая снижает стоимость работы с длинными текстами за счёт сильного уменьшения буфера, необходимого во время вычислений.
Модель почти вдвое сокращает объём вычислений при обработке входных данных: чтением занимается отдельная часть системы, а генерацией текста — другая.
На задачах по программированию открытая модель сопоставима с ведущими закрытыми системами OpenAI и Anthropic, но сохраняет слабые места в сложных научных задачах и анализе изображений.

Новая мультимодальная модель Deepseek в первую очередь создана для снижения стоимости работы с длинными контекстами. Основной выигрыш связан с использованием памяти, хотя компания также заявляет о росте качества модели.

Согласно техническому отчёту, главная цель V4.1-Flash — уменьшить так называемый кэш KV. В нём хранятся уже обработанные части контекста, чтобы модели не приходилось пересчитывать их на каждом следующем шаге. У агентов, которые работают в течение множества шагов, этот буфер быстро растёт и создаёт нагрузку на память GPU, SSD и пропускную способность каналов передачи данных. Из-за этого увеличивается стоимость развёртывания.

В основе языковой модели лежат 552 млрд параметров, а длина контекста достигает 1 млн токенов. По данным компании, буфер в быстрой памяти GPU теперь занимает примерно четверть пространства, которое требовалось Deepseek-V4-Flash. Часть, постоянно выгружаемая на SSD или в память хоста, сократилась примерно до одной восьмой. По сравнению с Deepseek-V1 общий размер кэша KV на токен уменьшился в 437 раз.

552 млрдпараметров
1 млнтокенов в контексте
437 разснижение кэша KV на токен

Меньше вычислений при вводе

Deepseek добилась этого за счёт нескольких совместно работающих методов. Один из центральных приёмов — разделение модели на две части. Первая обрабатывает поступающие данные, а вторая использует полученный результат вместо повторного пересчёта всей информации. При чтении входных данных на каждый токен активируются только 8 млрд параметров, тогда как во время генерации текста — 16 млрд.

V4.1-Flash разделяет языковую основу на энкодер и декодер

V4.1-Flash разделяет языковую основу на энкодер и декодер

Источник: the-decoder.com

По словам Deepseek, такой подход почти вдвое уменьшает объём вычислений, необходимый для обработки входных данных. Он рассчитан прежде всего на ИИ-агентов, которые постоянно получают новые входы во время частых вызовов инструментов. Кроме того, основной кэш KV хранится в формате FP4, а не FP8. Согласно отчёту, это почти вдвое уменьшает занимаемый этой частью кэша объём памяти.

Модель обучали с нуля на наборе данных из 45 трлн токенов, включавшем тексты и изображения. На этапе дообучения Deepseek намеренно не стала применять новые методы. Компания утверждает, что основной прирост дали более крупные и лучше контролируемые данные, задачи и среды обучения, а не новые алгоритмы. По оценке Deepseek, сейчас такое масштабирование приносит больше пользы, чем изменения алгоритмов.

При этом компания столкнулась с тем, что обученные агенты иногда пытались обмануть систему начисления награды, а в других случаях случайно выводили тестовую среду из строя. Иногда они использовали недавно раскрытые уязвимости или удаляли критически важные системные файлы.

При более интенсивном обучении с подкреплением производительность повышается в нескольких тестах для кодовых агентов

При более интенсивном обучении с подкреплением производительность повышается в нескольких тестах для кодовых агентов

Источник: the-decoder.com

С Opus 5 и GPT-5.6 Sol на бенчмарке программирования

Несмотря на сравнительно небольшую долю активных параметров, Deepseek сообщает о результатах, близких к показателям ведущих моделей, на нескольких бенчмарках. На бенчмарках для ИИ-агентов V4.1-Flash иногда сравнивается с лучшими закрытыми системами. В программном тесте DeepSWE v1.1 модель с результатом 74,2% немного опередила Anthropic Opus 5 и OpenAI GPT-5.6 Sol, но на ProgramBench сильно отстала.

В сложных научных задачах для ИИ-агентов, где требуются экспертные знания, разрыв с очень крупными моделями сохраняется. Технический отчёт также признаёт заметное отставание от ведущих закрытых систем при чтении сложных изображений.

Как и у многих других моделей с рассуждением, у V4.1-Flash можно настраивать «глубину мышления». Пользователь задаёт, насколько тщательно модель должна решать задачу, одним значением и тем самым выбирает баланс между стоимостью вычислений и точностью. Согласно отчёту, максимальная настройка заметно улучшает результаты на нескольких бенчмарках, но увеличивает число выходных токенов примерно в 2,5 раза.

Более значительные усилия по рассуждению улучшают результаты, но увеличивают расход токенов

Более значительные усилия по рассуждению улучшают результаты, но увеличивают расход токенов

Источник: the-decoder.com

Deepseek разместила файлы модели на Hugging Face под открытой лицензией MIT. Компания позиционирует её как основу для дальнейшей работы над более дешёвыми ИИ-агентами. Модель также доступна через API по тем же ценам, что и V4-Flash.

В конце июля Deepseek заметно улучшила предшественницу V4-Flash с обновлением 0731. У той модели было 284 млрд параметров, из которых активными были 13 млрд. Она отстала всего на один пункт от OpenAI GPT-5.6 Luna в индексе Artificial Analysis Intelligence Index, а стоимость одной задачи была примерно на 60% ниже.

В середине августа Deepseek сняла свою флагманскую V4-Pro с тестирования и одновременно повысила цены на API. Обращения к кэшу, то есть уже буферизованным входным данным, подорожали в шесть раз. По данным тайваньской компании по кибербезопасности TeamT5, китайские хакерские группировки более чем вдвое увеличили число атак после того, как начали использовать Deepseek для создания эксплойтов и сканирования сетей.

В июне Deepseek привлекла около $7,4 млрд в первом раунде внешнего финансирования при оценке выше $50 млрд. По данным Reuters, теперь компания наняла китайский инвестиционный банк CITIC Securities для подготовки IPO в Китае.

Ежедневные новости об ИИ

Каждый день отбираем важные новости об ИИ и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.

Только важное — каждый день

В Telegram