Основные факты
Новая мультимодальная модель Deepseek в первую очередь создана для снижения стоимости работы с длинными контекстами. Основной выигрыш связан с использованием памяти, хотя компания также заявляет о росте качества модели.
Согласно техническому отчёту, главная цель V4.1-Flash — уменьшить так называемый кэш KV. В нём хранятся уже обработанные части контекста, чтобы модели не приходилось пересчитывать их на каждом следующем шаге. У агентов, которые работают в течение множества шагов, этот буфер быстро растёт и создаёт нагрузку на память GPU, SSD и пропускную способность каналов передачи данных. Из-за этого увеличивается стоимость развёртывания.
В основе языковой модели лежат 552 млрд параметров, а длина контекста достигает 1 млн токенов. По данным компании, буфер в быстрой памяти GPU теперь занимает примерно четверть пространства, которое требовалось Deepseek-V4-Flash. Часть, постоянно выгружаемая на SSD или в память хоста, сократилась примерно до одной восьмой. По сравнению с Deepseek-V1 общий размер кэша KV на токен уменьшился в 437 раз.
Меньше вычислений при вводе
Deepseek добилась этого за счёт нескольких совместно работающих методов. Один из центральных приёмов — разделение модели на две части. Первая обрабатывает поступающие данные, а вторая использует полученный результат вместо повторного пересчёта всей информации. При чтении входных данных на каждый токен активируются только 8 млрд параметров, тогда как во время генерации текста — 16 млрд.
По словам Deepseek, такой подход почти вдвое уменьшает объём вычислений, необходимый для обработки входных данных. Он рассчитан прежде всего на ИИ-агентов, которые постоянно получают новые входы во время частых вызовов инструментов. Кроме того, основной кэш KV хранится в формате FP4, а не FP8. Согласно отчёту, это почти вдвое уменьшает занимаемый этой частью кэша объём памяти.
Модель обучали с нуля на наборе данных из 45 трлн токенов, включавшем тексты и изображения. На этапе дообучения Deepseek намеренно не стала применять новые методы. Компания утверждает, что основной прирост дали более крупные и лучше контролируемые данные, задачи и среды обучения, а не новые алгоритмы. По оценке Deepseek, сейчас такое масштабирование приносит больше пользы, чем изменения алгоритмов.
При этом компания столкнулась с тем, что обученные агенты иногда пытались обмануть систему начисления награды, а в других случаях случайно выводили тестовую среду из строя. Иногда они использовали недавно раскрытые уязвимости или удаляли критически важные системные файлы.
При более интенсивном обучении с подкреплением производительность повышается в нескольких тестах для кодовых агентов
Источник: the-decoder.com
С Opus 5 и GPT-5.6 Sol на бенчмарке программирования
Несмотря на сравнительно небольшую долю активных параметров, Deepseek сообщает о результатах, близких к показателям ведущих моделей, на нескольких бенчмарках. На бенчмарках для ИИ-агентов V4.1-Flash иногда сравнивается с лучшими закрытыми системами. В программном тесте DeepSWE v1.1 модель с результатом 74,2% немного опередила Anthropic Opus 5 и OpenAI GPT-5.6 Sol, но на ProgramBench сильно отстала.
В сложных научных задачах для ИИ-агентов, где требуются экспертные знания, разрыв с очень крупными моделями сохраняется. Технический отчёт также признаёт заметное отставание от ведущих закрытых систем при чтении сложных изображений.
Как и у многих других моделей с рассуждением, у V4.1-Flash можно настраивать «глубину мышления». Пользователь задаёт, насколько тщательно модель должна решать задачу, одним значением и тем самым выбирает баланс между стоимостью вычислений и точностью. Согласно отчёту, максимальная настройка заметно улучшает результаты на нескольких бенчмарках, но увеличивает число выходных токенов примерно в 2,5 раза.
Более значительные усилия по рассуждению улучшают результаты, но увеличивают расход токенов
Источник: the-decoder.com
Deepseek разместила файлы модели на Hugging Face под открытой лицензией MIT. Компания позиционирует её как основу для дальнейшей работы над более дешёвыми ИИ-агентами. Модель также доступна через API по тем же ценам, что и V4-Flash.
В конце июля Deepseek заметно улучшила предшественницу V4-Flash с обновлением 0731. У той модели было 284 млрд параметров, из которых активными были 13 млрд. Она отстала всего на один пункт от OpenAI GPT-5.6 Luna в индексе Artificial Analysis Intelligence Index, а стоимость одной задачи была примерно на 60% ниже.
В середине августа Deepseek сняла свою флагманскую V4-Pro с тестирования и одновременно повысила цены на API. Обращения к кэшу, то есть уже буферизованным входным данным, подорожали в шесть раз. По данным тайваньской компании по кибербезопасности TeamT5, китайские хакерские группировки более чем вдвое увеличили число атак после того, как начали использовать Deepseek для создания эксплойтов и сканирования сетей.
В июне Deepseek привлекла около $7,4 млрд в первом раунде внешнего финансирования при оценке выше $50 млрд. По данным Reuters, теперь компания наняла китайский инвестиционный банк CITIC Securities для подготовки IPO в Китае.
Ежедневные новости об ИИ
Каждый день отбираем важные новости об ИИ и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.
Только важное — каждый день
В Telegram