Производительность и стоимость
Высокая частота выпусков Flash может говорить о сильных результатах Google или отвлекать внимание от отсутствующих передовых моделей — Gemini 3.5 Pro и Gemini 4. Новый руководитель DeepMind Корай Кавукчуоглу дал понять, что компания стремится улучшать не только соотношение цены и производительности, но и базовые способности моделей.
По данным Google, Gemini 3.8 Flash набрала 73,7% в бенчмарке DeepSWE v1.1 для длинных задач по разработке программного обеспечения. Это немного ниже результата Claude Opus 5 — 74,0%, но выше показателей Claude Sonnet 5 — 53,8%, GPT-5.6 Sol — 72,7% и предыдущей Gemini 3.7 Flash — 65,3%.
Google утверждает, что Gemini 3.8 Flash превосходит Opus 5 от Anthropic и GPT-5.6 Sol от OpenAI во многих бенчмарках, несмотря на то что стоит гораздо дешевле. Впрочем, это всего лишь бенчмарки, и в реальных условиях производительность может ощущаться совсем иначе
Источник: the-decoder.com
Google также заявляет об улучшениях в генерации 3D. В ролике показана 3D-игра, которую Gemini 3.8 Flash, предположительно, создала по одному запросу в инструменте Google для программирования Antigravity. Текстуры сгенерировала модель изображений Google Nano Banana.
Источник: the-decoder.com
На старте Gemini 3.8 Flash стоит $0,75 за миллион входных токенов и $3,75 за миллион выходных — столько же, сколько Gemini 3.7 Flash. С января 2027 года обычная цена вырастет до $1,50 и $7,50 соответственно.
Даже после окончания льготного периода Gemini 3.8 Flash останется заметно дешевле ведущих моделей OpenAI и Anthropic по цене токенов.
Однако часть прироста относительно Gemini 3.7 Flash объясняется дополнительными шагами рассуждения на сложных задачах и многократными обращениями к инструментам. Google говорит, что модель «работает усерднее», поэтому расходует больше токенов и частично нивелирует преимущество низкой цены. Для сценариев, где важна экономия вычислений, компания советует снизить уровень рассуждения или использовать по-прежнему поддерживаемую Gemini 3.7 Flash.
Где доступна модель
Разработчики могут работать с Gemini 3.8 Flash через Google ИИ Studio, Google Antigravity и Android Studio. Для компаний модель доступна в Gemini Enterprise. Пользователи получают её в приложении Gemini, режиме ИИ в Google Поиске и, при наличии платной подписки, в Google Таблицах.
Независимые измерения
Независимая платформа Artificial Analysis присвоила Gemini 3.8 Flash 59 баллов в Intelligence Index — на три балла больше, чем Gemini 3.7 Flash с её результатом 56.
Такой же результат — 59 баллов — получили GPT-5.6 Sol с рассуждением уровня xhigh и Grok 4.6 со средним уровнем рассуждения. По данным Artificial Analysis, рост показателя обеспечили в первую очередь результаты в бенчмарках для ИИ-агентов, включая использование инструментов и задачи по программированию.
По стоимости выполнения одной задачи Gemini 3.8 Flash достигла границы Парето, отмечает Artificial Analysis: при цене $0,58 это самая дешёвая модель среди систем с сопоставимым уровнем интеллекта. Но показатель вырос примерно на 40% по сравнению с Gemini 3.7 Flash, у которой одна задача стоила $0,40, хотя цена токенов осталась прежней. Вероятно, поэтому Google рекомендует Gemini 3.7 Flash для рабочих задач, где важна эффективность вычислений.
При высоком уровне рассуждения Gemini 3.8 Flash генерирует около 300 выходных токенов в секунду, а среднее время выполнения задачи составляет 2,5 минуты.
При низком уровне рассуждения среднее время сокращается примерно до 48 секунд.
Gemini 3.8 Flash Cyber
Как и предыдущая Gemini 3.5 Flash Cyber, версия для кибербезопасности не доступна широкой публике. Google распространяет её через программу Fairwind среди государственных учреждений, операторов критической инфраструктуры и разработчиков программного обеспечения. У модели менее строгие настройки безопасности, поскольку она предназначена для защитных задач в сфере кибербезопасности.
В отраслевом бенчмарке CyberGym, который проверяет поиск уязвимостей в C и C++, Gemini 3.8 Flash Cyber набрала 86,2%, сообщает Google.
Внешний бенчмарк CWE-Bench оценивает автоматическое исправление уязвимостей. Здесь Gemini 3.8 Flash Cyber получила 47,2% Pass@1 — почти столько же, сколько передовая модель-лидер с результатом 47,8%, но при значительно меньшей стоимости.
Модель также показала устойчивость к атакам с внедрением инструкций. В бенчмарке Gray Swan IPI доля успешных атак для Gemini 3.8 Flash составила всего 5,5%.
Claude Opus 5 показала немного лучший результат, а при использовании дополнительных настроек безопасности внутри экосистемы Claude показатель оказался ещё ниже.
Ежедневные новости об ИИ
Каждый день отбираем важные новости об ИИ, роботах и метавселенных и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.
Только важное — каждый день
В Telegram