Точность коротких событий
Новые Gemini 3.7 Flash, 3.6 Flash и 3.5 Flash-Lite умеют находить события длительностью меньше секунды — например, смену состояния объекта или монтажную склейку, которые можно пропустить при обработке одного кадра в секунду. Google считает, что благодаря этому автоматический видеомонтаж станет точнее.
Система также ищет отдельные сцены в многочасовых записях, не расходуя миллионы токенов. Если она замечает подозрительный временной отрезок, то повторно анализирует его с более высокой частотой кадров. Это помогает находить аномалии, считать повторяющиеся движения и отслеживать отдельные объекты во времени.
На 1H-VideoQA и LVBench потребление токенов снижается на 88%, а точность немного повышается
Источник: the-decoder.com
До сих пор Gemini обрабатывала видео статично: по умолчанию брала один кадр в секунду, хотя через API частоту можно было изменить. С момента запуска встроенного анализа видео в 2025 году модель расшифровывала звуковую дорожку и изучала кадры с такой же, посекундной, частотой.
Как Gemini выбирает фрагменты
В режиме с агентом рассуждение модели напрямую связано со встроенными инструментами анализа видео. Gemini сама решает, какие отрезки просматривать, с какой скоростью и в каком формате — по кадрам, аудио или расшифровке. В обработку попадают только сигналы, необходимые для конкретной задачи.
Теперь Gemini использует внутренний инструмент, который извлекает из видео только нужный фрагмент. Раньше разработчики могли вручную собрать похожий избирательный подход, но теперь этим занимается сама модель.
Вместо загрузки видео с фиксированной частотой кадров Gemini использует цикл, чтобы выборочно получать кадры, аудио или расшифровки из нужных фрагментов
Источник: the-decoder.com
Новая схема развивает подход «зрения с помощью агента», который Google представила для Gemini 3 Flash в январе. Тогда модель получила возможность писать и запускать код на Python, чтобы увеличивать, обрезать и размечать изображения, а затем проверять результат в цикле «подумать — действовать — наблюдать» перед ответом.
При запуске эта функция работала автоматически не во всех случаях. Её основу Google заложила ещё раньше: в декабре, представляя Gemini 3 Flash, компания назвала рассуждение о визуальных и пространственных свойствах видео одной из будущих способностей модели.
Источник: the-decoder.com
Результаты на длинных видео
Преимущество нового режима заметнее всего на длинных роликах: от десятиминутных обучающих видео до лекций длительностью 90 минут и многочасовых записей. При статичной обработке разработчикам приходилось выбирать между большим расходом токенов и методами, которые отбрасывали важные детали.
В собственных бенчмарках Google, включая LongVideoBench, Gemini 3.7 Flash с анализом видео с помощью агента показывает наивысшее общее качество и лучшее сочетание точности и экономичности.
В собственной оценке Google 1H-VideoQA Gemini 3.7 Flash достигает наивысшей точности при самой низкой стоимости одного запроса
Источник: the-decoder.com
Функция уже доступна для загруженных видео и роликов с YouTube через Gemini API в Google ИИ Studio и Gemini Enterprise Agent Platform. В конфигурации API разработчику нужно выбрать режим обработки `agentic`. Оплата идёт по стандартным тарифам Gemini API за токены, без дополнительной комиссии. Подробности опубликованы в руководстве для разработчиков.
Интеграция с продуктами Google
Google собирается использовать эти улучшения и в собственных продуктах. В ближайшее время функция должна появиться у всех пользователей приложения Gemini на версиях Flash и Flash Lite.
В следующие месяцы анализ видео с помощью агента также начнёт поддерживать функцию «Спросить YouTube» на странице просмотра. Ответы должны точнее соответствовать тому, что действительно показано в ролике.
Источник: the-decoder.com
Ежедневные новости об ИИ
Каждый день отбираем важные новости об ИИ, роботах и метавселенных и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.
Только важное — каждый день
В Telegram