i
ДАТАИСТ
Новости · 2026-09-02

Новый агентный анализ видео в Google Gemini сокращает расход токенов до 88%

@neuronium_ai @neuronium_ai

Google добавляет анализ видео с помощью агента в несколько моделей Gemini. Вместо просмотра ролика с фиксированной частотой модель сама ищет нужные фрагменты, выбирает скорость анализа и подходящий тип данных — кадры, звук или расшифровку. По данным Google, это сокращает расход токенов и стоимость обработки до 88%, сохраняя больше деталей, чем обычный просмотр одного кадра в секунду.

Обложка: Новый агентный анализ видео в Google Gemini сокращает расход токенов до 88%

Точность коротких событий

Новые Gemini 3.7 Flash, 3.6 Flash и 3.5 Flash-Lite умеют находить события длительностью меньше секунды — например, смену состояния объекта или монтажную склейку, которые можно пропустить при обработке одного кадра в секунду. Google считает, что благодаря этому автоматический видеомонтаж станет точнее.

Система также ищет отдельные сцены в многочасовых записях, не расходуя миллионы токенов. Если она замечает подозрительный временной отрезок, то повторно анализирует его с более высокой частотой кадров. Это помогает находить аномалии, считать повторяющиеся движения и отслеживать отдельные объекты во времени.

88%максимальное сокращение расхода токенов
1 кадр/сстандартная частота обработки
меньше 1 секундыдлительность распознаваемых событий
На 1H-VideoQA и LVBench потребление токенов снижается на 88%, а точность немного повышается

На 1H-VideoQA и LVBench потребление токенов снижается на 88%, а точность немного повышается

Источник: the-decoder.com

До сих пор Gemini обрабатывала видео статично: по умолчанию брала один кадр в секунду, хотя через API частоту можно было изменить. С момента запуска встроенного анализа видео в 2025 году модель расшифровывала звуковую дорожку и изучала кадры с такой же, посекундной, частотой.

Как Gemini выбирает фрагменты

В режиме с агентом рассуждение модели напрямую связано со встроенными инструментами анализа видео. Gemini сама решает, какие отрезки просматривать, с какой скоростью и в каком формате — по кадрам, аудио или расшифровке. В обработку попадают только сигналы, необходимые для конкретной задачи.

Теперь Gemini использует внутренний инструмент, который извлекает из видео только нужный фрагмент. Раньше разработчики могли вручную собрать похожий избирательный подход, но теперь этим занимается сама модель.

Вместо загрузки видео с фиксированной частотой кадров Gemini использует цикл, чтобы выборочно получать кадры, аудио или расшифровки из нужных фрагментов

Вместо загрузки видео с фиксированной частотой кадров Gemini использует цикл, чтобы выборочно получать кадры, аудио или расшифровки из нужных фрагментов

Источник: the-decoder.com

Новая схема развивает подход «зрения с помощью агента», который Google представила для Gemini 3 Flash в январе. Тогда модель получила возможность писать и запускать код на Python, чтобы увеличивать, обрезать и размечать изображения, а затем проверять результат в цикле «подумать — действовать — наблюдать» перед ответом.

При запуске эта функция работала автоматически не во всех случаях. Её основу Google заложила ещё раньше: в декабре, представляя Gemini 3 Flash, компания назвала рассуждение о визуальных и пространственных свойствах видео одной из будущих способностей модели.

Источник: the-decoder.com

Результаты на длинных видео

Преимущество нового режима заметнее всего на длинных роликах: от десятиминутных обучающих видео до лекций длительностью 90 минут и многочасовых записей. При статичной обработке разработчикам приходилось выбирать между большим расходом токенов и методами, которые отбрасывали важные детали.

В собственных бенчмарках Google, включая LongVideoBench, Gemini 3.7 Flash с анализом видео с помощью агента показывает наивысшее общее качество и лучшее сочетание точности и экономичности.

В собственной оценке Google 1H-VideoQA Gemini 3.7 Flash достигает наивысшей точности при самой низкой стоимости одного запроса

В собственной оценке Google 1H-VideoQA Gemini 3.7 Flash достигает наивысшей точности при самой низкой стоимости одного запроса

Источник: the-decoder.com

Функция уже доступна для загруженных видео и роликов с YouTube через Gemini API в Google ИИ Studio и Gemini Enterprise Agent Platform. В конфигурации API разработчику нужно выбрать режим обработки `agentic`. Оплата идёт по стандартным тарифам Gemini API за токены, без дополнительной комиссии. Подробности опубликованы в руководстве для разработчиков.

Интеграция с продуктами Google

Google собирается использовать эти улучшения и в собственных продуктах. В ближайшее время функция должна появиться у всех пользователей приложения Gemini на версиях Flash и Flash Lite.

В следующие месяцы анализ видео с помощью агента также начнёт поддерживать функцию «Спросить YouTube» на странице просмотра. Ответы должны точнее соответствовать тому, что действительно показано в ролике.

Источник: the-decoder.com

Ежедневные новости об ИИ

Каждый день отбираем важные новости об ИИ, роботах и метавселенных и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.

Только важное — каждый день

В Telegram