Когда данные становятся видео
Сделать ролик по таблице — значит решить сразу несколько задач: найти интересные закономерности, выбрать графики, написать сценарий и настроить анимацию так, чтобы она появлялась в нужный момент. Современная языковая модель может попробовать выполнить всё это за один раз. Но на практике такой подход часто даёт сбои: диаграммы не отображаются, рассказ перескакивает между темами, а подсветка возникает не тогда, когда диктор говорит о нужном показателе.
Авторы DataMagic предлагают разделить работу на понятные части. Их система строит видеоролики по исходным таблицам и соединяет графики, текст озвучки и анимацию через общее описание. Затем несколько ИИ-агентов готовят отдельные сцены, а система отбирает и расставляет их в подходящем порядке.
На 109 примерах DataMagic набрала в среднем 3,89 балла из 5. Для сравнения, модели, которые сразу генерировали весь ролик, получили от 1,91 до 2,22 балла. В небольшом пользовательском исследовании работа с системой сократила среднее время создания ролика с 39,2 до 8 минут.
Почему одного запроса недостаточно
Видео о данных — это короткий рассказ с графиками, голосом и движением. Сначала зрителю показывают общий фон, затем раскрывают отдельные закономерности, а в нужный момент выделяют важное число или категорию. Поэтому хороший ролик должен одновременно верно передавать данные и связывать отдельные сцены в цельную историю.
Существующие инструменты обычно решают лишь часть задачи. Одни строят графики, но не создают сценарий и анимацию. Другие помогают озвучивать готовые диаграммы, но требуют, чтобы данные и визуализации уже были подготовлены. Генераторы видео способны создавать ролики целиком, но могут выдумать числа или показать их так, что зритель не сможет проверить, откуда они взялись.
DataMagic рассчитана на таблицы и запросы вроде «разбери динамику продаж» или «сравни урожайность по способам орошения». Система должна выяснить, какие именно разрезы анализа нужны, подготовить данные для каждого графика, сформулировать выводы и собрать сцены в последовательный рассказ.
Для этого авторы разделяют задачу на два уровня: что показать в каждой сцене и как сцены должны работать вместе. Такое разделение помогает не принимать решение обо всём ролике разом и не ограничиваться случайной подборкой отдельных графиков.
Общий план для графиков, речи и анимации
Основой DataMagic служит DVSpec — общее описание видеоролика, в котором каждая сцена представлена как отдельная редактируемая часть. В ней хранятся график и его данные, текст диктора и анимационные эффекты. Это описание нужно и ИИ-агентам, которые создают ролик, и пользователю, который хочет его изменить.
Один из важных приёмов — привязывать подсветку к значениям в данных, а не к техническим именам элементов на экране. Например, анимация может ссылаться на запись с датой 30 января. Если порядок строк изменится или разработчики заменят линейный график на столбчатый, система всё равно сможет найти нужную точку по значению даты.
Второй приём касается синхронизации голоса и изображения. Вместо точного времени вроде «включить подсветку на 14-й секунде» описание указывает номер фразы диктора. Когда начинается нужный фрагмент речи, появляется соответствующая анимация. Если пользователь меняет сценарий и озвучка становится длиннее или короче, точное время система пересчитывает при создании видео.
DVSpec связывает график, данные, текст озвучки и анимацию в описании одной сцены.
Такой подход полезен не только при генерации. Если пользователь исправляет текст или меняет график, системе не нужно вручную перенастраивать временную шкалу. Она обновляет нужную сцену, а остальные части ролика остаются без изменений.
В DataMagic предусмотрены три способа взаимодействия: пользователь может менять график прямо на холсте, редактировать описание сцен или давать команды обычным языком. Можно также задавать вопросы о данных и превращать найденный ответ в новую сцену. При этом система обращается к исходной таблице, а не пытается угадать значения по изображению графика.
Сначала варианты, потом связный рассказ
Рабочий процесс DataMagic состоит из двух больших частей. Сначала система готовит несколько возможных сцен, затем выбирает из них подходящие и выстраивает их в целый рассказ.
На первом шаге планировщик разбирает запрос на отдельные направления анализа. Например, просьбу изучить продажи можно разделить на динамику выручки, сравнение регионов и вклад товаров в прибыль. Затем отдельные ИИ-агенты подготавливают данные и выбирают для каждого вопроса подходящий тип графика.
После этого система отбирает сцены, которые вместе охватывают запрос и показывают интересные закономерности. Она определяет порядок сцен и пишет для них связный сценарий. Если первая сцена рассказывает об общей динамике выручки, следующая может перейти к сравнению регионов, не повторяя вводную информацию. Наконец, ещё один агент связывает упомянутые в речи категории и значения с соответствующими элементами графика.
Схема DataMagic: агенты готовят сцены, после чего система выбирает их, связывает сценарием и синхронизирует с анимацией.
Для генерации роликов авторы проверили четыре языковые модели на 109 примерах из деловых и общественных данных. Качество оценивали по пяти направлениям: соответствие запросу, полезность выводов, связность рассказа, точность анимации и внешний вид. Автоматические оценки сравнили с оценками специалистов на выборке из 60 роликов. Совпадение оценок оказалось высоким: общая корреляция составила 0,91.
Что показали испытания
Модели, которым поручали сразу написать код всего ролика, успешно завершали генерацию не всегда: доля выполненных запусков составляла от 48,62% до 86,24%. Средние оценки качества находились в диапазоне от 1,91 до 2,22 из 5.
В составе DataMagic те же модели справлялись заметно лучше. Доля успешных запусков превышала 95%, а средние оценки составили от 3,38 до 3,89. Лучший результат, 3,89 балла, показала версия с Claude Sonnet 4. Особенно заметно улучшились анимация и рассказ: при прямой генерации модели часто не могли вовремя подсветить нужное значение или убедительно связать сцены.
Сравнение качества показывает преимущество DataMagic над прямой генерацией роликов на всех пяти направлениях оценки.
У этого результата есть цена. Прямая генерация в среднем занимала около 57 секунд, а DataMagic — около 176 секунд с учётом подготовки описания и создания видео. Система тратит больше времени, зато чаще успешно завершает работу и выдаёт более цельный результат.
В отдельной проверке авторы отключали ключевые части системы. Без планировщика средняя оценка снизилась с 3,89 до 3,44 балла. Без этапа отбора и расстановки сцен — до 3,54. Это говорит о том, что система выигрывает и от разнообразия подготовленных сцен, и от проверки того, как они складываются в общий рассказ.
Пользовательское исследование было меньше: в нём участвовали 12 человек. Каждый создавал ролик двумя способами — с DataMagic и в обычном диалоге с языковой моделью. В первом случае на задачу в среднем уходило 8 минут, во втором — 39,2 минуты. Участники также сообщали о меньшей умственной нагрузке при работе с DataMagic. При этом заметной разницы в их собственной оценке результата не обнаружили.
Участники создавали ролики в среднем за 8 минут с DataMagic против 39,2 минуты в обычном диалоге с языковой моделью.
Что пока остаётся сложным
У DataMagic есть ограничения. Сейчас система рассчитана на отдельные таблицы, а не на набор связанных таблиц. Набор доступных графиков зависит от того, какие варианты поддерживает программа для создания видео. Кроме того, автоматические оценки не заменяют проверку конкретного ролика: авторы приводят примеры, где диаграмма обрезана, а значение в озвучке немного отличается от подписи на экране.
Есть и компромисс в анимации. Структурированные правила помогают синхронизировать движение с речью и не отвлекать зрителя, но могут ограничивать разнообразие эффектов. Система использует надёжные и понятные приёмы, а не максимально свободный визуальный стиль.
Вывод
DataMagic показывает, как языковую модель можно встроить в более управляемый процесс создания видео. Вместо одного большого запроса система использует общее описание сцен, распределяет работу между ИИ-агентами и отдельно проверяет, как сцены складываются в рассказ. Привязка к исходным данным помогает находить нужные элементы графика, а привязка анимации к фразам избавляет от ручной настройки времени.
Результаты испытаний показывают, что для роликов о данных важно связать графики и сценарий между собой. Пока система требует больше времени, чем прямая генерация, и поддерживает ограниченный набор данных и графиков. Но когда нужно получить проверяемое видео из таблицы, управляемая последовательность действий оказывается полезнее попытки поручить модели весь ролик сразу.
Читайте также
Как проверить, справился ли ИИ-агент с задачей
Можно ли автоматически собрать нужных ИИ-агентов по ходу работы
Как тысяча ИИ-агентов работают вместе без начальника
Как дать ИИ-агенту больше свободы с меньшим риском
Как ИИ-агент подбирает прошлый опыт под новую задачу
ИИ-судья сохраняет 99% точности за меньшие деньги
Как самоулучшение ИИ-агента улучшает результаты и экономит токены
Почему ИИ-агентам трудно работать с разными данными
Как ИИ-агентам экономить контекст и избегать сбоев
Как ИИ симулирует мысли пользователя
Как ИИ-агенты восстанавливают приложения по их поведению
Как ИИ помогает разрабатывать игры
ИИ-обзоры простыми словами
Каждый день читаем свежие статьи об ИИ и пересказываем главное естественным языком — без хайпа и воды. Если хотите понимать, куда движутся ИИ-агенты раньше остальных, — подписывайтесь.
Новые обзоры — каждый день
В Telegram