i
Новости
Новости · 2026-10-06

TwelveLabs представила Pegasus 1.6, чтобы улучшить данные для обучения роботов на видео от первого лица

@neuronium_ai @neuronium_ai

TwelveLabs выпустила Pegasus 1.6 — модель для анализа видео от первого лица, снятого человеком или машиной во время работы. Она разбивает записи на размеченные отрезки и описывает действия с временными отметками, чтобы эти данные можно было использовать при обучении роботов. Новая версия дополняет возможности Pegasus 1.5 и специально обучена работать с видео от первого лица, которое предыдущие модели TwelveLabs, по словам компании, обрабатывали хуже. Pegasus помогает структурировать записи, но разработчикам роботов по-прежнему нужно связывать эти описания с движениями, данными датчиков и системами управления.

Обложка: TwelveLabs представила Pegasus 1.6, чтобы улучшить данные для обучения роботов на видео от первого лица

Рабочий, собирающий деталь, показывает больше, чем готовый результат: какой рукой он удерживает компонент, когда тянется за инструментом и как исправляет движение, если деталь выскальзывает. TwelveLabs хочет помочь компаниям извлекать из таких записей подробности, полезные для обучения роботов похожей работе.

Компания, работающая с ИИ для видео, представила Pegasus 1.6 сегодня. В новой версии появилась специализированная поддержка записей от первого лица — с точки зрения человека или машины, выполняющих задачу.

TwelveLabs ориентируется на разработчиков роботов и поставщиков данных. Им нужно превращать такие записи в размеченные материалы с временными отметками. Pegasus 1.6 развивает возможности Pegasus 1.5 — предыдущей версии модели, которая описывает видео и делит его на сегменты.

Обе модели создают текст по видео и сегментируют записи, превращая исходные кадры в структурированные метаданные с временной привязкой.

В отличие от мультимодальных больших языковых моделей общего назначения, которые собирают отдельные кадры в последовательность или отвечают на простые вопросы о коротком ролике, линейка Pegasus рассчитана на работу с динамикой видео. Она учитывает причинно-следственные связи и изменения во времени, а также анализирует запись целиком.

Для компаний Pegasus может помочь решить практическую задачу автоматизации: превратить записи физической работы в данные, с которыми сможет работать команда разработчиков. Компании, изучающие робототехнику, могут начать документировать и упорядочивать отдельные рабочие процессы. Команды, которые уже обучают роботов, — автоматизировать часть разметки и проверки качества.

Pegasus предоставляет описания и структуру. Разработчикам роботов всё равно нужно связать эти наблюдения с движениями, датчиками и системами управления, чтобы машина могла надёжно выполнять работу.

Сооснователь и генеральный директор TwelveLabs Джэ Ли рассказал VentureBeat в интервью перед анонсом, что современные модели очень требовательны к данным.

От архивов видео к примерам человеческих действий

По словам Ли, сначала TwelveLabs работала с медиа, развлечениями, спортом и рекламой: клиентам нужно было искать нужные фрагменты в больших видеоколлекциях и описывать их содержимое. В робототехнике компания применяет те же возможности для другой задачи — поиска полезных примеров физических действий.

Телеуправление, когда человек дистанционно управляет роботом, даёт ценные примеры, но для этого нужны оборудование и обученные операторы. Масштабировать такой сбор данных дорого и долго, отметил Ли. Он описал этот процесс как работу одного человека с одним роботом.

Записи от первого лица могут стать ещё одним источником примеров. Камера на работнике фиксирует задачи, и для сбора материала не нужно каждый раз задействовать робота. Но сами записи всё равно нужно интерпретировать: определить действие и объект, понять, какая рука его выполняет, и отметить начало и конец действия.

Pegasus 1.5 уже делила видео на сегменты с временными отметками и создавала структурированные описания. До выхода новой версии сама TwelveLabs называла эти возможности основой для разметки робототехнических данных. Pegasus 1.6 дополнительно обучена работе с видео от первого лица — или эгоцентрическими записями. Компания говорит, что прежние версии плохо справлялись с такими материалами. Новизна версии — в этой специализации и заявленном улучшении качества, а не в самой возможности превращать видео в структурированный текст. Клиенты задают нужные им категории и поля, а модель организует видео в соответствии с этими требованиями, пояснил Ли в интервью и техническом описании компании.

Например, команда, занимающаяся сборкой, может запросить отдельные сегменты для захвата компонента, его позиционирования и закрепления, а также описание роли каждой руки. Это пример возможного процесса, а не раскрытый компанией случай внедрения у клиента.

TwelveLabs выделяет пять основных сценариев использования:

Разделение записей на размеченные действия.
Создание подробных подписей к видео.
Проверка качества записей.
Поиск необычных событий и дубликатов.
Обнаружение потенциально чувствительных материалов перед дальнейшей обработкой.

При проверке качества можно выявлять перекрытый обзор, нестабильную камеру и неразборчивые действия.

В Pegasus 1.6 также появились встроенный анализ изображений и улучшенное распознавание людей и объектов. Благодаря этому клиенты могут обрабатывать неподвижные изображения через тот же API, что и видео. Эти возможности пригодятся не только в робототехнике, но и для уже существующих задач анализа видео.

Понимание действия — лишь часть обучения робота

Ли описал ближайшее применение Pegasus в робототехнике как инфраструктуру для обучения. По его словам, сейчас компании продолжают активно обучать модели. Нынешние внедрения обычно ограничиваются отдельными задачами или сбором полевых данных, которые помогают разработчикам улучшать модели.

Долгосрочная гипотеза Ли состоит в том, что видео с участием людей может стать широкой базой знаний о поведении, а примеры телеуправления помогут адаптировать эти знания к реальным роботам. Пока это стратегия развития, а не подтверждение того, что дополнительное видео само по себе создаёт робота широкого профиля.

По словам Ли, Pegasus может описывать движения конечностей и примерно оценивать траектории, но этих данных недостаточно для выполнения действий. Давление, осязание и точное управление остаются отдельными задачами. Командам нужно объединять информацию из видео с другими данными и создавать системы, которые переводят её в действия.

В техническом приложении TwelveLabs описаны внутренние оценки распознавания действий, определения руки, которая выполняет действие, и понимания последовательности действий во времени. Числовых результатов и воспроизводимого сравнения с конкурентами в документе нет. В интервью и материалах, предоставленных до анонса, компания также не назвала клиента из робототехники, чьи результаты внедрения можно было бы независимо проверить.

Ли привёл пример масштаба обработки: по его воспоминаниям, один запуск обработал около 17 лет видеозаписей от первого лица примерно за 18 часов, причём ни одно видео не завершилось сбоем. Он не уточнил вычислительные ресурсы и условия оценки, поэтому это отдельное утверждение о скорости обработки, а не воспроизводимый бенчмарк или показатель точности.

Конкуренты и возможная роль в разработке роботов

Конкуренция затрагивает несколько этапов разработки роботов. Одни компании организуют обучающие данные, другие помогают роботу понимать окружение или формируют его действия.

Cosmos Curator от Nvidia напрямую решает задачу подготовки данных: фильтрует и размечает материалы, а также удаляет дубликаты. Открытые инструменты позволяют инженерным командам обойтись без платного сервиса анализа видео, но им всё равно придётся самостоятельно собрать и обслуживать выбранный пайплайн.

Близкий вариант — интеграция Nvidia Cosmos Reason 2 и Embed в Encord. Платформа размещает модели, создаёт предварительную разметку видео для проверки человеком и позволяет искать записи по действиям. Поэтому Encord конкурирует за задачи разметки и отбора данных, на которые нацелена TwelveLabs.

Gemini Robotics ER 2 от Google также анализирует видео и отслеживает ход выполнения задачи, но больше ориентирован на планирование и координацию действий. Выполнение движений он передаёт моделям более низкого уровня или интерфейсам для робототехники.

Модель FLUX-mimic от Black Forest Labs и mimic использует основу видеомодели для создания действий робота. Компании сообщают об испытаниях и внедрении у Audi, в том числе для промышленных манипуляций. Это пример системы, которая может использовать улучшенные обучающие данные. Однако сведений о её интеграции с TwelveLabs нет.

| Продукт | Возможности | Формат и цены |

|---|---|---|

| TwelveLabs Pegasus 1.6 | Сегментация действий от первого лица, подробные подписи и настраиваемые форматы результатов | API; обучение и управление роботом остаются задачей клиента. $1,75 за час видео, $3 за миллион токенов входных изображений и $7,50 за миллион выходных токенов. Для корпоративных клиентов — индивидуальные условия. |

| Nvidia Cosmos Curator | Открытые инструменты для подготовки данных: фильтрация, разметка и удаление дубликатов | Программное обеспечение с открытым исходным кодом, без платы за лицензию Curator. Вычислительные ресурсы, облако, хранение данных и работа инженеров оплачиваются отдельно. Условия лицензий моделей различаются. |

| Encord с Nvidia Cosmos Reason 2 и Embed | Автоматические предварительные метки, проверка человеком и поиск по действиям | Размещённая платформа, объединяющая модели и проверку человеком. Публичных цен нет; стоимость платформы и использования моделей нужно уточнять у Encord. |

| Gemini Robotics ER 2 от Google | Оценка продвижения по видео, планирование и работа с инструментами | Доступ к рассуждениям через API; движения выполняют отдельные системы. До 31 декабря 2026 года стандартная цена — $1 за миллион входных и $5 за миллион выходных токенов, включая токены на рассуждение. С 1 января 2027 года — $2 и $10 соответственно. Есть бесплатный уровень. |

| FLUX-mimic от Black Forest Labs и mimic | Преобразование представлений, извлечённых из видео, в поведение робота | Система для внедрения в робототехнику, которая охватывает выполнение действий, а не только подготовку данных. Публичная цена FLUX-mimic в анонсе не указана; условия внедрения нужно уточнять. Бесплатной моделью с открытым доступом она не объявлена. |

Цены проверены 6 октября 2026 года. Единицы тарификации и возможности продуктов различаются, поэтому по этим ставкам нельзя определить самый дешёвый вариант для конкретной задачи. Pegasus тарифицирует видео по длительности, а текстовый результат — по токенам. Google считает токены на входе и выходе. Кроме того, при запросе Segment TwelveLabs умножает оплачиваемую длительность видео на число заданных описаний сегментов. Даже программное обеспечение с открытым исходным кодом требует оплачиваемых вычислительных ресурсов или собственных мощностей.

Это функциональное сравнение по описаниям компаний, а не общий рейтинг качества. Из рассмотренных данных нельзя заключить, что Pegasus 1.6 превосходит все перечисленные решения по качеству разметки, стоимости или итоговому успеху роботов.

Ли считает, что разработчики моделей, которые создают действия для роботов, могут стать клиентами TwelveLabs: компания, по его словам, занимает отдельное место в технологическом стеке.

Коммерческий результат будет зависеть от того, сможет ли TwelveLabs сделать подготовку видео достаточно точной, недорогой и простой для подключения — так, чтобы команды предпочли покупать эту услугу, а не разрабатывать решение сами или искать альтернативу.

Цены и проверка перед внедрением

Цена выходных токенов Pegasus 1.6 осталась примерно такой же, как у предыдущей версии: $1,75 за час входного видео, $3 за миллион токенов входных изображений и $7,50 за миллион выходных токенов.

Для корпоративных клиентов условия рассчитываются индивидуально. Чтобы обсудить частное развёртывание или управление системой собственными силами, нужно связаться с отделом продаж.

По указанной ставке однократная обработка 1 000 часов видео обойдётся в $1 750 — без учёта затрат на выходные токены и других возможных начислений. Подробная разметка увеличит расходы на выходные данные. TwelveLabs подтвердила VentureBeat обновлённые цены Pegasus 1.6 после того, как на публичном сайте сначала указала их вдвое выше. Издание сообщило, что обновило материал и теперь приводит точные сведения.

В справке по ценам также говорится, что каждое описание сегмента в запросе Segment оплачивается отдельно. Поэтому стоимость обработки зависит от числа категорий разметки, запрошенных для одной и той же записи.

Ли добавил, что компания может заключить с ограниченным числом крупных партнёров долгосрочные лицензионные соглашения и договоры на индивидуальные исследования.

Компания, которая только начинает заниматься робототехникой, может выбрать для проверки одну конкретную задачу — например, упаковку определённого товара или сборку детали заданного типа. Пилотный проект поможет оценить, достаточно ли подробны записи, совпадают ли метки модели с экспертной оценкой и сколько исправлений потребуется, прежде чем партнёр в области робототехники сможет использовать эти данные.

Заранее нужно также определить права на запись работников и правила работы с данными о внутренних процессах компании. Автоматическое обнаружение чувствительных изображений помогает при проверке материалов, но само по себе не даёт разрешения собирать эти записи или использовать их для обучения.

Командам, которые уже испытывают роботов, важнее оценить влияние данных на дальнейшую работу: улучшает ли разметка Pegasus выполнение задач на примерах, которые не использовались при обучении, сокращает ли потребность в сборе данных или ускоряет ли разработку. Наряду со скоростью обработки стоит измерять точность разметки, пропущенные границы действий и время, которое люди тратят на исправления.

Ключевой экономический показатель — стоимость одного принятого и пригодного для обучения примера, а затем его вклад в улучшение поведения робота. TwelveLabs предлагает ускорить путь от записи действия до использования данных для обучения. Компаниям предстоит проверить на собственных задачах, помогает ли результат автоматизировать именно ту работу, которая им нужна.

OpenAI лично извинилась перед правительством Австралии, но ответов по-прежнему нет OpenAI снова выводит из себя целую кучу математиков Microsoft опубликовала скромный прогноз Нобелевского лауреата: ИИ добавит ВВП лишь 1,5% за десятилетие 16-летнего подростка спасли на горе «Вдоводел» после того, как он последовал советам ИИ-прокси-подростка Дата-центр Drax может ежегодно выбрасывать почти вдвое больше CO₂, чем все рейсы из Гатвика Пиарщица OpenAI попыталась прервать интервьюера, когда Сэма Альтмана спросили о женщине, покончившей с собой после общения с ChatGPT Mirror Particle создаёт «модель мира» человеческого поведения Искусственная рецензия: Лука Гуаданьино замахнулся на OpenAI в сумбурной техносатире Страховщики готовятся к многомиллионным искам из-за вышедших из-под контроля ИИ-агентов Anthropic даст стартапам год бесплатного доступа к Claude Team и $1 000 кредитов Суд постановил: обучение ИИ на материалах, защищённых авторским правом, не считается добросовестным использованием Google Research раскрыла потенциал геопространственных моделей Earth AI для общественного здравоохранения во всём мире Исследователи превратили JEPA Яна Лекуна в универсальную модель мира — от физики до биологии ИИ Pinterest превращает бьюти-идеи в планы действий Кому принадлежит «мозговая гниль»? Международная юридическая драма вокруг любимого мема Южная Корея вложит $3,49 млрд в собственную передовую ИИ-модель, чтобы соперничать с лучшими китайскими моделями Родители создают школьные фото детей с помощью ИИ вместо того, чтобы за них платить Mistral представила Large 4 «Le Chonk» — текстовую модель с триллионом параметров, сильными результатами на тестах и планами открыть веса Новые ароматы: может ли парфюмерная технология снизить нагрузку на редкие растения? Страхи правых из-за «великого замещения» заслоняют настоящее: технологии замещают людей

Ежедневные новости об ИИ

Каждый день отбираем важные новости об ИИ и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.

Только важное — каждый день

В Telegram