i
ДАТАИСТ
Новости · 2026-08-28

Meta представила Muse Image и Muse Video

Meta Superintelligence Labs выпустила Muse Image — модель генерации изображений, которая следует инструкциям, точно редактирует картинки и собирает композиции из нескольких исходных изображений. Она умеет пользоваться поиском и инструментами для программирования, самостоятельно улучшать результат и работать вместе с моделью Muse Spark. Одновременно Meta показала Muse Video — модель генерации видео на той же базе предварительного обучения, с высокой визуальной точностью и встроенной поддержкой звука. Muse Image уже доступна в приложении Meta ИИ и на meta.ai, в Instagram Stories в США и WhatsApp в некоторых странах; позже она появится в Facebook. Muse Video выйдет для создателей контента и в Meta ИИ.

Обложка: Meta представила Muse Image и Muse Video

Meta представила модель изображений Muse Image и показала Muse Video

Meta Superintelligence Labs выпустила Muse Image — модель генерации изображений, которая следует инструкциям, точно редактирует картинки и собирает композиции из нескольких исходных изображений. Она умеет пользоваться поиском и инструментами для программирования, самостоятельно улучшать результат и работать вместе с моделью Muse Spark. Одновременно Meta показала Muse Video — модель генерации видео на той же базе предварительного обучения, с высокой визуальной точностью и встроенной поддержкой звука. Muse Image уже доступна в приложении Meta ИИ и на meta.ai, в Instagram Stories в США и WhatsApp в некоторых странах; позже она появится в Facebook. Muse Video выйдет для создателей контента и в Meta ИИ.

Что умеет Muse Image

Вместо прямого преобразования запроса в изображение Muse Image работает как ИИ-агент: вызывает поиск и инструменты для программирования, проверяет собственные результаты и увеличивает объём вычислений во время инференса, чтобы повысить качество. Модель также интегрирована с Muse Spark — они могут совместно использовать инструменты и планировать генерацию медиаконтента.

Для возможностей агента Muse Image получила доступ к нескольким инструментам.

Программирование. Во время обучения с подкреплением Muse Image учится писать и выполнять код для создания точных графиков и QR-кодов. Затем она может использовать визуализированные изображения этих объектов, чтобы повысить точность итоговой картинки. Muse Spark и Muse Image также объединяют генерацию кода и медиаконтента для создания анимированных GIF, сайтов со встроенными изображениями и интерактивных визуальных игр.

Поиск. Модель учится искать информацию в интернете, чтобы опираться при генерации на проверяемые и актуальные данные, а также на визуальные примеры. Поиск особенно повышает точность ответов на запросы, связанные с текущими событиями и фактами из реального мира.

Внутренние сравнительные тесты показали, что использование поискового инструмента повышает долю побед Muse Image.

Самоисправление

Muse Image анализирует собственную работу в ходе рассуждения и дорабатывает результат. Если проблема небольшая, модель может изменить отдельную деталь текущего черновика. При серьёзной ошибке она способна сгенерировать изображение заново или выбрать другой подход — например, воспользоваться инструментом, чтобы точнее передать факты.

Такое поведение не задавали вручную. Оно появилось во время обучения с подкреплением: самоисправление давало более качественные изображения и приносило модели большую награду.

Внутренние сравнительные тесты показали улучшение результатов Muse Image благодаря возникшему самоисправлению.

Вычисления во время инференса

Как и языковые модели, Muse Image улучшается, если дать ей больше времени на рассуждение во время инференса. При увеличении доступных вычислений она глубже рассуждает, чаще вызывает инструменты и выполняет больше шагов самоисправления.

Рост способности к рассуждению, а вместе с ним и объёма вычислений во время инференса, повышает оценки Elo по предпочтениям людей. Зависимость примерно логарифмически линейная. При этом вычисления включают два разных типа работы: текстовые токены для рассуждения и визуальные токены для генерации. Качество зависит от их общего объёма.

Имеет значение и то, как именно распределяется доступный бюджет токенов. При выборе лучшего из N модель создаёт несколько изображений и оставляет лучшее. Это быстро повышает качество, но затем результат перестаёт улучшаться. Если направить тот же объём вычислений на продуманное рассуждение, улучшение продолжается заметно дольше.

Рассуждение и использование инструментов усиливают друг друга. Поиск даёт модели недостающие исходные изображения, а написание кода помогает точно воспроизводить детали — то, чего одного рассуждения добиться не всегда удаётся.

Внутренние сравнительные тесты показали улучшение Muse Image при масштабировании вычислений во время инференса.

Редактирование и композиции

Muse Image точно редактирует изображения и меняет именно те элементы, о которых просит пользователь. Она сохраняет согласованность между последовательными этапами редактирования, поэтому картинку можно постепенно дорабатывать или использовать для свободного поиска нужного результата.

Модель умеет объединять элементы из нескольких исходных изображений, включая людей, предметы, одежду, стили и окружение. В сложных запросах можно чередовать текст и изображения.

На момент публикации Muse Image занимала 2-е место в Arena по трём направлениям: генерации изображений по тексту, редактированию одного изображения и редактированию нескольких изображений. Рейтинг основан на оценках Elo по предпочтениям людей.

№2Muse Image в Arena
3 направлениятекст-в-изображение и редактирование
№3Muse Video в Arena

Muse Video

Вместе с Muse Image Meta представила предварительную версию Muse Video. Модель показывает конкурентные результаты в выполнении запросов, визуальной точности и согласованности движения во времени.

Meta продолжает работать над проблемами, которые пока сохраняются, включая синхронизацию звука и видео и физически точное отображение быстрых движений. Muse Video скоро станет доступна создателям контента и в Meta ИИ.

На момент публикации модель занимала 3-е место в Arena по Elo, рассчитанному на основе человеческих предпочтений в генерации видео по тексту.

Скрытая маркировка изображений

Чтобы пользователи могли проверять происхождение изображений, Muse Image использует Content Seal — систему невидимой маркировки. Картинки, созданные в приложении Meta ИИ и на meta.ai, получают скрытый сигнал происхождения. Он сохраняется после обрезки, сжатия, изменения размера и даже снимка экрана.

Meta планирует вскоре добавить Content Seal для видео. Компания также показывает инструмент обнаружения, который проверяет наличие водяного знака Content Seal и помогает определить, было ли изображение создано с помощью Meta ИИ.

Muse Image тесно связана с экосистемой Meta. Дальнейшие вложения компании в генерацию изображений и видео должны поддержать создание динамического контента в продуктах Meta для создателей и бизнеса.

Ежедневные новости об ИИ

Каждый день отбираем важные новости об ИИ, роботах и метавселенных и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.

Только важное — каждый день

В Telegram