Meta представила модель генерации изображений Muse Image
Источник: ai.meta.com
Muse Image как ИИ-агент
Muse Image не просто напрямую превращает запрос в изображение. Модель действует как ИИ-агент: обращается к поиску и программированию, сама улучшает результат и использует дополнительные вычисления на этапе инференса. Вместе с Muse Spark она может обмениваться инструментами и совместно планировать создание медиаконтента.
Meta предоставила Muse Image доступ к инструментам, которые расширяют её способности.
Программирование. Во время обучения с подкреплением Muse Image учится писать и запускать код для создания точных графиков и QR-кодов. Затем модель использует визуализированные изображения как дополнительные условия, чтобы повысить точность генерации. Muse Spark и Muse Image также объединяют генерацию кода и медиаконтента: так они создают анимированные GIF, сайты со встроенными изображениями и интерактивные визуальные игры.
Поиск. Muse Image учится искать информацию в интернете, чтобы опираться при генерации на факты, актуальные сведения и визуальные исходные материалы. Поиск повышает точность ответов на запросы, требующие знаний, особенно когда речь идёт о текущих событиях и фактах из реального мира.
Внутренние абляционные тесты показали, что качество Muse Image растёт при использовании поискового инструмента.
Источник: ai.meta.com
Самоулучшение
Muse Image анализирует собственную работу и исправляет её в ходе рассуждений. Если проблема небольшая, модель может локально изменить текущий черновик. При серьёзных ошибках она создаёт изображение заново или выбирает другой подход — например, использует инструмент для более точной генерации на основе фактов.
По данным Meta, такую механику не задавали вручную. Она появилась во время обучения с подкреплением: самоанализ давал более качественные изображения и, следовательно, приносил модели больше награды.
Внутренние абляционные тесты также показали рост качества при использовании самоулучшения.
Источник: ai.meta.com
Масштабирование вычислений
Как и языковые модели, Muse Image получает более качественные результаты, если ей дать больше времени на рассуждение во время инференса. При увеличении вычислительного бюджета модель дольше рассуждает, делает больше вызовов инструментов и выполняет больше шагов самоулучшения.
Рост вычислительной нагрузки повышает оценки Elo по человеческим предпочтениям и демонстрирует примерно логарифмически-линейную зависимость. При этом вычисления включают два разных типа работы: текстовые токены для рассуждений и визуальные токены для генерации. Качество зависит от их общего объёма.
Распределять бюджет токенов нужно рационально. Подход «лучшего из N», при котором модель создаёт несколько изображений и выбирает лучшее, быстро повышает качество, но вскоре достигает плато. Если направить те же вычисления на последовательное рассуждение, качество продолжает расти заметно дольше.
Рассуждение и использование инструментов усиливают друг друга. Поиск помогает найти недостающие сведения и исходные материалы, а написание кода — точно воспроизвести детали, которые невозможно получить только рассуждением.
Внутренние абляционные тесты Meta показали улучшение показателей Elo при масштабировании вычислений на этапе инференса.
Источник: ai.meta.com
Редактирование и исходные материалы
Muse Image точно редактирует изображения, меняя именно те элементы, о которых просит пользователь. Модель поддерживает разные типы инструкций и сохраняет согласованность между последовательными правками, поэтому с ней можно постепенно дорабатывать результат или искать нужную идею.
В одном запросе Muse Image умеет объединять элементы из множества исходных материалов: людей, предметы, одежду, стили и окружение. Текст и изображения можно чередовать прямо внутри запроса, что позволяет собирать сложные композиции.
На момент публикации Muse Image занимает 2-е место в Arena по человеческим оценкам Elo сразу в трёх категориях: генерация изображений по тексту, редактирование одного изображения и редактирование нескольких изображений.
Источник: ai.meta.com
Предварительная версия Muse Video
Одновременно Meta показала раннюю версию Muse Video. Она демонстрирует конкурентные результаты в следовании запросам, визуальной точности и согласованности движения во времени.
Компания продолжает работать над областями, где у модели остаются проблемы, включая синхронизацию звука и изображения, а также физически точное отображение быстрых движений. Muse Video скоро станет доступна авторам и пользователям Meta ИИ.
В Arena Muse Video занимает 3-е место по человеческим оценкам Elo в категории генерации видео по тексту на момент публикации.
Источник: ai.meta.com
Защита от подделок
Чтобы пользователи могли проверять происхождение изображений, Muse Image получила Content Seal — систему невидимой водяной маркировки Meta.
Изображения, созданные в приложении Meta ИИ и на meta.ai, содержат скрытый сигнал происхождения. Он сохраняется после обрезки, сжатия, изменения размера и даже снимка экрана.
Meta планирует вскоре добавить Content Seal для видео. Компания также предварительно тестирует инструмент, который проверяет наличие такой водяной маркировки и помогает определить, было ли изображение создано с помощью Meta ИИ.
Muse Image тесно связана с экосистемой Meta. Дальнейшие вложения компании в генерацию изображений и видео должны расширить возможности авторов и бизнеса по созданию динамичного контента в продуктах Meta.
Источник: ai.meta.com
Источник: ai.meta.com
Источник: ai.meta.com
Ежедневные новости об ИИ
Каждый день отбираем важные новости об ИИ, роботах и метавселенных и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.
Только важное — каждый день
В Telegram