Meta представила мультимодальную модель Muse Spark 1.1
Meta Superintelligence Labs выпустила Muse Spark 1.1 — мультимодальную модель рассуждения для агентных задач. По сравнению с первой Muse Spark она лучше работает с инструментами и компьютером, задачами по программированию и мультимодальным пониманием. Модель рассчитана на планирование действий в разных приложениях и сервисах, умеет координировать мультиагентные системы и управлять контекстом объёмом до 1 млн токенов. Публичный просмотр новой Meta Model API уже открыт, а Muse Spark 1.1 доступна в режиме «Рассуждение» в приложении Meta ИИ и на meta.ai.
Вместе с выпуском Muse Image, представленным на этой неделе, новая модель приближает Meta к идее персонального сверхинтеллекта — систем, которые помогают достигать целей, создавать задуманное, поддерживать отношения и действовать в соответствии с приоритетами пользователя.
Подробности оценок компания опубликовала в отдельном отчёте.
Агентные задачи
Muse Spark 1.1 показывает высокую производительность в персональных агентных задачах, где нужно планировать действия и координировать работу с несколькими внешними приложениями и сервисами. Модель без дообучения обобщает навыки на новые встроенные инструменты, MCP-серверы и пользовательские навыки.
Сложные проекты она выполняет быстрее первой Muse Spark: модель обучали координировать мультиагентные системы, чтобы сокращать общее время выполнения. В роли главного агента она собирает контекст, составляет план и распределяет работу между параллельными подагентами. В роли подагента — придерживается своей задачи, учитывает доступные инструменты и понимает, когда нужно передать управление главному агенту.
Muse Spark 1.1 может самостоятельно управлять контекстом объёмом 1 млн токенов. Она запоминает выполненные действия, извлекает сведения из ранних этапов работы и сжимает контекст так, чтобы сохранить критически важные шаги для продолжения задачи.
Источник: ai.meta.com
Работа с компьютером
Модель хорошо справляется с рабочими сценариями, которые проходят через несколько приложений, когда данные в них меняются по ходу выполнения. Она сохраняет контекст длинных сессий, подстраивается под новые требования и взаимодействует с незнакомыми интерфейсами при минимальном участии пользователя.
Muse Spark 1.1 определяет, когда быстрее написать скрипт для автоматизации, а когда проще воспользоваться интерфейсом напрямую. Модель обучали выбирать между скриптом и кликами, а также создавать группы действий на каждом этапе вместо последовательного выполнения каждого шага на рабочем столе.
В сценарии с организацией званого ужина модель замечает, что новые сведения меняют задачу уже во время оформления заказа, и самостоятельно вносит необходимые изменения.
Программирование
На реальных задачах с большими и сложными кодовыми базами Muse Spark 1.1 заметно улучшила результаты. Она может находить и исправлять сложные ошибки, добавлять функции в корпоративные системы и выполнять масштабные миграции кода. В задачах вроде создания веб-приложений и сквозного ответа на вопросы новая модель получила существенный прирост по сравнению с первой версией.
Модель обучали адаптироваться к разным средам запуска и надёжно работать со сложными многошаговыми сценариями. Muse Spark 1.1 поддерживает популярные настройки агентов для программирования, включая режим планирования, привязку к цели, делегирование подагентам и сжатие контекста.
В демонстрации с OpenCode модель создаёт веб-приложение с чатом, автоматически делает снимки экрана, находит видимые для пользователя ошибки, связывает их с нужными участками кода, вносит исправления и проверяет результат. В этом сценарии она объединяет программирование, мультимодальное понимание и вызов инструментов.
Разработчики и исследователи Meta уже ежедневно используют Muse Spark 1.1, чтобы быстрее создавать продукты и выполнять рабочие задачи. Во внутреннем бенчмарке Meta модель заметно превосходит Muse Spark и сопоставима с ведущими альтернативами.
Исследователи также применяют её для автоматизации разработки и оценки моделей.
В другой демонстрации, связанной с оценкой DeepSWE в OpenCode, Muse Spark 1.1 проверяет себя на части задач DeepSWE с разными уровнями рассуждения и по результатам формирует аналитическую панель.
Источник: ai.meta.com
Мультимодальные возможности
Помимо программирования и агентных сценариев, Muse Spark 1.1 работает с восприятием, мультимодальным рассуждением и инструментами. Модель взаимодействует с реальными средами и создаёт результаты, связанные с окружающим контекстом. Среди её задач — генерация визуально-кодовых артефактов, подробное описание изображений и видео, а также выполнение агентных рабочих процессов с мультимодальными данными.
Эти возможности особенно полезны в сценариях, где восприятие и действие должны происходить вместе. Модель анализирует изображение и звук, сохраняет детали на протяжении длинного рабочего процесса и использует их, когда управляет компьютером от имени пользователя.
В сценарии с Facebook Marketplace Muse Spark 1.1 получает видео со смартфона, выбирает из него подходящие фотографии, анализирует товар, открывает браузер пользователя и самостоятельно создаёт объявление на Facebook Marketplace.
Безопасность
До развёртывания Meta провела расширенные оценки безопасности в соответствии с методикой масштабирования передовых систем ИИ. Она определяет набор оценок, модели угроз и пороги развёртывания для наиболее передовых моделей компании.
В трёх категориях передовых рисков — химические и биологические угрозы, кибербезопасность и потеря контроля — Muse Spark 1.1, согласно оценкам Meta, остаётся в безопасных пределах. Модель показывает устойчивость к прямым попыткам обхода ограничений, косвенным атакам через ненадёжные данные, внедрению запросов и атакам через запросы разработчика.
Компания также сообщает о повышенной устойчивости к состязательным атакам, более низкой частоте галлюцинаций и меньшей склонности соглашаться с пользователем вопреки фактам.
Полное описание мер безопасности для версии 1.1 приведено в отчёте об оценке Muse Spark 1.1.
Источник: ai.meta.com
Meta Model API
Впервые разработчики могут начать создавать продукты с Muse Spark 1.1 через новую Meta Model API, которая сейчас работает в режиме публичного просмотра.
Ранние партнёры Meta описывают модель как основу для агентных систем, сочетающую работу с длинным контекстом, программирование и рассуждение для масштабных задач.
В Box отметили, что Muse Spark показала на корпоративном наборе задач результаты, сопоставимые с ведущими передовыми моделями. По словам Яшоды Бхавнани, вице-президента по продуктам ИИ в Box, модель особенно подходит для структурированных процедурных процессов в профессиональных услугах, государственном секторе и промышленности.
В Cline отдельно выделили работу с инструментами и стоимость, которая позволяет запускать реальные задачи по программированию в большом масштабе. В OpenClaw модель назвали быстрой и мощной для запуска агентов.
Meta также сообщила, что продолжает обучать более способные модели и позже расскажет о них.
Источник: ai.meta.com
Ежедневные новости об ИИ
Каждый день отбираем важные новости об ИИ, роботах и метавселенных и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.
Только важное — каждый день
В Telegram
