Холст вместо чата
ИИ умеет делать картинки, видео, сайты, слайды и музыку по одному запросу. Но реальная творческая работа так не устроена. Вы почти никогда не приходите к финалу одной фразой. Обычно есть референсы, черновики, удачные и неудачные варианты, правки, ветки версий, комментарии от коллег и куча мелких решений по дороге.
Вот эту промежуточную жизнь проекта инструменты часто теряют. Чат помнит диалог линейно. Генераторы отдают готовый результат и забывают, как к нему пришли. Узловые редакторы делают шаги видимыми, но обычно требуют вручную собирать конвейер. В итоге ИИ-агент может что-то сгенерировать, но ему трудно долго держать в голове весь проект и не запутаться.
Статья про JarvisHub предлагает простой с виду, но важный ход: сделать главным не чат, а холст. То есть общее рабочее пространство, где лежит всё: запросы, изображения, заметки, связи между артефактами, версии, статусы, пользовательские правки. Этот холст видит и человек, и ИИ-агент. Оба могут его читать и менять.
Это важно по одной причине: если вы хотите, чтобы ИИ-агент делал не одиночный артефакт, а вёл длинную творческую задачу, ему нужен не только доступ к моделям, но и память о проекте.
Почему обычных генераторов и чат-агентов мало для длинной творческой работы, и чем отличается JarvisHub.
Что именно предлагают авторы
JarvisHub — это открытый фреймворк для мультимодальных творческих ИИ-агентов. Ключевая идея: проект хранится как редактируемый граф на холсте. Каждый объект — это узел. Например, текст задачи, референс, кадр раскадровки, черновик сайта, видеофрагмент, слайд, комментарий пользователя. Между узлами есть связи: что на что опирается, какая версия из какой выросла, какой артефакт был отклонён, а какой принят.
Звучит как инженерная деталь, но на практике это меняет механику работы ИИ-агента. Он больше не живёт внутри истории сообщений. Он работает с внешним состоянием проекта.
Авторы делят систему на три слоя:
Это похоже на разделение обязанностей в хорошей системе: память отдельно, контроль доступа отдельно, логика действий отдельно. Такой дизайн нужен, чтобы ИИ-агент не менял проект как попало и чтобы каждое действие можно было отследить.
Архитектура JarvisHub: состояние холста, протокольный мост и исполнительная среда агента.
Почему чат здесь не справляется
Линейный чат удобен, пока задача короткая. Но в длинной работе он быстро становится узким местом.
Представьте, что вы делаете короткий видеосюжет. Есть герои, стиль, локации, порядок сцен, варианты кадров, отвергнутые попытки, удачные детали, которые надо сохранить. Всё это плохо помещается в переписку. Чат не очень умеет показывать ветвление версий, локальные правки конкретного кадра или зависимость одной сцены от другой.
Холст решает эту проблему иначе. Он делает состояние проекта явным. У каждого артефакта есть адрес. На него можно сослаться, переиспользовать, откатить, исправить локально или связать с новым шагом.
Авторы выделяют три свойства такого подхода:
Для творческой работы это особенно важно. Здесь редко бывает один правильный ответ. Зато важен путь: что выбрали, что отбросили и почему.
Как работает цикл агента
Каждый ход в JarvisHub устроен примерно так. Пользователь даёт запрос. ИИ-агент смотрит на текущий холст. Протокольный мост сообщает, какие действия в этом ходе разрешены. После этого агент выбирает шаг: прочитать узлы, создать новый артефакт, вызвать генерацию изображения, запустить внешний инструмент, запросить уточнение, сделать исправление. Результат проверяется и только потом записывается на холст.
То есть система не даёт агенту тайно жить в собственной внутренней логике. Любое полезное действие должно превратиться в проверяемое изменение общего состояния.
Авторы отдельно описывают семейства инструментов, которыми пользуется исполнительная среда:
Сверху на это накладываются ещё три сущности: навыки, память и субагенты. Навыки задают повторяемые процедуры вроде сборки слайдов или создания раскадровки. Память хранит предпочтения и прошлые решения. Подагенты помогают разветвлять работу, когда части задачи можно делать параллельно.
Цикл работы ИИ-агента: наблюдение за холстом, выбор действия, вызов инструмента и проверенная запись результата.
Где это проверяли
Авторы не строят формальный бенчмарк с цифрами. Вместо этого они показывают три длинных творческих сценария в одной и той же среде:
В качестве основы они использовали GPT-5.5 как главный мозг агента, GPT Image 2 для изображений, Seedance 2.0 для видео и Gemini 3.1 Pro как мультимодальный оценщик.
Это не соревнование моделей. Здесь вопрос другой: помогает ли общий холст вести длинную задачу так, чтобы проект не рассыпался по дороге.
Что видно в примерах
Самая наглядная часть работы — не финальные результаты, а следы процесса. Авторы показывают не только готовые артефакты, но и рабочее пространство: заметки, промежуточные изображения, зависимости, статус задач, превью, черновики.
В кейсе с нарративным видео холст хранит краткое описание истории, визуальные референсы, кандидаты кадров и связи между ними. Это позволяет удерживать постоянство персонажей и локации между сценами.
Следы работы на холсте для нарративной медиагенерации: план, референсы, кандидаты кадров и связи между ними.
В кейсе с веб-разработкой на холсте лежат описание сайта, визуальные ориентиры, макеты, кодовые артефакты, превью страниц и состояние правок. За счёт этого агент не просто пишет код, а работает в режиме проекта: сравнивает, меняет, возвращается к предыдущим решениям.
Следы работы на холсте при создании сайта: бриф, референсы, макеты, артефакты реализации и состояние правок.
В кейсе с презентацией тот же принцип переносится на слайды. Холст хранит структуру лекции, диаграммы, черновики слайдов, ссылки между содержанием и визуальными элементами, а также превью итоговой колоды.
Общий вывод из этих примеров простой: система хранит не только результат, но и контекст, который нужен для следующего шага.
Почему это важно для исследований и продуктов
У работы есть интересная мысль: объектом анализа должен быть не только финальный артефакт, но и траектория. Иначе вы видите красивую картинку или неплохой сайт, но не понимаете, как именно ИИ-агент туда пришёл. Он мог игнорировать референсы, терять выбранные версии, перегенерировать всё целиком вместо локальной правки и случайно прийти к нормальному результату.
JarvisHub записывает траекторию пошагово: запрос, состояние холста, доступные действия, выбранное действие, наблюдение от инструмента, обратная связь, решение об исправлении, новое состояние. Такой журнал делает процесс воспроизводимым.
Из этого вытекают сразу несколько практических последствий:
Это особенно актуально сейчас, когда многие коммерческие продукты уже движутся к агентному творческому режиму, но их внутренняя механика закрыта. Видно, что они умеют делать; не видно, как именно они удерживают состояние проекта.
Ограничения
Авторы честно описывают и границы подхода.
Во-первых, это качественная демонстрация, а не строгий бенчмарк с численными метриками и таблицей лидеров. Здесь показывают, что фреймворк работает на содержательных сценариях, но не измеряют его в стандартизованной гонке.
Во-вторых, JarvisHub отвечает за оркестрацию и управление состоянием, а не за магию качества самой генерации. Если внешняя модель для изображений или видео слаба, холст это не исправит.
В-третьих, проверка действий через протокол делает систему более надёжной, но не гарантирует, что творческое решение будет семантически верным. Агент всё ещё может выбрать плохой ход, просто теперь этот ход будет зафиксирован и видим.
Наконец, траектории полезны для анализа и будущего обучения, но с ними сразу встают вопросы согласия пользователей, анонимизации и авторских прав.
Вывод
JarvisHub предлагает смотреть на творческого ИИ-агента как на участника проекта, а не как на генератор по запросу. Для этого ему дают общее рабочее пространство — холст, где хранятся артефакты, версии, зависимости, статусы и правки.
Главная идея статьи в новой единице организации работы. Если длинная задача требует памяти, локальных исправлений, ветвлений и обратной связи, чат оказывается слишком узким интерфейсом. Холст подходит лучше, потому что превращает проект в явное состояние, с которым можно работать шаг за шагом.
Из этого может вырасти следующий слой инфраструктуры для ИИ-агентов: не ещё один генератор картинок или слайдов, а среда, где видно весь путь от запроса до результата. Для творческих систем это уже не удобное дополнение. Это базовое условие, если вы хотите, чтобы ИИ-агент вёл проект долго, последовательно и под контролем человека.
ИИ-обзоры простыми словами
Каждый день читаем свежие статьи об ИИ и пересказываем главное естественным языком — без хайпа и воды. Если хотите понимать, куда движутся ИИ-агенты раньше остальных, — подписывайтесь.
Новые обзоры — каждый день
В Telegram