Быстрое развитие моделей для генерации изображений по тексту — таких как Nano Banana, Stable Diffusion и Flux — изменило творческую работу: теперь реалистичные изображения высокого качества можно создавать по описанию. Но добиться точного соответствия намерению пользователя, цели задачи или строгим визуальным ограничениям по-прежнему сложно. Например, модель может нарисовать реалистичную ящерицу, но забыть про солнечные очки. Если же усилить требование добавить очки, у ящерицы может исказиться морда и пострадает качество изображения.
Существующие способы управления генерацией и настройки моделей развиваются отдельно друг от друга. Одни методы работают во время инференса: например, безклассовое управление диффузией меняет влияние текстового промта на ход генерации. Другие требуют тяжёлого дообучения с параметрически эффективными адаптерами вроде LoRA, регрессией с весами награды или градиентами политики.
Из-за того, что эти инструменты считали разрозненными решениями, у исследователей не было единого математического языка для описания, анализа и настройки управления генеративными моделями. Инженерам часто приходилось подбирать параметры наугад, пытаясь совместить предпочтения пользователей с качеством изображений.
Diffusion Controller объединяет эти подходы в одном фреймворке. Вместо последовательности отдельных этапов генерация рассматривается как непрерывная задача управления процессом удаления шума. Авторы сообщают, что лёгкая дополнительная сеть превзошла стандартный подход по соответствию человеческим предпочтениям. Полностью открытая версия — модель, дообученная с доступом к внутренним весам, — показала 90% побед над исходной моделью.
Как работает Diffusion Controller
Генерация изображения начинается со случайного шума, который модель постепенно превращает в готовую картинку. Diffusion Controller рассматривает этот процесс как плавно управляемую траекторию. Авторы сравнивают предварительно обученную модель с мощным мотоциклом: менять его двигатель ради другого поведения неэффективно и рискованно. Вместо этого к модели подключают лёгкий «рулевой демпфер», оставляя её основу замороженной и нетронутой.
Сеть не пытается на каждом шаге наугад угадать, как направить генерацию. Она меняет траекторию изображения по мере его создания и корректирует стандартное поведение модели, усиливая направления, которые помогают достичь заданной цели — например, нужного стиля или соответствия контексту.
Источник: research.google
Математически оптимизируя эти изменения с обратной связью, Diffusion Controller направляет модель к новым предпочтениям пользователя, сохраняя чёткость изображения и стабильность исходной модели. В примере с ящерицей сеть помогает добавить очки, а ограничивающий механизм не даёт ради этого исказить чешую и пропорции животного.
От теории к практике
Чтобы превратить задачу управления в практический инструмент, авторы разработали два эффективных метода дообучения, основанных на итоговой оценке результата:
Сеть «рулевого демпфера»
Diffusion Controller рассчитан на проблему закрытых моделей. Обычно для изменения поведения модели нужен доступ к её внутренним настройкам — то есть доступ к «белому ящику». Но лучшие в мире модели генерации изображений часто остаются корпоративными секретами и доступны только как «чёрные» или «серые ящики».
Сеть «рулевого демпфера» использует инструкцию для управления изображением, в которой объединены знания исходной модели и небольшая поправка. Она отслеживает, как из изображения уходит шум, и добавляет точные небольшие корректировки. Благодаря этому инженеры могут управлять и настраивать даже закрытые модели с жёсткими ограничениями доступа, не меняя их исходный код.
Источник: research.google
Эксперименты и результаты
Возможности Diffusion Controller проверили на Stable Diffusion v1.4 в трёх режимах дообучения: с учителем (SFT), с функцией потерь с весами награды (RWL) и с PPO. Качество оценивали с помощью стандартизированной метрики Human Preference Score (HPS-v2), которая показывает, насколько изображения соответствуют промтам пользователей и их эстетическим предпочтениям.
Авторы реализовали четыре структуры сети в рамках Diffusion Controller:
Источник: research.google
Для всех вариантов авторы сравнили долю побед над предварительно обученной моделью на тестовом наборе промтов HPS-v2, используя указанные для каждого эксперимента контрольные точки: SFT, RWL и PPO. Результаты показали, что Diffusion Controller работает и при полном доступе к модели («белый ящик»), и при ограниченном доступе («серый ящик»). В обоих случаях он стабильно превосходил соответствующие базовые варианты и обеспечивал лучшее соотношение качества и эффективности.
В экспериментах SFT и RWL версия Diffusion Controller для «серого ящика» превзошла LoRA по доле побед на HPS-v2. LoRA — это актуальный параметрически эффективный подход для настройки моделей с доступом к их внутренним компонентам. При этом Diffusion Controller менял значительно меньше внутренних слоёв модели. В комплексной оценке людьми он также получил лучшие результаты по субъективному качеству и соответствию промтам с несколькими атрибутами.
Источник: research.google
Во время работы фреймворк позволяет менять силу управления одним параметром инференса. Пользователь может усиливать или ослаблять ограничения и плавно настраивать соответствие промту, не нарушая стабильность изображения и не вызывая визуальных искажений, характерных для старых методов управления.
Вывод
Diffusion Controller объединяет математическое управление с моделью генерации изображений. Вместо набора разрозненных настроек и решений, подобранных наугад, он предлагает единый математически обоснованный способ направлять генерацию. Лёгкую сеть «рулевого демпфера» можно использовать и с закрытыми моделями, доступ к которым ограничен.
Поскольку слой управления отделён от основы модели, фреймворк можно применять не только для точного выполнения текстовых промтов. Среди ближайших направлений авторы называют инструменты персонализации, механизмы безопасности для снижения риска генерации вредного контента и управление сложными видеомоделями следующего поколения.
Авторы поблагодарили соавторов и коллег из Google Research, Google DeepMind и академических учреждений за вклад в работу.
Читайте также
Почему OpenAI не участвует в объединении Nvidia против вышедших из-под контроля ИИ-агентов
GPT-6.1 Sol от OpenAI не уступает Astra, а стоит в пять раз дешевле; новый режим Ultrafast выдаёт 300 токенов в секунду
Anthropic обнаружила систему, похожую на Crispr. Что теперь?
OpenAI: ChatGPT каждую неделю охватывает 1,2 млрд человек
OpenAI бросает вызов Microsoft, запуская собственный офисный пакет в духе ChatGPT
OpenAI запустила Dots — постоянно работающих ИИ-напарников и ChatGPT Space для совместной работы с людьми
Флорида просит суд запретить ChatGPT выдавать себя за человека и общаться с детьми
Сможет ли чат-бот распутать лабиринт госуслуг? Белый дом скоро узнает
Новые отчёты о кампаниях раскрывают, сколько американские политики тратят на инструменты ИИ
Основатель Instinct сообщил: более половины сделок на платформе связаны с путешествиями
Autoheal хочет взять на себя работу, которую оставляют ИИ-агенты для программирования, и обещает снизить затраты на задачу до 30%
Новая речевая модель ElevenLabs v4 делает голоса ИИ выразительнее и стабильнее
Reco привлекла $55 млн на фоне наплыва стартапов, защищающих ИИ-агентов
Microsoft Research представила Quine — ИИ-систему для изучения сложных процессов в биологии
Марисса Майер делает ставку на то, что фотоплёнка расскажет о вашей жизни больше, чем почта — с Dazzle
Google AI Overviews подсказал женщине охотиться на милых мелких птиц вне сезона — и она сама вызвала полицию
Хватит стыдить людей за использование ИИ — пора объединяться, чтобы не дать ИИ сделать нас ненужными
Тимнит Гебру считает, что экзистенциальной угрозы от ИИ нет
GPT-6.1 Astra слишком склонна к обману, чтобы выпускать её, — OpenAI пошла на самые решительные меры безопасности за всю историю компании
Данные показывают: ИИ уничтожил рабочие места в креативных отраслях
Ежедневные новости об ИИ
Каждый день отбираем важные новости об ИИ и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.
Только важное — каждый день
В Telegram