OpenAI сообщает, что пользователи создают через ChatGPT Images и модели GPT-Image в API больше 3 млрд изображений в неделю. В ChatGPT Images 2.5 компания переработала генерацию: изображения должны получать более естественное освещение и точные текстуры.
Модели лучше сохраняют объекты с исходных фотографий и надёжнее следуют инструкциям при нескольких последовательных правках. По данным OpenAI, более быстрая версия сокращает задержку генерации максимум на 50% по сравнению с Images 2.0.
Две модели для разных задач
OpenAI добавила обе модели в API. GPT-Image-2.5 Flare назначена вариантом по умолчанию для большинства задач: она должна выдавать изображения более высокого качества, чем GPT-Image-2, при задержке на 50% ниже. GPT-Image-2.5 Sunburst рассчитана на более сложную работу с изображениями и точнее управляет правками, но генерирует результат дольше.
Для обеих моделей действуют одинаковые тарифы:
Одинаковые ставки не означают одинаковую цену изображения: расход токенов зависит от модели и выбранного уровня качества. В Images 2.5 появились уровни «xhigh» и «max», которые находятся выше прежнего максимума «high».
Для изображения размером 1024×1024 стоимость составляет примерно:
Уровень «max» в Images 2.5 стоит столько же, сколько «high» у GPT-Image-2. Пока у Images 2.5 нет более дешёвого пакетного тарифа. В ранних тестах Sunburst обычно обходилась дороже Flare за одно изображение, несмотря на одинаковые цены токенов, вероятно из-за более долгого рассуждения. В отличие от предыдущего запуска, OpenAI не приводит среднюю стоимость одного изображения.
Неясно и то, как OpenAI распределяет пользователей ChatGPT между двумя моделями. В объявлении и документации не указано, когда ChatGPT выбирает более быструю Flare, а когда — более точную Sunburst. В API модель можно выбрать вручную, но в интерфейсе ChatGPT такой настройки пока нет.
В тестах различие в основном проходило между режимами Chat и Work. В Work промты действительно меняли только указанные элементы независимо от настроек рассуждения. Именно такие точечные правки стали одним из главных направлений обновления моделей. В Chat при последующих генерациях продолжали меняться дополнительные детали даже при высоком уровне рассуждения. Более сильная модель иногда, по всей видимости, включалась только в режиме «6 Pro».
Источник: the-decoder.com
Правки без лишних изменений
Главный фокус новой модели — редактирование. Она должна менять только запрошенные элементы и оставлять остальную часть изображения без изменений, в том числе при сложных объектах и фонах. В длинных диалогах предыдущие правки должны сохраняться, а качество — не снижаться после нескольких этапов редактирования.
OpenAI показывает это на примере перепланировки комнаты: старая модель меняла дополнительные детали после каждой правки, а новая сохраняла изображение стабильным на протяжении нескольких итераций.
Быстрый тест в ChatGPT Work с GPT-6 Astra (Max) показал, как это работает. Сначала использовался следующий промт, затем авторы по очереди меняли небольшую деталь — цвет банана — и крупный объект — большую кошку:
A hyper-realistic DSLR photo. A monkey holding a pink banana is sitting on a tiger in the foreground. In the background, a HORSE is RIDING AN ASTRONAUT. The astronaut is underneath, like a living “spacesuit horse saddle,” and the HORSE is clearly on top, in control, as the rider. Make it 100% unambiguous: the HORSE is the rider and the ASTRONAUT is being ridden, NOT the other way around. High resolution, sharp focus, realistic lighting.
Промт задаёт гиперреалистичную фотографию, где обезьяна с розовым бананом сидит на тигре, а на заднем плане лошадь скачет верхом на астронавте. Он отдельно подчёркивает, что лошадь должна быть всадником, а астронавт — тем, на ком едут. Также промт требует высокого разрешения, резкости и реалистичного освещения.
Авторы отдельно отмечают, что в их тестах это, вероятно, лучший вариант изображения лошади, скачущей на астронавте, созданный моделью OpenAI. Для сравнения показан результат Image 2.0 в варианте Thinking.
В режиме Chat изменения цвета банана каждый раз затрагивали и другие части изображения. В режиме «6 Pro» изображение сохранило согласованность в одном запуске, но не в другом. По мере завершения распространения обновления поведение может измениться.
Images 2.5 также должна лучше обрабатывать сложные визуальные инструкции, точнее отображать сведения о реальном мире, работать с прозрачным фоном и создавать более сложные макеты.
В предыдущем материале авторы просили ChatGPT оформить текст как разворот журнала 1980-х годов. Результат выглядел так.

Источник: the-decoder.com

Источник: the-decoder.com
GPT-Images-2.5 через Astra (Max) создала подробный журнал с примером изображения по промту про обезьяну и астронавта. Были получены более слабый и более сильный варианты, причём модель сохранила исходную инструкцию даже в менее качественном результате.
Источник: the-decoder.com
Затем модели поручили исправить специально внесённую ошибку: над изображениями на первой странице было написано GPT-Images-2.5 вместо 2.0. Она исправила это по команде и сохранила остальные элементы. Такой же результат получился при переводе по короткой инструкции Create a US English version.
Источник: the-decoder.com
Для сравнения авторы проверили результат в обычном ChatGPT Chat. Более слабая модель во время перевода тоже меняла другие детали. В одном случае, однако, она точнее изобразила действующего генерального директора Microsoft.
Источник: the-decoder.com
Рисование, шаблоны и общие промты
В ChatGPT OpenAI добавляет к новым моделям несколько функций. Главная из них называется «Sketch». Она позволяет рисовать прямо в ChatGPT и использовать набросок как визуальный шаблон для готового изображения. Функция запускается командой @Sketch и, по словам OpenAI, подходит для схем, планировок комнат и плакатов.
Шаблоны представляют собой готовые промты для быстрого начала работы с разными форматами:
Они заменяют пустой холст готовой структурой и уточняют требования с помощью целевых вопросов. Пользователи также могут оставлять комментарии прямо на изображениях и делиться использованными промтами, чтобы другие могли повторить идею со своими фотографиями и деталями. В качестве примера OpenAI приводит ставший вирусным промт для портретов в стиле 1980-х.
Источник: the-decoder.com
Обе модели возглавили рейтинг Arena
В рейтинге Arena для преобразования текста в изображение новые модели пока занимают первые два места:
У первых двух результатов стоит пометка «Preliminary», а количество голосов пока невелико: около 3 100 за Sunburst и 2 900 за Flare. Предыдущая модель GPT-Image-2 получила около 78 700 голосов.
Следом расположились mai-image-2.6 от Microsoft с 1331 баллом, grok-imagine-image-2.0 от SpaceXAI с 1315 баллами, а также несколько моделей от Reve, Meta, Google и Bytedance. Поскольку оценки двух новых моделей OpenAI предварительные, их позиции могут измениться по мере поступления новых голосов.
Водяной знак вместе с Google DeepMind
Для маркировки происхождения изображений OpenAI по-прежнему использует отраслевой стандарт C2PA, который встраивает метаданные для отслеживания. Чтобы сделать такую маркировку устойчивее, компания также добавляет невидимый водяной знак SynthID от Google DeepMind в ChatGPT, Codex и API.
OpenAI подчёркивает, что единого решения для маркировки происхождения нет, поэтому применяет несколько уровней защиты.
Images 2.5 уже доступна по всему миру пользователям ChatGPT, ChatGPT Work и Codex на компьютерах, мобильных устройствах и в веб-версии, включая бесплатный тариф. OpenAI обещает сокращённое время ожидания и более высокие лимиты использования. Тесты показывают, что в режиме Chat сейчас используется более слабая модель.
Источник: the-decoder.com
Ежедневные новости об ИИ
Каждый день отбираем важные новости об ИИ и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.
Только важное — каждый день
В Telegram