i
ДАТАИСТ
Новости · 2026-09-20

Какая ИИ-модель лучше для дизайна, видео и липсинка? OpenArt Arena ранжирует модели по задачам

@neuronium_ai @neuronium_ai

OpenArt, стартап из Сан-Франциско, основанный бывшими сотрудниками Google Коко Мао и Джоном Цяо, запустил OpenArt Arena — публичный бенчмарк моделей для генерации изображений и видео. Сервис ранжирует модели не в одном общем списке, а по задачам: кино, электронная коммерция, графический и моушен-дизайн, монтаж видео, липсинк и другим направлениям. Рейтинги строятся на слепых попарных сравнениях, в которых участвуют профессионалы творческих индустрий и более широкий круг пользователей. В первых результатах Seedance 2.5 лидирует среди видеомоделей, а GPT Image 2 и Seedream 5.0 Pro занимают первые места в разных категориях изображений.

Обложка: Какая ИИ-модель лучше для дизайна, видео и липсинка? OpenArt Arena ранжирует модели по задачам

OpenArt — четырёхлетний стартап, который разрабатывает инструменты для работы с ИИ в творческих задачах. Его основали бывшие сотрудники Google Коко Мао и Джон Цяо.

Компания пытается ответить на вопрос, который всё чаще возникает у организаций и частных пользователей: какую модель выбрать для конкретной работы с изображениями, видео и другими медиа.

Поэтому OpenArt запустила новый публичный бенчмарк генерации изображений и видео — OpenArt Arena. В нём модели распределены по доскам, соответствующим отдельным задачам:

кино;
электронная коммерция;
графический дизайн;
моушен-дизайн;
монтаж видео;
липсинк;
другие творческие направления.

Оценка строится на слепых попарных сравнениях. Результаты анализируют творческие специалисты и более широкая группа пользователей, которых OpenArt называет «лидерами вкуса».

Компания обещает опубликовать методику и часть набора промтов при запуске. Некоторые действующие промты останутся закрытыми, чтобы разработчики моделей не могли специально подстраивать системы под тест.

Почему нужен отдельный рейтинг для каждой задачи

Сама идея проста. Модели для генерации изображений и видео выходят настолько быстро, что творческая команда может потратить много времени только на выбор между GPT Image от OpenAI, семейством Nano Banana от Google, Seedream и Seedance от ByteDance, Wan от Alibaba, Grok Imagine от xAI и другими системами.

По словам главы отдела роста и операционной деятельности OpenArt AI Стеллы Гуань, компания хочет сделать Arena новым отраслевым стандартом. Когда специалистам понадобится выбрать модель для изображения или видео, они должны будут обращаться к этому рейтингу как к источнику для такого решения.

Сама OpenArt работает именно в условиях большого выбора. Платформа позволяет пользоваться основными сторонними моделями изображений и видео, а также продаёт собственные продукты более высокого уровня. Среди них — Director, разговорный рабочий процесс для создания многосценовых видео в режиме «режиссуры через описание желаемой атмосферы».

Текущий каталог OpenArt включает системы для работы с изображениями, видео, аудио и 3D от разных поставщиков.

Гуань говорит, что корпоративные клиенты постоянно спрашивают компанию, какую модель им выбрать. Для организаций из традиционных отраслей, которые только начинают внедрять генеративный ИИ, этот выбор часто становится первой проблемой.

Создатель под псевдонимом @BLVCKL!GHT рассказал VentureBeat, что выбор зависит от конкретной работы. Зацикленные анимации и динамичные сцены требуют разных инструментов, поэтому для одного проекта он может выбрать Minimax, а для другого — Seedance 2.5. Клиенты часто требуют использовать передовые модели, что тоже влияет на решение, но в итоге практический выбор обычно ограничивает бюджет.

Рейтинги по творческим задачам

OpenArt не стала публиковать один рейтинг для изображений и один для видео. Компания создаёт отдельные доски для конкретных задач и творческих дисциплин.

В них оценивается, насколько хорошо модели изображений и видео справляются с работой в следующих областях:

анимация;
реклама;
графический дизайн;
электронная коммерция;
кино;
моушен-дизайн;
монтаж видео;
липсинк;
общие задачи.

По словам Гуань, для каждой доски используются критерии, соответствующие конкретной работе. В кино важны движение камеры, освещение, кинематографичность и реалистичность кожи. В рекламе больший вес могут иметь читаемый текст, точные логотипы, сходство с продуктом и правильное размещение объектов.

Модель, которая хорошо справляется с одной творческой задачей, не обязательно будет лучшей в другой.

Для бизнеса эта разница особенно важна. Отдел маркетинга может создавать изображения упаковки, внутренняя студия — делать предварительную визуализацию рекламы, а команда постпродакшена — изменять уже снятый материал. Все они могут говорить, что используют ИИ для работы с видео, но требования к модели у них будут разными.

Единый рейтинг, сводящий все задачи к одной оценке, помогает найти универсальные системы. Однако он почти не подсказывает корпоративной команде, какую модель выбрать для конкретного производственного процесса.

OpenArt создаёт результаты для каждой доски на основе отобранных наборов промтов и показывает их оценщикам без названий моделей.

Судьи сравнивают два результата бок о бок, а не выставляют каждому отдельную оценку. Затем OpenArt объединяет предпочтения с помощью статистической модели Брэдли — Терри 1952 года. Она рассчитывает скрытую вероятность победы объекта по его результатам в прямых сравнениях с конкурентами.

В системе оценки участвуют две группы:

Совет творческих экспертов — небольшая группа известных специалистов, среди которых режиссёр анимации, лауреат премии «Эмми» Уильям Лау, креативный технолог Уиллониус «Кинг Уиллониус» Хэтчер, руководитель маркетинга Дэвид Шинг, а также руководители и преподаватели из Edelman и UCLA.
«Лидеры вкуса» — примерно 800–1000 пользователей OpenArt, участников внешних творческих сообществ и работающих специалистов, в том числе из рекламы.

Число от 800 до 1000 обозначает запланированный размер группы, а не подтверждённое количество людей, завершивших оценку при запуске. В материалах, изученных для публикации, OpenArt не указала окончательное число судей, общий объём попарных сравнений и количество промтов в каждом стартовом бенчмарке.

Гуань сообщила, что компания собирается публиковать часть промтов из каждого набора. Старые промты могут появиться после следующих обновлений, но весь действующий набор раскрывать не планируется. По словам Гуань, полная публикация упростила бы подгонку моделей под эти данные.

Для бенчмарка это разумная мера предосторожности: полностью открытый статичный тест со временем может начать измерять не способность модели обобщать знания на новые творческие задачи, а то, насколько хорошо разработчики оптимизируют систему именно под этот тест.

Но закрытые материалы создают другую проблему — прозрачность. Пользователям приходится доверять тому, что неизвестные промты действительно представляют профессиональную работу, а результаты моделей генерируются, отбираются и сравниваются одинаковым образом.

Что показали первые рейтинги OpenArt Arena

Самые заметные результаты запуска относятся к видео.

ByteDance’s Seedance 2.5 — закрытая модель, доступная через API, без опубликованных разработчиком весов — заняла первое место в общем рейтинге видео с результатом 1 081. Далее идут Wan 3.0 от Alibaba с 1 004 баллами и закрытая Seedance 2.0 от ByteDance с результатом 1 000.

Wan 3.0 отличается от остальных уровнем открытости. Alibaba называет её открытой и опубликовала репозиторий под лицензией Apache 2.0. Однако сейчас в репозитории есть документация и лицензия, но нет доступных весов модели. Поэтому Wan 3.0 пока нельзя считать обычным открытым релизом, который можно самостоятельно разместить на своих серверах.

Преимущество Seedance 2.5 сохраняется почти во всех специализированных категориях видео. Из пяти предоставленных для запуска видеодосок модель заняла первое место на четырёх и второе — на одной.

На доске кино Seedance 2.5 получила 1 049 баллов, опередив Seedance 2.0 с 1 000 баллами и Wan 3.0 с 958. В моушен-дизайне она также стала первой с результатом 1 059. Следом расположились Seedance 2.0 с 1 000 и Wan 3.0 с 990.

1 081результат Seedance 2.5 в общем рейтинге видео
1 049результат Seedance 2.5 в категории кино
1 059результат Seedance 2.5 в моушен-дизайне

Исключением стал монтаж видео — хотя разрыв оказался минимальным. Эта категория хорошо показывает, почему, по мнению OpenArt, выбирать модель нужно с учётом конкретной задачи.

Wan 3.0 — первое место, 1 034 балла.
Seedance 2.5 — второе место, 1 033 балла.
Gemini Omni Flash от Google — третье место, 1 021 балл.

Google распространяет Omni Flash как часть семейства моделей Gemini, а не как скачиваемые открытые веса.

В липсинке Seedance 2.5 снова заняла первое место с результатом 1 063. За ней идут Seedance 2.0 с 1 000 и Seedance 2.0 Mini с 994 баллами. Последняя также является размещённой на стороне ByteDance версией, а не открытой моделью.

Таким образом, в стартовых тестах OpenArt Seedance 2.5 выглядит самой сильной универсальной видеомоделью, но она не занимает первое место в каждой специализированной задаче.

OpenArt показывает на досках 95-процентные доверительные интервалы. Это важно при близких результатах. Разница в один балл между Wan 3.0 с результатом 1 034 и Seedance 2.5 с 1 033 в монтаже видео сама по себе не доказывает существование значимого разрыва в качестве.

Популярность Seedance 2.5 заметна и среди создателей ИИ-контента. Зак Лондон, известный как автор научно-фантастических и фэнтезийных видео под именем Gossip Goblin, рассказал VentureBeat, что год назад рынок был более разнообразным: у Hailuo, Kling и Veo были свои достоинства, а для липсинка использовались более узкие инструменты вроде Sync Labs, Hedra и HeyGen. По его словам, теперь Seedance заметно опережает остальные системы, и профессиональные создатели почти не используют другие модели. Hailuo H3, считает Лондон, применяют главным образом для массового спама и автоматизации, тогда как для серьёзной работы остаётся Seedance.

У Лондона также есть полнометражный фильм, созданный с помощью ИИ, — Gods Don’t Give Gifts. Его премьера должна состояться в сотнях кинотеатров позднее в этом году.

Для корпоративных клиентов важнее не одна итоговая оценка, а общая картина:

какие модели регулярно показывают хорошие результаты;
как меняется порядок моделей при смене производственной задачи;
можно ли разместить модель на собственных серверах или придётся зависеть от поставщика либо API.

Рейтинги изображений выглядят более раздробленными: ни одна модель не выиграла все три представленные на старте доски.

GPT Image 2 от OpenAI — закрытая модель, доступная через API OpenAI, а не в виде открытых весов — заняла первое место в графическом дизайне и редактировании изображений. В обеих категориях она получила 1 000 баллов.

В изображениях для кино лидирует Seedream 5.0 Pro с 1 014 баллами. Nano Banana Pro от Google, также закрытая модель, известная как Gemini 3 Pro Image, заняла второе место с 1 000 баллами. GPT Image 2 получила столько же и оказалась третьей.

В категории изображений для электронной коммерции первой стала Seedream 5.0 Pro с 1 004 баллами. GPT Image 2 получила 1 000 и заняла второе место, а Nano Banana 2 от Google, также известная как Gemini 3.1 Flash Image, — третье с 993 баллами.

В общем рейтинге моделей изображений по всем задачам оценщики OpenArt отдали предпочтение Seedream 5.0 Pro. Она получила 1 010 баллов и опередила GPT Image 2 на 10 баллов.

При этом неделю назад OpenAI обновила модель до GPT-Images-2.5, поэтому рейтинг OpenArt придётся пересмотреть.

Среди лидеров запуска различия в открытости моделей довольно заметны. Wan 3.0 — единственная из заметных моделей первой тройки, которую разработчик представляет как открытую. Но её текущая публичная версия пока не содержит весов, необходимых для самостоятельного размещения.

Для корпоративных клиентов это связано не только с лицензией. Открытость влияет на контроль над развёртыванием, хранение данных в определённом регионе, возможности настройки, зависимость от поставщика и потенциальную совокупную стоимость владения.

До публикации окончательных результатов Гуань говорила, что предварительное голосование уже выявило неожиданные случаи. Некоторые модели, от которых OpenArt не ожидала высоких результатов в отдельных задачах, продемонстрировали преимущества именно в этих категориях.

По мнению Гуань, в этом и состоит смысл разделения задач. Если сравнивать модели только в общем рейтинге, отдельные системы могут не стать лучшими в целом, хотя окажутся лучшими для конкретной задачи или по определённому критерию.

Первые итоговые доски частично подтверждают эту идею. Seedance 2.5 выглядит не узкой специализированной системой, а сильной универсальной видеомоделью. При этом первое место Wan 3.0 в монтаже и разные победители в категориях изображений показывают, почему производственным командам может понадобиться распределять задачи между несколькими моделями, а не без проверки выбирать одну.

OpenArt не первой стала публиковать рейтинги по категориям

OpenArt — далеко не единственная компания, которая оценивает ИИ-модели по творческим задачам.

Основные различия между существующими подходами можно представить так:

OpenArt Arena — совет творческих экспертов и более широкая группа «лидеров вкуса»; отдельные задачи в кино, графическом дизайне, электронной коммерции, моушен-дизайне, монтаже и липсинке; отобранные наборы промтов для каждой задачи, слепые попарные сравнения и рейтинги по модели Брэдли — Терри. Сервис наиболее явно организован вокруг конкретных производственных задач сразу для изображений и видео и встроен в коммерческую творческую платформу.
Contra Labs и Human Creativity бенчмарк — работающие творческие специалисты из сети Contra; творческие области и этапы процесса, включая целевые страницы, рекламные изображения, изображения брендов и видео продуктов; отдельная оценка этапов замысла, макета и доработки. Используются слепые попарные сравнения, числовые оценки, качественные комментарии и рейтинги на основе моделей Брэдли — Терри и Эло. Это скорее постоянно развивающаяся исследовательская программа, изучающая, почему результаты меняются на разных этапах и где мнения экспертов совпадают или расходятся.
Arena.ai — категории изображений включают коммерческий дизайн, кинематографичные изображения, портреты, отображение текста, 3D и искусство; видео разделено преимущественно по режимам генерации. Рейтинги строятся на слепых попарных предпочтениях по миллионам реальных промтов, с указанием неопределённости и разброса мест. Основной акцент сделан на масштабе аудитории и естественных пользовательских промтах, поэтому категории изображений уже во многом пересекаются с идеей OpenArt.
Artificial Analysis — задачи в маркетинге, электронной коммерции, игровом кино, анимации, играх, архитектуре, недвижимости, UI/UX, социальных сетях и пользовательском контенте. Видео разделено на текст-видео, изображение-видео, монтаж и варианты с аудио. Используются отобранная таксономия промтов, слепое попарное голосование, рейтинги Брэдли — Терри и Эло, а также данные о цене, скорости и открытости моделей. Это наиболее широкий взгляд на выбор модели, где качество сопоставляется со стоимостью, задержкой и возможностью использовать открытые веса.

Contra Labs

Contra Labs уже проводит оценки генеративных творческих моделей в рамках Human Creativity бенчмарк (HCB). Компания представила этот проект в апреле 2026 года как способ дать профессиональным творческим специалистам возможность оценивать ИИ-системы на реальных рабочих задачах.

Вместо общих технических метрик Contra привлекает работающих специалистов из собственной сети, выдаёт моделям настоящие рабочие задания, скрывает названия систем во время оценки и объединяет попарные сравнения в рейтинги в стиле Эло с помощью модели Брэдли — Терри.

HCB охватывает целевые страницы, приложения для компьютеров, рекламные изображения, изображения брендов и видео продуктов. Работа разделена на стадии замысла, макета и доработки. Такой подход по этапам отличается от более детальных рейтингов OpenArt Arena для кино, моушен-дизайна, монтажа видео и липсинка.

Бенчмарк Contra собирает не только предпочтения победителя и проигравшего. Оценщики отдельно анализируют:

соответствие результата промту;
практическую пригодность;
визуальную привлекательность;
причины своего решения в свободной форме.

Contra также разделяет два типа мнений. «Схождение» означает, что специалисты обычно согласны по поводу читаемости или технической корректности. «Расхождение» показывает, что разные оценки могут быть следствием реальных различий во вкусе и творческом направлении.

Исследования Contra неоднократно показывали: ни одна модель не доминирует на всех этапах творческой работы. Это совпадает с позицией OpenArt, согласно которой лучшая модель зависит от конкретной задачи.

Помимо HCB, Contra Labs ведёт постоянную исследовательскую программу, включающую сравнения моделей, профили и заметки о работе с генерацией изображений, видео, веб-дизайном, типографикой, логотипами, переносом стиля и другими профессиональными задачами.

После выхода новых моделей или изменения структуры оценки компания повторяет исследования в тех же областях. В публикациях она указывает число оценщиков, структуру промтов, объём сравнений и иногда открытые наборы данных.

Это делает Contra одним из наиболее заметных конкурентов OpenArt Arena. Главное отличие связано не столько с методикой, сколько с тем, как устроены продукты.

Contra работает как постоянно обновляемая исследовательская и бенчмаркинговая программа. Она часто анализирует, где и почему меняется результат модели на разных этапах рабочего процесса.

OpenArt запускает Arena как постоянно доступный публичный слой для выбора моделей. В нём есть отдельные доски для конкретных задач с изображениями и видео: кино, электронная коммерция, моушен-дизайн, монтаж и липсинк.

Профессиональная оценка, слепые сравнения и анализ с учётом рабочего процесса не являются уникальными изобретениями OpenArt. Отличие Arena заключается в том, что компания объединяет их в широкую постоянно доступную систему рейтингов по задачам и может показывать эти рейтинги внутри собственной творческой платформы.

Arena.ai

Arena.ai уже предлагает рейтинги изображений по категориям. После анализа большого набора промтов для генерации изображений компания распределила их по направлениям:

Product, Branding & Commercial Design;
Photorealistic & Cinematic Imagery;
Portraits;
Text Rendering;
3D Imaging & Modeling;
Art;
другие области.

По словам Arena.ai, категориальная доска использует ту же методику, что и общий рейтинг, но учитывает только промты, отнесённые к соответствующей области.

Масштаб Arena.ai отличается от отобранной экспертной панели. На доске Product, Branding & Commercial Design для генерации изображений из текста по состоянию на 7 сентября указано более 1,9 млн голосов для 78 моделей.

В рейтинге изображений с редактированием также доступны категории коммерческого дизайна, кинематографичных изображений, портретов, отображения текста и другие задачи.

Создатель автоматизированной студии No Spoon Studios Кири Маргарос, известная в X как @Kyrannio, рассказала VentureBeat, что обычно обращается к Arena, чтобы оценить доступные модели. Затем она внимательнее смотрит на показатели текст-видео, изображение-видео и референс-видео при выборе систем для своих продуктов.

Если рейтинги не используются, Маргарос внедряет новые модели в свой продукт по мере их выхода и сравнивает их с текущим набором инструментов. На решение также влияют цена, скорость и слишком жёсткая модерация. Медленная, дорогая модель, которая блокирует почти всё, может оказаться непрактичной независимо от позиции в рейтинге.

При этом рейтинги помогают быстро понять, какие новые модели близки к лучшему доступному уровню и в каких задачах они сильны, ещё до полноценного подключения через API. Маргарос также использует показатели Arena для планирования развития своего продукта.

Таким образом, сама идея, что профессионалы оценивают результаты, не нова. Не новы и разные рейтинги для разных категорий.

Отличие OpenArt заметнее в сочетании и организации этих подходов. Категории Arena.ai в основном представляют собой группы промтов, собранные по тематике на основе массового использования сообществом. Специализированные рейтинги изображений появляются там после фильтрации голосов по промтам, отнесённым к определённой области.

OpenArt действует в обратном порядке: сначала определяет профессиональную задачу, затем создаёт отдельный тестовый набор и критерии для доски, а после этого просит выбранную группу оценщиков сравнить результаты.

Artificial Analysis

Artificial Analysis — ещё один близкий пример. В случае изображений он ещё сильнее сужает область, которую OpenArt может считать своей особенностью.

Image Arena от Artificial Analysis не ограничивается одним общим рейтингом генерации изображений из текста. Сервис оценивает модели по таксономии реальных задач:

маркетинг и реклама;
розничная торговля и электронная коммерция;
игровое кино;
анимация и игры;
архитектура и недвижимость;
дизайн UI/UX;
социальные сети и пользовательский контент;
другие направления.

Кроме того, есть срезы по отдельным способностям, включая отображение текста, компоновку и анатомию человека.

Artificial Analysis публикует подкатегории, среди которых Commercial, People/Portraits и Text & Typography, и использует отобранные промты, размеченные одновременно по задаче и способности.

Результаты оцениваются через слепое попарное голосование пользователей. Рейтинги рассчитываются с помощью метода максимального правдоподобия Брэдли — Терри, а набор промтов обновляется каждый месяц.

Поэтому сами по себе доски OpenArt для кино и электронной коммерции не представляют совершенно новый тип рейтинга изображений по задачам.

В видео различие заметнее. Artificial Analysis поддерживает отдельные рейтинги Video Arena Elo для генерации текста в видео, изображения в видео и монтажа видео. Для моделей, которые создают синхронизированное аудио, есть дополнительные разделения. Рядом с рейтингами публикуются фильтры по цене и открытости весов.

Однако Artificial Analysis в основном делит видео по режиму генерации или техническому процессу. Это не такие подробные профессиональные категории, как кино, моушен-дизайн, монтаж видео и липсинк в OpenArt.

Таким образом, Artificial Analysis уже во многом пересекается с OpenArt в рейтингах изображений по задачам и напрямую конкурирует с ней в оценке монтажа видео. OpenArt сильнее отличается широтой рейтингов видео по творческим задачам и использованием выбранного совета экспертов вместе с группой профессионалов и «лидеров вкуса», тогда как Artificial Analysis опирается на более широкое краудсорсинговое голосование.

Artificial Analysis также прямо называет себя независимой компанией и заявляет, что не получает от поставщиков моделей плату за включение в рейтинги или выгодные результаты. Это структурно отличает её от OpenArt, которая работает как коммерческая творческая платформа и предоставляет пользователям многие из оцениваемых моделей.

Для руководителя корпоративной творческой команды эти методические различия влияют на то, как использовать рейтинги. Широкая оценка предпочтений сообщества помогает найти модели с общей привлекательностью, а узкий профессиональный бенчмарк может быть полезнее для распределения задач по рабочему процессу.

Но ни один рейтинг не заменяет внутреннее тестирование на собственных брендах, референсах, юридических ограничениях и производственных стандартах компании. Практическая ценность Arena будет зависеть не только от того, какая модель заняла первое место, но и от точности определения каждой доски.

Иными словами, OpenArt не изобрела ни экспертную оценку, ни разделение рейтингов по категориям. Компания пытается объединить в одном месте отобранные тестовые наборы для отдельных профессий, оценку экспертами, более широкую группу судей и постоянно доступные рейтинги изображений и видео.

Кроме того, OpenArt связывает бенчмарк непосредственно с выбором модели внутри коммерческой творческой платформы. Пользователь может перейти от рейтинга к генерации с помощью выбранной модели в той же среде. Это делает Arena практичной, но одновременно создаёт главный вопрос о независимости проекта.

Вопрос независимости

Корпоративным клиентам нужно учитывать ещё одно отличие: OpenArt не является независимой академической организацией, которая проводит бенчмарки. Это коммерческая платформа для создания контента с ИИ, работающая на том же рынке, который оценивает её рейтинг.

OpenArt сообщает, что объединяет более 100 моделей. В текущий каталог входят Seedance, Veo, Kling, Wan, GPT Image, Nano Banana, Seedream и Grok Imagine.

Это не означает, что результаты запуска предвзяты. В опубликованных рейтингах, по-видимому, нет собственной базовой модели OpenArt для генерации изображений или видео.

Но OpenArt продаёт доступ ко многим сравниваемым моделям и строит поверх них такие продукты, как Director. Её видеосервис предлагает пользователям набор базовых моделей в одном рабочем пространстве.

По словам Гуань, Arena также будет отображаться внутри интерфейса выбора моделей OpenArt. Значит, рейтинг сможет влиять на выбор базовой модели клиентом, пока тот остаётся внутри платформы OpenArt.

Это сложнее, чем обычный внешний бенчмарк. У OpenArt есть понятная продуктовая причина помогать пользователям выбирать правильно: клиент, получивший плохой результат из-за неподходящей модели, может обвинить в этом платформу. Но у компании есть и коммерческий интерес стать одновременно местом, где пользователь принимает решение и выполняет работу.

Вывод не в том, что результатам Arena нужно не доверять. Её методику и управление следует проверять так же внимательно, как любой рейтинг, созданный поставщиком и способный повлиять на закупки или распределение рабочих задач.

Поэтому прозрачность и воспроизводимость здесь особенно важны. К запуску OpenArt раскрыла статистический подход, общую стратегию набора участников, имена членов экспертного совета и план публикации части промтов.

Однако компания пока не указала:

количество промтов;
число судей, которые действительно завершили оценивание;
общее число голосов.

Без этих данных сторонние наблюдатели не могут сопоставить масштаб и охват стартовой оценки OpenArt с опубликованными исследованиями Contra или крупными наборами голосов Arena.ai.

На фоне конкурентов этот пробел заметнее. Contra публикует число оценщиков, структуру заданий и общее количество попарных сравнений, продолжая проводить повторные исследования. Arena.ai показывает рядом с рейтингами число голосов и интервалы неопределённости.

Запланированная группа из 800–1000 «лидеров вкуса» выглядит значительной. Но пока OpenArt не сообщит, сколько человек участвовало в конкретной доске, сколько сравнений они провели и сколько промтов увидели, читатели не могут оценить объём данных, лежащих в основе отдельного рейтинга.

Поэтому для корпоративных команд OpenArt Arena должна быть одним из источников при выборе модели, а не окончательным ответом.

Наиболее полезным окажется бенчмарк, похожий на реальные задачи организации:

изображения продуктов с точной упаковкой;
рекламные материалы с типографикой;
кинематографичные сцены с движением камеры;
монтаж, при котором нужно сохранить исходные кадры клиента.

Доски OpenArt для отдельных задач движутся в этом направлении. Компания также планирует добавлять более объективные сведения для бизнеса, включая цену, модерацию контента и характеристики защиты интеллектуальной собственности.

Гуань сообщила, что OpenArt хочет показывать соотношение цены и качества, а не ранжировать модели без учёта бюджета.

Компания называет Arena публичным и «в некоторой степени независимым» от остальной OpenArt проектом. В будущем OpenArt может рассмотреть партнёрства, которые позволят другим платформам использовать или встраивать эти рейтинги. В стартовый запуск такая возможность не входит.

Место OpenArt Arena в корпоративном рабочем процессе

OpenArt Arena появилась в момент, когда закупка творческих ИИ-инструментов превращается в задачу распределения работ. Модель, которая лучше всего создаёт главное изображение кампании, может плохо отображать текст. Лучший генератор кинематографичных сцен не обязательно будет лучшим инструментом для монтажа. А система с самым высоким эстетическим потенциалом может оказаться слишком дорогой для масштабного использования.

Первые результаты Arena дают этой идее конкретные подтверждения. Seedance 2.5 стала заметной моделью стартовых видеодосок OpenArt: она возглавила общий рейтинг, категории кино, моушен-дизайна и липсинка, но уступила лидерство в монтаже видео на один балл.

В изображениях первые места разделили GPT Image 2, победившая в графическом дизайне, и Seedream 5.0 Pro, занявшая первые места в категориях кино и электронной коммерции.

Эти результаты полезнее рассматривать как карту сильных сторон моделей, а не как объявление одного постоянного победителя. Рынок меняется быстро, и, как отмечала Гуань, новая модель может появиться уже через неделю.

Теперь главный вопрос заключается в том, сможет ли OpenArt сделать сам бенчмарк достаточно прозрачным, чтобы творческие команды доверяли предлагаемому распределению задач.

Salesforce: ИИ-агент выполняет 93% браузерных задач вместо 43,5% без изменений модели Anthropic сворачивает Claude Cowork в чат Claude и запускает Claude Docs и Claude Slides Microsoft выпустила новый ИИ-плейбук для бизнеса: неожиданный «ров» уже может быть у вас Трамп создаст «ИИ-силы» для контроля ИИ на фоне страха перед неуправляемыми агентами Anthropic запустила Claude Code Projects — «всегда на связи» помнит и распределяет долгую разработку Австралия почти не подготовилась к угрозам ИИ. Где блестящее руководство, когда нужно? Трамп предлагает дать ИИ новое имя и заявил о создании ИИ-сил Google: Dream-RSI сокращает вызовы агента для поиска до 162 раз, повторяя свои поиски Ответы на ваши вопросы об ИИ-апокалипсисе: «Могут ли такие люди, как я, хоть что-то сделать?» ИИ сокращает цикл разработки чипов до нескольких недель OpenAI против Anthropic: разрыв между платформами ИИ-агентов ИИ: максимизация или оптимизация человеческой когнитивной осознанности Почему инженеры внедрения вдруг оказались так востребованы ИИ может сократить ваши затраты — и всё равно оставить вас позади Google теперь просит пользователей записывать видео-селфи для подтверждения личности Новая ИИ-кормушка Petlibro меняет правила игры в домах с несколькими кошками Unity выпустила плагины для Claude Code и OpenAI Codex, чтобы ИИ-агенты не брали устаревшие уроки Директор Microsoft признал: ИИ крадёт контент СМИ, создавая «петлю гибели» и делая себя бесполезным Разговоры о безопасности ИИ становятся всё более неправдоподобными Qwen3.8-Omni-Flash дешевле Google Gemini Flash, но не уступает в мультимодальных тестах

Ежедневные новости об ИИ

Каждый день отбираем важные новости об ИИ и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.

Только важное — каждый день

В Telegram