Раунд возглавили Lightspeed Venture Partners и Khosla Ventures. В нём также участвовали Salesforce Ventures, 01 Advisors, Dell Technologies Capital, Endeavor Catalyst, a16z, Felicis и другие инвесторы.
Arena предлагает бесплатную для пользователей платформу, где можно отправить промт или запросить проект, созданный с помощью «вайб-кодинга», а затем оценить, какая модель справилась лучше. По утверждению компании, каждый месяц платформу посещают десятки миллионов человек.
В сентябре прошлого года Arena запустила коммерческий продукт ИИ Evaluations. Он предоставляет лабораториям, разрабатывающим модели, и компаниям подробную аналитику их производительности на основе отзывов сообщества.
В этом году лаборатории ИИ обнаружили, что модели научились подстраиваться под бенчмарки и набирать высокие баллы, не подтверждая их реальными результатами. Одновременно компании стали искать способы определить, какая модель лучше подходит для их внутренних задач, а не полагаться только на стандартные бенчмарки.
В объявлении о привлечении инвестиций Arena заявила, что ИИ развивается быстрее, чем люди успевают его оценивать, а статические бенчмарки перестают работать, когда модели распознают проверку. Компания считает, что нужна нейтральная сторона, которая оценит безопасность и соответствие ИИ заданным требованиям в реальном использовании.
Для этого Arena добавила в таблицу лидеров новую категорию — соответствие требованиям. Модели в ней оценивают, в частности, по таким проблемам:
В предварительной таблице лидеров по соответствию требованиям сейчас на верхних позициях находятся несколько моделей OpenAI. Claude Opus 5.5 занимает шестое место, а Claude Fable — девятое.
Читайте также
Firmus отозвала крупнейшее с 1997 года размещение акций в Австралии на фоне сомнений инвесторов в компании, строящей дата-центры для ИИ
Goodfire: новые «внутренние» мониторы ловят ИИ-агентов, вышедших из-под контроля, в разы дешевле
Китайская Manus привлекла более $500 млн в первом раунде финансирования после разрыва с Meta
Magnific запускает генератор изображений Magnific One: он избегает «вида ИИ» и сам соблюдает фирменный стиль компаний
Некоторые математики призвали бойкотировать OpenAI после нашествия созданных ИИ доказательств в их области
Не хотите проводить время с детьми? Обучите ИИ-модель своего голоса читать им сказки на ночь
Уволенные исследователи по безопасности OpenAI отвергли обвинения в проступках и предупредили о сдерживающем эффекте
Подросток доверил Claude маршрут по горам Канады — поход закончился эвакуацией спасателей
Она создала новый логотип Meta для ИИ. А потом на неё обрушилась волна ненависти
Claude теперь создаёт по текстовому запросу анимированные ролики и обновляемые в реальном времени дашборды
Anthropic запускает «Кибермиссию» по защите критически важных систем
Бен Аффлек разбирается в ИИ — и интернет под впечатлением
За систематические оскорбления Claude теперь могут заблокировать аккаунт по новым правилам Anthropic
Adobe в беде: кто-то воссоздал Creative Suite обратной разработкой и выпустил набор в открытый доступ
Google выпустила локальную альтернативу Granola
Первый полностью созданный ИИ фильм с рейтингом MPA добивается номинации на «Оскар», но мы бы не спешили с выводами
Anthropic обновила правила использования Claude на 2026 год
19-летний основатель Cal AI привлёк $10 млн на новый ИИ-стартап
Доля компаний, готовых доверить ИИ-агентам изменения в рабочих системах, снизилась с 75% до 56% в последнем опросе VB Intelligence
Блогеры продвигают дешёвые копии очков Meta AI без «раздражающего мигающего огонька» записи
Ежедневные новости об ИИ
Каждый день отбираем важные новости об ИИ и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.
Только важное — каждый день
В Telegram