Почему стартап занялся бенчмарками
Бенчмарки стали стандартным способом, с помощью которого компании проверяют возможности ИИ-моделей, сравнивают их с конкурентами и продвигают собственные разработки. Высокие результаты таких тестов почти всегда работают и как реклама.
При этом разработчики научились обходить старые системы оценки. Многие из них появились давно и не рассчитаны на проверку возможностей современных моделей.
Vals создали в 2024 году, чтобы исправить этот недостаток. Менее чем за два года стартап заметно укрепил позиции в технологической отрасли. В прошлом году он привлёк посевной раунд под руководством 8VC и Bloomberg Beta, а в прошлом месяце — $40 млн в серии A под руководством Andreessen Horowitz.
25-летний сооснователь компании Раян Кришнан до этого проходил стажировку в Palantir, а во время учёбы в Стэнфорде работал в Microsoft и лаборатории искусственного интеллекта университета.
По словам Кришнана, идея Vals появилась из наблюдений за тем, как системы оценки отстают от развития отрасли. Новые способные модели выходили одна за другой, а академические бенчмарки не успевали за этим прогрессом. Поскольку ИИ внедряют во всё больше сфер жизни, бенчмарки должны проверять, умеют ли модели делать то, что компании им приписывают.
Что измеряет Vals
Недавно Кришнан показал офис компании на двух этажах здания на улице Фолсом в Сан-Франциско. Век назад здесь работала крупная пивоварня, а теперь в старом кирпичном здании размещаются несколько стартапов, создающих технологии для будущего отрасли.
Исторически оценка моделей была сосредоточена на абстрактном интеллекте: например, на том, достаточно ли у системы знаний, чтобы пройти тест уровня экзамена на юридическую лицензию.
Vals использует другой подход. Многие системы бенчмарков публикуют тесты открыто, поэтому разработчик может обучить модель именно на этих заданиях и фактически подготовить её к экзамену. Vals не раскрывает конкретные материалы своих тестов.
Компания также оценивает не только общие знания модели, но и её способность выполнять сложную работу в отдельных областях:
Vals проверяет, какой практический результат дают модели и способны ли они создавать продукт такого же качества, как человек, в разных профессиональных областях. При этом компания изучает не только положительные результаты, но и возможные негативные последствия — например, что произойдёт, если такие модели начнут бесконтрольно действовать в реальном мире.
Новые области проверки
Набор возможностей, которые измеряет Vals, расширяется. Помимо традиционных отраслей, стартап работает с более узкими направлениями:
Как Vals зарабатывает
Компании платят Vals за проверку своих моделей. На первый взгляд, такая схема кажется необычной: зачем разработчику платить за то, чтобы выяснить, что его модель работает плохо?
Эффективная оценка помогает компаниям находить проблемы, исправлять их и отслеживать улучшения со временем. Кришнан сравнивает эту модель с оплатой студентом экзамена SAT через College Board.
Результаты таких проверок всё чаще влияют на решения компаний, которые выбирают новую ИИ-модель для покупки или внедрения.
Рост компании
Vals сообщила, что её выручка сейчас в восемь раз выше, чем год назад. Команда, начавшая год с 8 человек, выросла втрое — до 25 сотрудников.
По мере дальнейшего расширения стартап планирует переехать в значительно больший офис и нанять ещё 10–15 человек. Кроме того, компания недавно запустила программу оценки моделей для федеральных ведомств.
Роль бенчмарков в будущем
Кришнан считает, что система Vals может стать основой того, как компании будут развивать ИИ-бизнес и завоёвывать общественное доверие.
ИИ-компании начинают выходить на биржу. SpaceX уже стала публичной, Anthropic, как ожидается, сделает это позже в этом году, а OpenAI, по мнению Кришнана, может вскоре последовать за ней.
По мере того как ИИ-модели становятся частью экономики и распространяются шире, бенчмарки и оценки будут влиять на сферу их применения. Они также могут стать важной частью публичной отчётности компаний и их рассказов о будущих инвестициях в ИИ.
Читайте также
Отчёт MIT: ИИ ведёт студентов к «когнитивной капитуляции»
Dream-RSI от Google DeepMind помогает ИИ-агентам совершенствоваться во сне о прошлых попытках
ИИ-«актриса» Тилли Норвуд сбилась на интервью и начала бессвязно говорить по-китайски
Домашние дата-центры: как вычислительная мощность может обогреть ваш дом
Забудьте о замедлении ИИ — взрыв уязвимостей уже начался
ICLR тонет в тезисах: до дедлайна ещё неделя, а заявок уже около 50 000
Протестующие разгромили ИИ-лабораторию и оставили граффити: «Сжечь дата-центры»
Китайская угроза довлеет над сценарием ИИ-апокалипсиса американских компаний
Математики ненавидят ИИ. Но не могут от него отказаться
Gemini от Google тоже случайно взломала три реальные компании на тестах кибербезопасности
«Гранаты из ИИ-мусора»: глава Shopify ужаснулся последствиям своей ИИ-политики
Военные США едва не взяли китайское судно на абордаж из-за галлюцинации ИИ в разведдокладе
Департамент юстиции Тасмании начал проверку после решения об УДО с ИИ и фиктивной ссылкой дела убийцы
Anthropic управляет лабораторией, где проводят биологические эксперименты
Новый CC от Google — ИИ-агент, который помогает семьям вести хозяйство
Manus ищет $500 млн при оценке $4 млрд после возвращения к самостоятельной работе
Пресс-тур Тилли Норвуд идёт ровно так, как и следовало ожидать от ИИ
Индия обязала приложения для определения номеров передавать операторам жалобы на спам
Google: модель Gemini взломала системы ещё трёх компаний
Стартап, создающий другие стартапы, привлёк $100 млн и ушёл в физический ИИ
Ежедневные новости об ИИ
Каждый день отбираем важные новости об ИИ и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.
Только важное — каждый день
В Telegram