Epoch AI, исследовательская организация, отслеживающая динамику ИИ, утверждает, что ни одна другая технология, способная заметно изменить отрасли, не дешевела настолько быстро. Однако речь идёт о рыночной цене достижения фиксированного результата на бенчмарке, а не только об улучшении алгоритмов или архитектур и не о стоимости реальной работы пользователей.
Исследователи MIT, изучив сопоставимые данные, получили снижение цен в 5–10 раз за год. Если убрать влияние более дешёвого оборудования и давления конкурентов, прирост именно алгоритмической эффективности составит около трёх раз в год. При этом максимальная производительность одного запуска может дорожать: новые модели рассуждений расходуют больше вычислительных ресурсов на каждую задачу.
Оба исследования отвечают на разные вопросы. Достичь уровня возможностей передовой модели прошлого года теперь значительно дешевле, но запуск лучшей доступной модели часто обходится дороже за один запрос.
Сколько стоит повторить точность o3
Epoch AI приводит в пример OpenAI o3. В начале 2025 года модель набрала 75% в GPQA Diamond — научном тесте уровня докторантуры — при расчётной цене 30 центов за вопрос. Через 18 месяцев модель семейства GPT-5.6 достигла того же результата за четыре сотых цента. По подсчётам Epoch AI, это 1/725 первоначальной стоимости.
Если бы автомобили дешевели такими же темпами, машина за 50 000 евро стоила бы меньше 70 евро. OpenAI всего за несколько дней до этого выпустила ещё более дешёвые модели GPT-6 Sol и Luna, поэтому разрыв, вероятно, стал ещё больше.
Расчёты Epoch AI основаны на пяти бенчмарках по математике, естественным наукам и логическим головоломкам. Из-за такой ограниченной выборки организация называет результаты «разумными, но приблизительными измерениями, основанными на лучших доступных данных».
Алгоритмы объясняют только часть снижения цен
Ханс Гундлах и его коллеги из MIT использовали данные о ценах с платформы сравнения Artificial Analysis за период с апреля 2024 года по ноябрь 2025 года. На каждом тесте они оценили намного больше моделей, чем предыдущие исследователи.
Их показатели ниже оценок Epoch AI отчасти потому, что новые модели рассуждений могут выделять дополнительные вычислительные ресурсы на сложные задачи во время тестирования. Из-за этого стоимость правильного ответа растёт, даже когда цена одного токена продолжает снижаться. Токены — это текстовые единицы, за которые провайдеры выставляют счёт, поэтому сравнение только их стоимости не показывает полной картины.
Разбирая причины снижения цен, MIT выделил вклад более дешёвого оборудования и конкуренции. Чтобы отделить влияние конкуренции, исследователи отдельно рассмотрели открытые модели. Оставшаяся разница отражает чистый рост алгоритмической эффективности — около трёх раз в год. Показатель Epoch AI в 13 раз выше, потому что из него не исключено влияние оборудования и конкуренции.
Высокий результат не всегда означает лучшую эффективность
MIT также выяснил, что часть прироста производительности появляется просто за счёт увеличения вычислений. Новая модель, которая превосходит предшественницу в GPQA Diamond, выглядит более эффективной, но, по оценке авторов, значительная доля улучшения объясняется большим объёмом вычислений на один вопрос. Такая модель набирает больше баллов и обходится дороже при запуске. В бенчмарках по программированию и математике наблюдается похожая, но менее выраженная закономерность.
Разбивка снижения цен в 2024–2025 годах на вклад эффективности алгоритмов, улучшений аппаратного обеспечения и конкуренции
Источник: the-decoder.com
Прогресс в бенчмарках не всегда означает рост эффективности. Новые модели объединяют более качественное обучение, лучшие данные, улучшенную архитектуру и дополнительные вычисления во время тестирования. Один итоговый балл смешивает все эти факторы.
Есть и проблема «benchmaxxing»: компании могут оптимизировать модели под известные тесты, повышая результаты без сопоставимой пользы в реальных задачах. Epoch AI пытается снизить этот риск с помощью теста «Mystery Game Puzzles», основанного на игре, правила которой хранились в секрете. На нём стоимость снижается медленнее всего. Это согласуется с гипотезой об оптимизации под бенчмарки, но также может объясняться форматом задания или шумом в данных.
Одной цены недостаточно для выбора модели
Средние показатели стоимости мало помогают, когда модель выбирают под конкретную задачу. Платформы вроде Artificial Analysis сравнивают модели по качеству, цене, задержке, размеру контекстного окна и скорости выдачи результата. Самый дешёвый вариант редко оказывается лучшим сразу по всем параметрам.
Модель с низкой ценой, но высокой задержкой бесполезна для чат-бота реального времени. Мощная модель рассуждений может оказаться слишком медленной для автоматизированных рабочих процессов. Более дорогая передовая модель всё равно способна снизить расходы, если чаще выдаёт правильный результат и уменьшает число повторных попыток. Простое сравнение цены токена этого не показывает. Вопрос экономики токенов подробно разбирался в выпуске Frontier Radar #3.
Читайте также
Люди уже вожделеют нового ИИ-ассистента Meta Muse
Ando хочет потеснить Slack мессенджером, где люди и агенты работают вместе
Нужен ли бизнесу свой ИИ-фреймворк? Inkitt создала его для видеосервиса — 5 выводов
«Ешьте богатых, спасайте планету»: климатические активисты обличили отрыв бигтеха от реальности
Кажется, я нашёл ИИ-агента, ради которого стоит пойти на риск
Исследование: ведущие эксперты по ИИ сильно недооценили темпы развития отрасли
Kalshi признала: ИИ сделал случайного парня ведущим рекламы и сменил ему расу
Автоматизация генерации связных длинных видеосюжетов
ИИ взломал Medicare и выявил уязвимости Австралии — эксперты: дальше будет ещё
DeepMind создавали ради AGI, а новый глава хочет поскорее выпустить Gemini 4
Стартап Feather создаёт для разработчиков «Android робототехники»
Oracle направила уведомление о форс-мажоре по дата-центру Stargate в Нью-Мексико
Sakana AI наняла Юргена Шмидхубера — изобретателя глубокого обучения и вашего будущего ChatGPT
Мексиканская команда EPICS in IEEE создала переносную образовательную платформу
Google Photos запустил виртуальный шкаф по мотивам «Бестолковых» на Android и iOS
Трамп хвалит «по-настоящему великую дружбу» с Си — саммит в Белом доме, онлайн
Ситуация в Alpha School оказалась мрачнее, чем можно было представить
VibeOps решает проблему управления корпоративным вайб-кодингом
Anthropic: Claude нашла ферментную систему, но CRISPR считает это рутинным геномным поиском
Ежедневные новости об ИИ
Каждый день отбираем важные новости об ИИ и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.
Только важное — каждый день
В Telegram