i
ДАТАИСТ
Новости · 2026-09-10

OpenAI: GPT-6 Astra даёт математикам передышку — так задумано

@neuronium_ai @neuronium_ai

GPT-6 Astra от OpenAI заняла первое место в ErdosBench — бенчмарке со 226 открытыми математическими задачами. Модель набрала 3,23 балла, решила 106 задач, из них 43 полностью, и опровергла ещё 27 утверждений. При этом главный научный сотрудник OpenAI Якуб Пахоцки говорит, что компания специально не оптимизировала Astra для математических исследований. Результат показывает: прогресс моделей растёт прежде всего в тех областях, на которые направлены усилия разработчиков, а одновременно улучшать все способности пока не получается.

Обложка: OpenAI: GPT-6 Astra даёт математикам передышку — так задумано

После выхода Astra математики могут ненадолго перевести дух — вероятно, ненадолго. Новая модель действительно продвигает математические исследования, но не с той скоростью, на которую одни надеялись, а другие опасались.

На ErdosBench от ulam.ai Astra заняла первое место. Бенчмарк включает 226 открытых математических задач, созданных по мотивам известных задач Эрдёша. Модель набрала 3,23 балла, решила 106 задач, причём 43 — полностью, и опровергла ещё 27.

226открытых задач
106решены Astra
43решены полностью
27опровергнуты

По сравнению с Sol, которая в режиме максимального рассуждения решила 78 задач, Astra лучше пишет научные тексты и реже делает чрезмерно громкие заявления. В некоторых случаях она, напротив, преуменьшала собственные результаты. Разработчик бенчмарка Пшемек Хоецки оценил прирост в разных проверенных навыках математического исследования в 5–10 процентов, но добавил, что бенчмарк ещё далёк от насыщения.

GPT-6 Astra возглавляет ErdosBench с результатом 3,23 и 106 решёнными задачами; за ним следуют GPT-5.6 Sol с результатом 3,12 и 78 решёнными задачами

GPT-6 Astra возглавляет ErdosBench с результатом 3,23 и 106 решёнными задачами; за ним следуют GPT-5.6 Sol с результатом 3,12 и 78 решёнными задачами

Источник: the-decoder.com

OpenAI не оптимизировала Astra для математики

OpenAI могла сделать Astra заметно сильнее в математических исследованиях, но решила этого не делать, хотя в первом анонсе компании математические достижения были вынесены на первый план. В эссе «Чужой разум» главный научный сотрудник OpenAI Якуб Пахоцки пишет, что компания считает возможным улучшить модели именно в математических исследованиях за счёт дополнительного внимания к этому направлению, но не ставит его в приоритет из-за срочности задач, связанных с RSI и автоматизированными исследованиями безопасности ИИ.

Получается, что самая способная на данный момент математическая модель появилась не в результате целевой оптимизации. Она стала побочным результатом других приоритетов. OpenAI направляет ресурсы на рекурсивное самоулучшение и защиту будущих систем ИИ: по словам Пахоцки, это единственный способ сохранять лидерство на переднем крае исследований ИИ. После публикации эссе появились сообщения, что OpenAI обучила более сильные внутренние математические модели, но ситуация остаётся сложной, а темы RSI и безопасности ИИ за это время резко расширились.

Заявление Пахоцки важно и по другой причине: оно показывает, что на переднем крае разработки ИИ приходится выбирать между направлениями. Модель, которая доминирует в математике, не обязательно будет лучшей во всём остальном. Это напоминает визуализацию исследователя Кембриджского университета Адама Ханта, где сопоставлены два возможных пути развития ИИ. Согласно гипотезе «мейнстримного AGI», модели постепенно и широко улучшаются, пока не начинают справляться со всеми задачами человека.

Альтернативный сценарий предполагает всё более «пиковую» траекторию: модель получает исключительные способности в нескольких областях, например в программировании и математике, но перестаёт улучшаться или даже теряет позиции в качестве языка, здравом смысле и социальном рассуждении. В результате появляется узкоспециализированная система, а не то, что большинство людей назвало бы общим искусственным интеллектом. При желании AGI можно назвать что угодно.

Два пути развития ИИ: постепенное, широкое улучшение (вверху) по сравнению с экстремальной специализацией при стагнирующих базовых возможностях (внизу)

Два пути развития ИИ: постепенное, широкое улучшение (вверху) по сравнению с экстремальной специализацией при стагнирующих базовых возможностях (внизу)

Источник: the-decoder.com

То, что OpenAI сознательно отказалась от оптимизации Astra в математике, подтверждает сценарий «пиковой» траектории. Даже ведущая лаборатория ИИ не может одновременно добиться максимального прогресса во всех направлениях. Способности растут там, где идёт оптимизация, а усиление математики требует сокращать усилия в других областях. Приоритет RSI связан с надеждой, что в будущем модель сама начнёт выполнять такие оптимизации и быстрее расширять свои способности, в том числе в математике.

Математика сталкивается с ИИ и собой

Независимо от того, насколько Astra лучше предшественницы — на 5 или на 50 процентов, — для математики остаётся более глубокий вопрос. Область сталкивается с вычислительными возможностями, которые помогают решать задачи, но не обязательно помогают их понимать. Математик Теренс Тао поднял эту тему на Международном конгрессе математиков 2026 года: если модели продолжат создавать доказательства быстрее, чем люди смогут их проверять, математика рискует перейти от нехватки доказательств к их избытку.

Тогда главной задачей станет уже не решение проблем, а определение того, какие результаты действительно важны. Тао считает, что математика столкнулась с кризисом собственных ценностей и практик, сравнимым с потрясениями в основаниях науки в начале XX века.

Пока самые сложные математические задачи остаются нерешёнными, и это даёт области дополнительное время. Направление развития уже обозначилось, хотя некоторые математики не считают, что языковые модели способны совершать настоящие прорывы из-за отсутствия человеческой креативности. По схожим причинам сохраняются сомнения и в способности ИИ к настоящему самоулучшению.

Ежедневные новости об ИИ

Каждый день отбираем важные новости об ИИ и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.

Только важное — каждый день

В Telegram