Как ИИ-соавтор для математиков решает открытые задачи
Большинство сегодняшних математических ИИ-систем умеют впечатлять в режиме «вот задача — вот ответ». Но настоящая математика так не работает. Она живёт в черновиках, тупиках, сомнениях, странных догадках, полуверных леммах и внезапно найденной статье двадцатилетней давности, которая меняет всё. Именно в эту неаккуратную, человеческую часть исследования и пытается зайти работа Google об ИИ-соавторе-математике — не как о ещё одной LLM, а как о целой рабочей среде с агентами, памятью, ветками исследования и встроенной привычкой сомневаться.
Когда ИИ перестаёт быть калькулятором и становится коллегой
Это и делает статью важной. Она не просто показывает, что модель стала лучше решать олимпиадные задачки. Она предлагает другой взгляд: возможно, следующий скачок в ИИ для науки — это не «ещё сильнее рассуждать в одном ответе», а лучше организовывать долгую исследовательскую работу. То есть быть не оракулом, а партнёром.
Что вообще сделали авторы
Авторы представляют систему, которую называют «ИИ-соавтором-математиком». По сути, это специальный рабочий стол для исследователя, где над одной задачей могут параллельно трудиться несколько агентов. В центре — координатор проекта, который общается с пользователем, уточняет постановку задачи, создаёт цели и раздаёт подзадачи отдельным рабочим потокам. Те, в свою очередь, могут заниматься поиском литературы, вычислительными экспериментами, написанием кода, черновыми доказательствами и сборкой итогового текста.
Ключевая идея здесь не в том, что одна LLM вдруг научилась «по-настоящему понимать математику». И не в том, что авторы обучили какую-то новую специализированную модель. Напротив: система построена поверх стандартных коммерчески доступных моделей семейства Gemini и делает ставку на архитектуру взаимодействия — как именно агентам поручают работу, как сохраняется состояние проекта, как фиксируются ошибки и как человек может вмешаться в процесс.
Это важный поворот. В последние годы ИИ в математике развивался в нескольких направлениях: одни системы пытались автономно решать задачи, другие — делать формальные доказательства, третьи — искать алгоритмы эволюционным перебором. Но в обычной жизни математик редко сидит в одном интерфейсе и не задаёт работу в формате «докажи теорему от начала до конца». Ему нужно одновременно искать статьи, запускать вычисления, проверять гипотезы и переписывать постановку. Авторы статьи честно говорят: именно эта оркестровка до сих пор оставалась слабым местом.
Почему чат-бота для математики недостаточно
Если коротко: потому что чат слишком быстро забывает, а исследование — нет.
Авторы очень точно описывают повседневность математика как процесс, где важно не только находить работающие ходы, но и помнить неработающие. Обычный интерфейс чата плохо приспособлен к этому. Он линейный, эфемерный и заставляет пользователя самому быть «клеем» между литературным поиском, вычислениями, кодом и доказательствами.
Новая система пытается решить это несколькими принципами.
Во-первых, она поддерживает итеративное уточнение замысла. Пользователь не обязан с первого сообщения сформулировать идеальный запрос. Сначала идёт диалог, в котором координатор проекта помогает превратить смутную идею в исследовательский вопрос и набор целей.
Во-вторых, система производит не просто ответы в чате, а естественные для математика артефакты: живой рабочий текст, наброски, заметки на полях, ссылки на источники, черновые выкладки, код и результаты проверок. Это важная деталь устройства: вместо красивого, но одноразового ответа — разворачивающийся документ, который можно читать, редактировать и проверять.
В-третьих, она устроена асинхронно. Пока один агент копается в статьях, другой может писать библиотеку на Python, третий — пытаться собрать доказательство. Пользователь при этом не ждёт в режиме «модель думает», а видит частичный прогресс и может подруливать процесс в любой момент.
Наконец, система специально заточена на работу с неопределённостью. Для математики это критично: одна галлюцинация в ссылке или одна дырка в лемме могут обрушить всю конструкцию. Поэтому здесь не прячут сомнения, а наоборот, стараются их маркировать, отслеживать и выносить на поверхность.
Как выглядит работа системы на практике
Самая содержательная часть статьи — не таблицы, а сценарий реальной сессии. Авторы разбирают пример с вариантом задачи о «движущемся диване» — известной задачи из вычислительной геометрии о том, какую фигуру максимальной площади можно пронести через прямой угол.
Сначала пользователь загружает свежую статью и пишет, что хочет проверить верхние оценки для одного из вариантов задачи. Координатор проекта не начинает немедленно «доказывать». Он уточняет: на каком именно варианте сфокусироваться, какой тип результата нужен, какие цели считать успехом. После нескольких реплик пользователь утверждает формулировку проекта.
Дальше система делит работу на параллельные потоки. Например, один поток делает обзор литературы, другой строит вычислительный каркас, третий запускается позже и использует написанную библиотеку для масштабного перебора.
Здесь особенно заметна сила подхода. Вместо единственного монолитного «рассуждения» система ведёт себя почти как небольшая исследовательская группа: один ищет, что уже известно; другой строит инструменты; третий использует эти инструменты в вычислительном поиске.
Авторы отдельно подчёркивают, что в нынешнем прототипе специализированные агенты в основном опираются на обычные вызовы LLM, а не на какие-то магические новые модули. Но архитектура оставляет естественные точки подключения для более сильных систем — например, формальных проверяющих или инструментов эволюционного поиска.
Самое интересное: система умеет не скрывать провал
Одна из лучших идей статьи — отношение к неудаче. Большинство ИИ-агентов сегодня устроены так, будто провал надо замести под ковёр: перезапустить, переформулировать, сделать вид, что всё под контролем. Здесь логика другая. Если рабочий поток застрял, это не исчезает. Неудавшаяся гипотеза сохраняется как часть истории проекта.
Это не косметика, а фундаментальная штука. В математике знание о том, что не сработало, часто не менее ценно, чем знание о том, что сработало. Авторы прямо закладывают это в систему: тупики становятся первоклассными объектами, на которые потом можно опираться.
Ещё один важный слой — жёсткие программные ограничения. Если агент пишет код, он не может объявить работу завершённой, пока тесты не проходят, а отдельный проверяющий агент не одобрит результат. Если доказательство не выдерживает проверки, отчёт не получает статус завершённого. Это попытка защититься от самого неприятного свойства LLM — преждевременной уверенности.
И всё же система не полностью автономна. И это, пожалуй, честное достоинство статьи. Когда один из вычислительных подходов упирается во взрыв пространства поиска, координатор прямо пишет пользователю: текущая стратегия неэффективна, подскажите, нет ли у вас математической интуиции для лучшего отсечения вариантов. То есть человек здесь не «надзиратель для красоты», а реальный участник контура управления.
Что показали ранние тесты с математиками
Авторы дают системе ограниченный доступ нескольким профессиональным математикам и описывают несколько кейсов. Это не строгая массовая оценка, но для понимания потенциала — очень показательно.
В одном случае математик Марк Лакенби использовал систему для исследования открытого вопроса из «Тетради Куровки». Система создала два потока: один пытался доказать утверждение, другой — опровергнуть. Особенно примечательно, что сначала она выдала доказательство, которое сама же потом пометила как неверное после внутренней проверки. Но в этом неудачном черновике исследователь увидел сильную стратегию, а в замечании проверяющего — подсказку, как закрыть пробел. В итоге совместными усилиями получился корректный результат.
Это очень нетривиальный сигнал. Польза ИИ здесь не в том, что он «сам решил задачу», а в том, что он сгенерировал ценный промежуточный объект: неидеальное, но плодотворное направление мысли.
Другие кейсы показывают похожий паттерн: система помогает искать литературу, строить вычислительные подтверждения, выделять ключевые леммы, быстрее доходить до тупиков и, что важно, оформлять всё это в удобный для проверки вид. Не все пользователи остались одинаково довольны, и авторы этого не скрывают. Но даже из описанных историй видно, что сильная сторона системы — ускорение исследовательского цикла, а не обязательная полная автоматизация.
Результаты на бенчмарках: впечатляют, но с оговорками
Хотя статья много говорит о том, что одних бенчмарков недостаточно, без них сегодня никуда. Авторы оценивают систему в специальном режиме, где ей запрещено получать дополнительный ввод после исходной задачи, а в конце нужно выдать один финальный ответ. Это, по сути, попытка втиснуть интерактивный исследовательский инструмент в формат обычного теста.
На внутреннем наборе из 100 исследовательских задач с автоматически проверяемыми ответами система заметно опережает и Gemini 3.1 Pro, и Gemini 3.1 Deep Think при одиночном вызове.
Ещё громче звучит результат на FrontierMath Tier 4 — одном из самых тяжёлых математических бенчмарков. Система решила 23 задачи из 48, то есть показала 48% точности и тем самым установила новый рекорд среди протестированных ИИ-систем. Для сравнения, базовая Gemini 3.1 Pro, на которой всё это построено, набирала 19%.
Это серьёзный скачок. Но авторы не пытаются выдать его за бесплатный подарок. Они честно признают: такая система тратит больше вычислений, чем обычный одиночный прогон модели. У неё нет жёсткого лимита на число вызовов и токенов, а значит, прирост качества частично куплен ценой более тяжёлого инференса. И это важно помнить, когда сравнивают «систему из агентов» с «одной моделью в лоб».
Ограничения: здесь статья особенно взрослая
Самая сильная черта текста — он не скрывает неприятные режимы поведения.
Первый риск — ложный консенсус. В многошаговом цикле «автор — проверяющий» может появиться аргумент, который всё ещё неверен, но уже научился проходить проверки текущих агентов. То есть система может не приблизиться к истине, а просто адаптироваться под вкус своего внутреннего рецензента.
Второй риск — бесконечные циклы несогласия. Когда агенты не могут прийти к согласию, рабочий поток застревает в бесконечной редактуре и начинает деградировать в галлюцинации. Авторы прямо используют почти бытовой термин вроде «смертельной спирали», и это хорошо передаёт природу проблемы.
Третий риск — интерфейсный. Красиво свёрстанный математический текст очень легко принять за строгий результат. Но LLM отлично имитируют форму, не гарантируя содержания. Поэтому даже аккуратный LaTeX-документ нельзя автоматически считать надёжным. Авторы признают, что сообществу ещё только предстоит придумать новые нормы представления, проверки и рецензирования таких материалов.
Наконец, есть системный риск: если такие инструменты станут массовыми, математическая литература может утонуть в потоке правдоподобных, но неглубоких или слабо проверенных текстов. ИИ умеет быстро генерировать «видимость исследования», а вот человеческое внимание на проверку по-прежнему ограничено.
Почему эта работа важна для ИИ вообще, а не только для математики
Хотя статья посвящена математике, её главный тезис гораздо шире. Она показывает, что следующий этап развития ИИ-инструментов, вероятно, будет определяться не только мощностью модели, но и качеством рабочей среды вокруг неё: памятью, разбиением задач, проверками, сохранением истории, понятным взаимодействием с человеком.
Это очень похоже на то, что уже происходит в разработке программного обеспечения, где агент для программирования полезен не потому, что «лучше всех пишет одну функцию», а потому, что умеет жить внутри длинного процесса: читать кодовую базу, запускать тесты, предлагать правки, исправлять ошибки, вести состояние проекта. Авторы буквально переносят эту логику в математику — и получают заметный выигрыш.
Вывод
Статья об ИИ-соавторе-математике — это не просто отчёт о сильной модели и не просто демонстрация очередного рекорда на FrontierMath. Это, скорее, манифест: если мы хотим ускорять науку, ИИ должен уметь работать не только с ответами, но и с исследовательским процессом.
Работа убеждает сразу на двух уровнях. На практическом — система уже помогает реальным математикам искать идеи, обходить тупики, поднимать литературу и иногда даже доводить дело до решения открытых задач. На концептуальном — она показывает, что архитектура взаимодействия, память и управление неопределённостью могут быть не менее важны, чем «сырая» сила рассуждения модели.
Конечно, до полноценного надёжного коллеги ещё далеко. Слишком много риска в ложной уверенности, слишком велика цена проверки, слишком хрупки циклы внутренней рецензии. Но в одном смысле эта работа уже попала в цель: она делает ИИ в математике менее похожим на экзаменационного решателя и более похожим на реального исследовательского партнёра. А это, возможно, и есть самый важный сдвиг.
ИИ-обзоры статей
Каждый день читаем свежие статьи по ИИ и пересказываем главное человеческим языком — без хайпа и воды. Если хотите понимать, куда движутся ИИ-агенты раньше остальных, — подписывайтесь.
Новые обзоры — каждый день
В Telegram