Сможет ли ИИ пройти сложный экзамен по финансовому анализу?

Экзамены CFA (Chartered Financial Analyst) в мире финансов — это марафон с тремя дистанциями. На первом уровне проверяют базовые знания и умение не путаться в терминах. На втором — заставляют разбирать кейсы, где важно применять формулы и логику в контексте. На третьем — ждут уже не просто правильных вычислений, а связного профессионального решения: как собрать портфель, как оценить риск, что делать в неоднозначной ситуации и где проходит этическая граница.
Ещё недавно большие языковые модели (LLM) на таких экзаменах выглядели неубедительно: могли блеснуть фактами, но «сыпались» на прикладных задачах и особенно на вопросах, где нужно рассуждать. Авторы работы Reasoning Models Ace the CFA Exams показывают, что эта картина стремительно меняется. Современные рассуждающие модели неожиданно уверенно проходят все три уровня — и делают это на большом наборе пробных экзаменов.

Почему CFA — такой показательный стресс‑тест для ИИ
Финансовые экзамены хороши тем, что в них смешано всё сразу. Нужно считать, сравнивать, интерпретировать текст, помнить определения, замечать нюансы, а иногда — выбирать «наименее неправильный» вариант в этической дилемме. Это ближе к реальной работе аналитика, чем к стандартным «вопрос–ответным» задачам. Поэтому CFA давно стали удобным ориентиром: если модель проходит их стабильно, значит прогресс в рассуждениях не косметический.
Но тут есть важная деталь: старые исследования часто опирались на устаревшие наборы вопросов. В CFA программы обновляются, меняются акценты, появляются новые форматы. Авторы новой работы стараются избежать этой ловушки и собирают датасет на актуальных материалах.
Из чего собрали проверку и как оценивали
Для эксперимента авторы берут 980 вопросов из нескольких пробных экзаменов: три версии Уровень I, две версии Уровня II и три версии Уровня III. Источники — официальный CFA Institute Practice Pack (для Уровней I–II) и AnalystPrep (для Уровня III). Такой выбор важен: меньше шанс, что модель просто «видела» эти задания раньше, и выше вероятность, что мы правда измеряем способность рассуждать, а не вспоминать.
Проверяют две стратегии ответа. Первая — без объяснений, только финальный вариант. Вторая — с просьбой рассуждать шаг за шагом (chain-of-thought). Для тестовых вопросов всё считается просто: процент правильных ответов. Для развернутых заданий Уровень III используется автоматический оценщик на базе o4-mini: он сравнивает ответ модели с эталоном и рубрикой. Авторы честно отмечают риск перекоса: такие оценщики иногда «любят» более подробные ответы и могут недонаказать за тонкие ошибки.
Что получилось
Главная интрига работы — сравнение поколений. Старые модели и правда часто не проходили уровни, особенно второй и третий. Но почти все современные рассуждающие модели проходят все три уровня.
Среди лидеров по суммарной эффективности авторы выделяют Gemini 3.0 Pro, Gemini 2.5 Pro, GPT-5, Grok 4, Claude Opus 4.1 и DeepSeek-V3.1. Самые яркие цифры выглядят почти невероятно для экзамена такого класса: Gemini 3.0 Pro набирает 97.6% на Уровне I, а лучший результат на Уровне II показывает GPT-5 — 94.3%.
Любопытное наблюдение: chain-of-thought помогает старым моделям ощутимо, но у сильных рассуждающих моделей эффект неоднозначен. Иногда точность на тестах даже немного падает, зато на развернутых ответах рассуждающий режим чаще улучшает качество.
Где модели всё ещё ошибаются — и почему это важно
Авторы приводят примеры типичных ошибок. И они хорошо показывают, что даже при высокой итоговой точности слабые места остаются «человеческими»: неверная интерпретация условий, путаница в близких утверждениях, неправильное применение правил, упрощения или банальная ошибка в расчётах.


Отдельно подчёркивается, что этика остаётся одной из самых сложных областей. Это логично: такие задания часто завязаны на контекст и тонкие различия формулировок, а не на формулы.
Что это меняет и к чему авторы призывают дальше
Работа задаёт новый ориентир: теперь «может ли LLM пройти CFA?» — скорее да, по крайней мере в формате пробных тестов. Но авторы не предлагают делать из этого вывод «ИИ стал уже финансовым аналитиком». Наоборот, они аккуратно фиксируют ограничения: Уровень III взят не из официального источника, а развернутые ответы оценивает автоматический судья.
Если переводить это на практический смысл, то CFA становится не столько экзаменом «на знание», сколько инструментом тонкой диагностики: где модель рассуждает, где угадывает, где красиво пишет, но ошибается по сути. Следующий шаг — более строгие проверки с участием людей-экзаменаторов.
ИИ-обзоры статей
Каждый день читаем свежие статьи по ИИ и пересказываем главное человеческим языком — без хайпа и воды. Если хотите понимать, куда движутся ИИ-агенты раньше остальных, — подписывайтесь.
Новые обзоры — каждый день.
В Telegram