Nvidia обошла AMD в бенчмарке ИИ-агентов до пяти раз
SemiAnalysis опубликовала AgentX 24 августа. Бенчмарк воспроизводит реальные сессии агентов для программирования на производительных программных комплексах для инференса, а не короткие запросы фиксированной длины, которые используют многие сравнения.
На GLM 5.3, запущенной через открытый SGLang, оборудование Nvidia показало до пятикратного преимущества AMD по эффективности затрат при скорости 150 выходных токенов в секунду на пользователя. По расчётам компании, даже если конкурирующие ускорители предоставить бесплатно, итоговая стоимость токена всё равно окажется выше после учёта размещения и электроэнергии.
Этот результат относится к одной конфигурации и не описывает соотношение сил на всём рынке. В опубликованном сравнении B200 с MI355X на той же модели преимущество менялось вместе с интерактивностью: около 57% при 108 токенах в секунду на пользователя и 247% при 141 токене.
SemiAnalysis считает, что длинные многотуровые сессии ИИ-агентов уже занимают основную часть производительного потока запросов к системам инференса. Если это так, покупатели, которые два года ждали появления второго поставщика для снижения цен Nvidia, видят расширение разрыва именно в важных для них сценариях.
Что такое AgentX
AgentX — средство воспроизведения записей работы агентов, а не генератор запросов. SemiAnalysis установила промежуточный сервер, перехватывающий запросы сотрудников к Claude Code и Codex, и собрала корпус более чем из 8 000 сессий объёмом 610 млрд токенов. В открытую версию 1.0 вошли 393 сессии Claude Code. Данные выпущены по лицензии Apache 2.0.
Исходное содержимое преобразуют в связанные блоки с хешами размером 64 токена, привязанные к отдельной сессии. Такой формат сохраняет связи между префиксами, от которых зависит повторное использование кеша, но удаляет оригинальные запросы и код.
Структура трафика и формирует основную особенность теста. Медианная длина входа составляет 142 000 токенов, а медианный выход — 444 токена. Между ходами агент в среднем ждёт инструмент 3,84 секунды. В 175 из 393 сессий создаётся как минимум один субагент.
Обычный бенчмарк с фиксированной последовательностью — например, 8 000 входных и 1 000 выходных токенов — ничего из этого не проверяет.
Откуда берётся разрыв
Сессия ИИ-агента показывает, сохранилось ли повторно используемое состояние ключей и значений в памяти с высокой пропускной способностью или на уровне выгрузки. Затем она проверяет, может ли серверная система направить следующий ход туда, где это состояние находится.
Особенно заметно это по работе кеша. На DeepSeek V4 при 384 параллельных сессиях SemiAnalysis получила 91% попаданий в память с высокой пропускной способностью и ещё 1,36% — в оперативную память хоста. Тест запускался на конфигурации B300 с 3 ТБ DRAM и декодированием с параллелизмом экспертов в восемь потоков, использовался vLLM.
На B200 с тем же движком, но при параллелизме 196 вместо 384, показатель упал до 73%, а ещё 20% пришлось компенсировать памятью хоста. По данным SemiAnalysis, при росте числа пользователей такая зависимость от выгрузки резко увеличивает задержку.
Второй источник преимущества — токенизация. В TensorRT-LLM от Nvidia добавили пошаговую токенизацию с учётом границ: если разговор повторно отправляет всю историю, системе больше не нужно токенизировать её целиком. На трассе Qwen 3.5 этот режим совпал с полной токенизацией на всех 1 087 проверенных переходах, а среднее время обработки одного хода сократилось со 185,1 до 11,3 миллисекунды.
Бенчмарк фиксированной длины такой выигрыш не покажет: в нём нет предыдущего хода, который можно повторно использовать.
Что показывает AMD
AMD продолжает развивать свои решения, и AgentX отмечает несколько случаев, где они дают результат. Движок ATOM опережает стойку GB300 NVL72 с vLLM по соотношению цены и производительности на части кривой Kimi K3 — в диапазоне задержки от 40 до 60 секунд.
На DeepSeek V4 система MI355X с SGLang не уступала B200 с vLLM, пока 21 августа оптимизации от Inferact и Nvidia не вошли в основную ветку. При этом B300 с vLLM и B200 с SGLang опережали этот результат ещё до указанной даты.
Разница в том, где именно применяются эти улучшения. По данным SemiAnalysis, ATOM почти не используют в производстве — за пределами одного рекламного подразделения Alibaba. Основная команда Qwen также не работает с этим движком. Поэтому для заказчиков более показательным сравнением компания считает штатный vLLM.
На одинаковых открытых программных средах разрыв увеличивается. При запуске Qwen 3.5 через SGLang на обеих платформах Nvidia опережает AMD более чем в 20 раз при скорости 90 токенов в секунду на пользователя. SemiAnalysis также указывает, что в таблице поддержки функций vLLM нет серверных компонентов AMD для параллелизма контекста — стратегии, на которую чаще всего опираются длинные контексты.
Значительная часть преимущества Nvidia теперь находится на уровне программного обеспечения. AgentX связывает его с ядрами вычислений, управлением кешем, маршрутизацией и планированием — эти компоненты обновляются быстрее, чем успевает смениться технологический производственный цикл.
Переворот результатов 21 августа показывает, почему отдельный замер нельзя считать постоянным. Если рейтинг меняется за неделю после обновлений основной ветки, он отражает скорость развития программного обеспечения не меньше, чем возможности оборудования. SemiAnalysis уже запланировала обновление AgentX в течение месяца.
Ограничения AgentX
При чтении графиков нужно учитывать ещё несколько условий. При воспроизведении анонимизированные блоки с хешами заполняют синтетическими токенами. Это искажает принятие токенов при спекулятивном декодировании, поэтому SemiAnalysis не измеряет этот показатель в реальном времени, а фиксирует длину принятия по SPEED-Bench.
Кроме того, трассы получены из инструментов для программирования, которые добавляют большой объём контекста. Более простой инструмент дал бы другое распределение входных данных.
AgentX работает в замкнутом цикле: более быстрая конфигурация успевает обработать больше запросов и получает немного иной состав нагрузки. Сильнее всего это влияет при низком параллелизме.
SemiAnalysis отдельно называет сторонниками более широкой инициативы InferenceX компании Meta, Microsoft, Oracle, OpenAI и несколько китайских лабораторий, а также отмечает вклад инженеров Nvidia и AMD. Это не означает, что перечисленные компании поддерживают какое-либо конкретное сравнение.
Google TPU пока отсутствуют в матрице. Поколение Rubin от Nvidia выйдет позднее в августе, а TPU и MI455X от AMD ожидаются позднее в 2026 году. Поэтому текущий результат сравнивает Blackwell с CDNA 4 и не охватывает более новые платформы.
Что проверять покупателям
Покупателям стоит запросить у поставщика показатель попаданий в префиксный кеш при производственном параллелизме и объём памяти хоста, который приходится на каждый ускоритель. По оценке SemiAnalysis, сквозная выгрузка в DRAM хоста лучше всего работает, когда ёмкость этого уровня в 1,5–3 раза превышает объём кеша с высокой пропускной способностью.
Второй параметр — маршрутизация сессий. Нужно выяснить, закрепляет ли поставщик сессию за рабочим узлом, где хранится её префикс, или распределяет нагрузку между узлами, заставляя систему заново обрабатывать префикс на каждом ходу.
Оба показателя можно требовать как измеряемые обязательства, а не соглашаться на одну цифру токенов в секунду, которая ничего не говорит о 40-м ходу сессии. Это рекомендация, а не результат бенчмарка. Команды, отвечающие за платформу, также могут прогонять собственный трафик через опубликованный набор инструментов.
Для AMD путь к сокращению разрыва лежит в программном обеспечении, а не в выпуске более быстрого чипа. Если компания перенесёт больше наработок ATOM в vLLM и SGLang и улучшит параллелизм длинного контекста и механизмы выгрузки, значительную часть текущего отставания, согласно AgentX, можно будет устранить. Бенчмарк не показывает, насколько быстро это произойдёт.
В конфигурациях с высокой интерактивностью и на нескольких распространённых открытых программных средах Nvidia сейчас заметно опережает AMD. Это преимущество сохраняется не для каждой модели, движка и точки на кривой производительности. Для предприятий, операторов неооблаков и команд, которые поддерживают такие движки, воспроизводимый бенчмарк на собственном трафике даёт больше информации, чем слайд поставщика.
Ежедневные новости об ИИ
Каждый день отбираем важные новости об ИИ, роботах и метавселенных и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.
Только важное — каждый день
В Telegram