i
ДАТАИСТ
Новости · 2026-08-28

GLM-5.3-Flash: топовый уровень без Nvidia

Z.ai выпустила GLM-5.3-Flash — первую изначально мультимодальную модель серии GLM-5. Она содержит 320 млрд параметров, из которых активны 18 млрд, работает с контекстом до 1 млн токенов, распространяется по лицензии MIT и доступна с открытыми весами на Hugging Face. На максимальном уровне рассуждения модель набрала 57 баллов в индексе интеллекта, сравнявшись с GPT-5.6 Terra и Muse Spark 1.2, но стоит примерно в 7,5 раза дешевле GLM-5.3. По данным Z.ai, модель также работает на китайских ИИ-чипах без Nvidia.

Обложка: GLM-5.3-Flash: топовый уровень без Nvidia

GLM-5.3-Flash сравнялась с передовыми моделями и работает без Nvidia

Z.ai выпустила GLM-5.3-Flash — первую изначально мультимодальную модель серии GLM-5. Она содержит 320 млрд параметров, из которых активны 18 млрд, работает с контекстом до 1 млн токенов, распространяется по лицензии MIT и доступна с открытыми весами на Hugging Face. На максимальном уровне рассуждения модель набрала 57 баллов в индексе интеллекта, сравнявшись с GPT-5.6 Terra и Muse Spark 1.2, но стоит примерно в 7,5 раза дешевле GLM-5.3. По данным Z.ai, модель также работает на китайских ИИ-чипах без Nvidia.

Цена и показатели

GLM-5.3-Flash стала первой изначально мультимодальной моделью в серии GLM-5, сообщила Z.ai. Всего в ней 320 млрд параметров, но в работе участвуют только 18 млрд. Модель получила контекстное окно на 1 млн токенов, лицензию MIT и открытые веса, опубликованные на Hugging Face.

По измерениям Artificial Analysis, при максимальном уровне рассуждения модель набирает 57 баллов в индексе интеллекта. Это на 3 балла меньше, чем у более крупной GLM-5.3, получившей 60 баллов. Такой же результат показали GPT-5.6 Terra и Muse Spark 1.2.

Главное отличие — стоимость выполнения задач. В индексе одна задача для GLM-5.3-Flash обходится в $0,09 против $0,68 для GLM-5.3 — примерно в 7,5 раза дешевле. Artificial Analysis относит модель к эффективному сочетанию интеллекта и цены. GLM-5.3-Flash также пополнила список китайских моделей, которые усиливают ценовое давление на западных поставщиков.

В рейтинге Intelligence Index GLM-5.3-Flash набирает 57 баллов и оказывается в наиболее привлекательном квадранте по соотношению стоимости и интеллекта

Источник: the-decoder.com

57баллов в индексе интеллекта
$0,09стоимость задачи
7,5 разадешевле GLM-5.3
100 трлнтокенов в день

В API Z.ai миллион входных токенов стоит $0,15, а миллион выходных — $0,50. Это немного больше 10% от цены GLM-5.3.

На задачах с ИИ-агентами модель не отстаёт от старшей версии. В GDPval-AA v2 она получила около 1770 баллов Эло — столько же, сколько GLM-5.3 и Grok 4.6. Выше результат только у Claude Opus 5. При этом GLM-5.3-Flash менее эффективно расходует токены: Artificial Analysis выяснила, что около 90% использованных выходных токенов уходило на рассуждение.

Тест до запуска

До официального запуска Z.ai анонимно тестировала модель под названием «ox-alpha» в OpenCode и OpenRouter. За неделю она стала самой популярной моделью на этих площадках.

По данным Z.ai, весь этот поток запросов обрабатывался на китайских ИИ-чипах.

SemiAnalysis сообщает, что модель обслуживала 100 трлн токенов в день. Ранее считалось, что такой объём доступен только передовым ИИ-лабораториям. Z.ai утверждает, что эффективность её оборудования и стоимость обработки токена сопоставимы с распространёнными GPU Nvidia.

SemiAnalysis рассматривает это как ещё одну проверку преимущества CUDA после недавних результатов нового чипа OpenAI.

Как работает CUDA

CUDA — это программный слой Nvidia между ПО для ИИ и графическим процессором. Он развивается почти 20 лет, поэтому практически каждый инструмент для ИИ оптимизирован под эту систему.

Переход на другие чипы требует заново выполнять эту работу: переписывать вычислительные операции, настраивать доступ к памяти и искать узкие места.

Z.ai создала собственное ПО для обслуживания моделей поверх SGLang и разделила обработку на этапы, которые можно масштабировать независимо. По словам команды, это втрое увеличило пропускную способность по сравнению с первой попыткой на том же оборудовании. В оптимизации помогал ИИ-агент на базе GLM-5.3.

Ежедневные новости об ИИ

Каждый день отбираем важные новости об ИИ, роботах и метавселенных и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.

Только важное — каждый день

В Telegram