GLM-5.3-Flash сравнялась с передовыми моделями и работает без Nvidia
Z.ai выпустила GLM-5.3-Flash — первую изначально мультимодальную модель серии GLM-5. Она содержит 320 млрд параметров, из которых активны 18 млрд, работает с контекстом до 1 млн токенов, распространяется по лицензии MIT и доступна с открытыми весами на Hugging Face. На максимальном уровне рассуждения модель набрала 57 баллов в индексе интеллекта, сравнявшись с GPT-5.6 Terra и Muse Spark 1.2, но стоит примерно в 7,5 раза дешевле GLM-5.3. По данным Z.ai, модель также работает на китайских ИИ-чипах без Nvidia.
Цена и показатели
GLM-5.3-Flash стала первой изначально мультимодальной моделью в серии GLM-5, сообщила Z.ai. Всего в ней 320 млрд параметров, но в работе участвуют только 18 млрд. Модель получила контекстное окно на 1 млн токенов, лицензию MIT и открытые веса, опубликованные на Hugging Face.
По измерениям Artificial Analysis, при максимальном уровне рассуждения модель набирает 57 баллов в индексе интеллекта. Это на 3 балла меньше, чем у более крупной GLM-5.3, получившей 60 баллов. Такой же результат показали GPT-5.6 Terra и Muse Spark 1.2.
Главное отличие — стоимость выполнения задач. В индексе одна задача для GLM-5.3-Flash обходится в $0,09 против $0,68 для GLM-5.3 — примерно в 7,5 раза дешевле. Artificial Analysis относит модель к эффективному сочетанию интеллекта и цены. GLM-5.3-Flash также пополнила список китайских моделей, которые усиливают ценовое давление на западных поставщиков.
В рейтинге Intelligence Index GLM-5.3-Flash набирает 57 баллов и оказывается в наиболее привлекательном квадранте по соотношению стоимости и интеллекта
Источник: the-decoder.com
В API Z.ai миллион входных токенов стоит $0,15, а миллион выходных — $0,50. Это немного больше 10% от цены GLM-5.3.
На задачах с ИИ-агентами модель не отстаёт от старшей версии. В GDPval-AA v2 она получила около 1770 баллов Эло — столько же, сколько GLM-5.3 и Grok 4.6. Выше результат только у Claude Opus 5. При этом GLM-5.3-Flash менее эффективно расходует токены: Artificial Analysis выяснила, что около 90% использованных выходных токенов уходило на рассуждение.
Тест до запуска
До официального запуска Z.ai анонимно тестировала модель под названием «ox-alpha» в OpenCode и OpenRouter. За неделю она стала самой популярной моделью на этих площадках.
По данным Z.ai, весь этот поток запросов обрабатывался на китайских ИИ-чипах.
SemiAnalysis сообщает, что модель обслуживала 100 трлн токенов в день. Ранее считалось, что такой объём доступен только передовым ИИ-лабораториям. Z.ai утверждает, что эффективность её оборудования и стоимость обработки токена сопоставимы с распространёнными GPU Nvidia.
SemiAnalysis рассматривает это как ещё одну проверку преимущества CUDA после недавних результатов нового чипа OpenAI.
Как работает CUDA
CUDA — это программный слой Nvidia между ПО для ИИ и графическим процессором. Он развивается почти 20 лет, поэтому практически каждый инструмент для ИИ оптимизирован под эту систему.
Переход на другие чипы требует заново выполнять эту работу: переписывать вычислительные операции, настраивать доступ к памяти и искать узкие места.
Z.ai создала собственное ПО для обслуживания моделей поверх SGLang и разделила обработку на этапы, которые можно масштабировать независимо. По словам команды, это втрое увеличило пропускную способность по сравнению с первой попыткой на том же оборудовании. В оптимизации помогал ИИ-агент на базе GLM-5.3.
Ежедневные новости об ИИ
Каждый день отбираем важные новости об ИИ, роботах и метавселенных и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.
Только важное — каждый день
В Telegram