i
ДАТАИСТ
К ленте

Оценка и бенчмарки

Как измеряют качество моделей и почему бенчмарки регулярно врут.

30 материалов

Meta: Muse Spark 1.3 — передовой уровень, но лучшая версия пока недоступна разработчикам

Meta представила Muse Spark 1.3 — новую модель, которая заметно опередила Muse Spark 1.2 на независимых бенчмарках, особенно в долгих задачах с ИИ-агентами. Версия xhigh, доступная разработчикам сейчас, вошла в число лидеров по соотношению цены и возможностей. Однако лучшие результаты Meta получила в конфигурации max: она ещё проходит проверку безопасности, не доступна через API и пока существует только в ограниченном предварительном тестировании. При прежней цене токенов Muse Spark 1.3 стала экономичнее в собственных сценариях программирования, но в более широких агентных задачах средняя стоимость выполнения выросла.

HydraFusion от GitHub снижает расходы, но уступает в качестве

Microsoft в пятницу представила HydraFusion — исследовательский режим для Copilot CLI, который в реальном времени распределяет задачи по программированию между несколькими моделями. В лучшем тесте система снизила расчётную стоимость на 67% по сравнению с Claude Opus 5, но качество уровня передовых моделей показала только в одном из трёх бенчмарков. HydraFusion уже доступна разработчикам на всех тарифах Copilot через флаг /experimental, а запросы оплачиваются по стандартным тарифам задействованных моделей. GitHub называет систему способом выбирать не только подходящую модель, но и схему выполнения задачи.

Бенчмарки спорят о GPT-6 Astra, но ARC-AGI-3 сдвигает прогноз Шолле по AGI

Новая модель OpenAI GPT-6 Astra получила противоположные оценки на разных бенчмарках. Epoch ИИ поставила её на первое место среди 267 моделей с результатом 169 баллов, тогда как Artificial Analysis дала Astra 61 балл — столько же, сколько предшественнице, — и поставила ниже Claude Fable 5.1 с 66 баллами. Главный результат пришёлся на ARC-AGI-3: Astra впервые прошла игровые задачи эффективнее среднего человека, набрав 62,7% против 7,78% у GPT-5.6 Sol и 30,16% у Claude Opus 5. Франсуа Шолле, руководитель ARC Prize, считает, что модель появилась примерно вдвое раньше ожидаемого и из-за ускорения прогресса сдвинул прогноз AGI на более ранний срок.

GPT-6 Astra — первая модель, с которой OpenAI готова объявить «эру AGI»

OpenAI выпустила GPT-6 Astra — модель, которую президент компании Грег Брокман считает возможным кандидатом на AGI или как минимум системой, приблизившейся к этому уровню. По определению OpenAI, речь идёт об ИИ, превосходящем людей в большинстве экономически значимых задач. Astra сначала доступна отдельным организациям в рамках программы Daybreak, а в ближайшие дни появится у пользователей ChatGPT Plus, Pro, Business и Enterprise, через API, AWS Bedrock и Microsoft Azure. В бенчмарках модель заметно опередила GPT-5.6 Sol и Fable, а её стоимость на некоторых задачах оказалась ниже.

Abliteration.ai строит бизнес на снятии защитных ограничений с ИИ

Компания Abliteration.ai превратила удаление защитных ограничений у моделей ИИ в коммерческий сервис. Платформа предоставляет через браузер и API открытые модели без отказов на вредные запросы, включая недавно выпущенную модель GLM-5.3 от Z.ai. Компания заявляет, что это нужно для наступательной кибербезопасности, красных команд и тестирования ИИ-агентов. Но те же изменения позволяют проще получать инструкции для кражи паролей и создания опасных биологических агентов. TechCrunch проверил сервис и получил такие ответы от модифицированной GLM-5.3.

Новая погодная ИИ-модель Google: забыть зонт больше не оправдание

Google DeepMind и Google Research выпустили WeatherNext 3 — новую модель ИИ для прогнозирования погоды. Она точнее отслеживает изменения в атмосфере, строит прогнозы с разрешением до 5 км, улучшила оценку дождя на 60% по сравнению с WeatherNext 2 и формирует данные каждый час вместо одного раза в шесть часов. Google планирует использовать модель в погодной информации Поиска, Google Maps и Gemini, а также открыть её пользователям и исследователям через облачные платформы. На бенчмарке Operational WeatherBench WeatherNext 3 обошла другие модели ИИ и традиционные прогнозы.

Российские математики научили ИИ-модели общаться друг с другом без слов

Российские математики из стартапа Mostik разработали способ связывать ИИ-модели напрямую — через математические значения в их весах, без передачи текстовых ответов. Так способности крупной модели можно передавать компактной и заметно дешевле повышать её возможности. Метод помог создать систему, стремительно поднявшуюся на вершину сложного бенчмарка ARC-AGI 3. Для демонстрации Mostik также объединила китайские открытые модели: GLM-5.2 на 753 млрд параметров и Qwen-3.5 на 4 млрд параметров, способную работать на смартфоне. Гибрид стоит в 20 раз дешевле полной версии GLM, а его результат оказался ровно посередине между показателями двух исходных моделей.

Gemini 3.8 Flash — третья бюджетная модель Google за шесть недель, а передовые всё ещё не вышли

Google представила Gemini 3.8 Flash — третью бюджетную модель серии за шесть недель и следующую версию спустя три недели после Gemini 3.7 Flash. Новинка выпускается в обычной версии для рассуждений и программирования и в варианте Gemini 3.8 Flash Cyber для кибербезопасности. В бенчмарке DeepSWE v1.1 модель набрала 73,7%, почти догнав Claude Opus 5, а её стартовая цена составила $0,75 за миллион входных токенов. При этом Google по-прежнему не выпустила передовые Gemini 3.5 Pro и Gemini 4.

Hugging Face представила @huggingface/kernels: более 200 WebGPU-ядер для локального ИИ

Hugging Face выпустила библиотеку @huggingface/kernels для загрузки и запуска оптимизированных ядер WebGPU из Hugging Face Hub. Вместе с ней опубликована начальная коллекция из 207 ядер для операций машинного обучения. Каждое ядро оформлено как отдельный версионируемый пакет с интерфейсом, шаблонами шейдеров, тестами корректности, бенчмарками и инструкциями по использованию. Одновременно компания представила Fleet — набор браузерных тестов, который проверяет и оценивает производительность ядер на оборудовании пользователей.

TimesFM-3: базовая модель для многомерного прогнозирования без дообучения

Google Research представила TimesFM-3 — модель временных рядов с 330 млн параметров, которая умеет без дополнительного обучения одновременно прогнозировать несколько связанных показателей. Её обучили на корпусе из более чем 1 трлн реальных и синтетических временных точек. На бенчмарках Gift-Eval, FEV-Bench и Time TimesFM-3 заняла первое место среди предварительно обученных моделей по точности обычных и вероятностных прогнозов. Модель доступна на GitHub и Hugging Face, а интеграцию с BigQuery обещают добавить в ближайшие недели.

Как оценивать универсальные политики роботов перед применением в реальном мире

Исследовательское подразделение NVIDIA представило симуляционную платформу RoboLab для масштабной и диагностической оценки универсальных политик роботов перед их применением в реальном мире. Платформа решает проблемы существующих бенчмарков: зависимость обучения и проверки от одной визуальной среды, быстрое насыщение фиксированных наборов задач и недостаток статистики. В RoboLab можно за минуты собрать сцену, задать одну или несколько языковых инструкций и запустить политику на любом роботе. Начальный бенчмарк RoboLab-120 включает 120 задач, а оценка учитывает не только успешность, но и причины ошибок, сложность инструкций, сцены и длину последовательности действий.

Nvidia обходит AMD до пяти раз в новом тесте ИИ-агентов

SemiAnalysis выпустила AgentX — открытый бенчмарк, который воспроизводит реальные сессии агентов для программирования. На производительных системах для инференса Nvidia оказалась до пяти раз эффективнее AMD по стоимости, а в отдельных конфигурациях на открытых программных средах — до 20 раз. AgentX проверяет не фиксированные запросы, а длинные многотуровые сессии с большим контекстом: медианный вход составляет 142 000 токенов, выход — 444 токена, а между ходами есть паузы. Разрыв объясняют программным обеспечением Nvidia: управлением кешем, маршрутизацией и пошаговой токенизацией. Данные собраны из анонимизированных сессий Claude Code.

MIT предупреждает: ИИ уже выполняет почти любые задания бакалавриата — вуз обдумывает реформу образования

MIT рассматривает полную перестройку образовательной системы после того, как специальная комиссия университета пришла к выводу: современные модели ИИ способны правдоподобно выполнять почти любые задания бакалаврской программы — от эссе и математических задач до научных доказательств и задач по программированию. В отчёте также говорится, что менее чем за три года ИИ уже изменил университетскую жизнь: студенты реже посещают консультации преподавателей, участвуют в сетевых обсуждениях и собираются для совместной учёбы. На этом фоне другие университеты ужесточают правила: Чикагский университет запретил телефоны и ноутбуки на занятиях для первокурсников юридической школы, а Принстон отказался от более чем вековой традиции сдавать экзамены без наблюдения.

Как выбрать правильный процесс для автоматизации

Автоматизировать всё сразу невозможно — и не нужно. Начинать стоит не с процесса, а с бизнес-цели: сначала определить метрику, которую компания хочет изменить, затем найти процесс, сильнее всего на неё влияющий, и только после этого выбрать конкретные операции. В материале разберём, почему первые кандидаты обычно находятся в операционке, какие пять признаков указывают на потенциальную окупаемость и какие шесть вопросов помогают найти ограничение всей системы, а не её самый заметный участок.

Бизнес как система процессов: как потоки данных создают ценность

Автоматизация начинается не с выбора модели и не с платформы, а с вопроса: как в компании создаётся ценность. Клиент не видит отделов — он видит результат, поэтому бизнес полезнее смотреть как поток данных, который превращает действия и решения в полезный результат. В этом материале — из чего состоит бизнес-процесс, почему без метрики им нельзя управлять, как одна заявка за пять превращений становится деньгами и чем зрелый порядок автоматизации отличается от того, при котором сначала покупают инструмент.

AgentOps: шесть шагов от идеи до работающего ИИ-агента

Пилот доказывает только одно — агент в принципе работает. AgentOps отвечает на другой вопрос: как довести его до промышленной эксплуатации и не растерять эффект по дороге. Шесть шагов — зафиксировать метрику и описать процесс, собрать агента, подключить его к живым системам, обучить на собственных данных, доказать эффект A/B-тестом и поставить на мониторинг, который сам запускает следующий круг улучшений.

Почему код стал операционной системой для агентов

Вокруг LLM уже сложился почти привычный сюжет: модель пишет код, чинит ошибки, вызывает инструменты, иногда даже проходит бенчмарки уровня хорошего стажёра. ИИ пишет код, чинит ошибки, вызывает инструменты, иногда даже проходит бенчмарки уровня хорошего стажёра. Но обзор Code as Agent Harness предлагает куда более интересный поворот. Авторы…

Разработка игр стала новым бенчмарком для ИИ-агентов

Мы привыкли мерить прогресс AI-агентов по задачам вроде исправления багов в GitHub-репозиториях, написания Python-скриптов или фронтенда по макету. Но реальная разработка — особенно игровая — устроена куда грязнее и интереснее. Здесь мало просто сгенерировать функцию: нужно понимать сцены, иерархии объектов, спрайты, шейдеры, анимации, интерфейсы…

Атомарные навыки: как улучшить агентов для программирования на 18.7%

Авторы статьи предлагают перестать тренировать ИИ-агентов только на комплексных задачах и вместо этого учить их атомарным навыкам — небольшим, проверяемым строительным блокам разработки. У ИИ-агентов для программирования: модели неплохо приспобаливаются к бенчмаркам, но стоит чуть изменить постановку задачи — и ничего не работает. Агент умеет…

Всё, что нужно знать об обучении агентов простыми словами

Как обучение с подкреплением (RL) используется не только для «хорошего ответа», а для устойчивого поведения в динамических условиях. Ещё недавно обучение с подкреплением для LLM выглядело так: модели показывают промт, она выдаёт один ответ, и этот ответ «оценивают» — людьми или автоматическими метриками. Это отлично работает для подстройки стиля…

Почему ИИ-агенты хорошо чинят баги, но плохо доводят продукт до релиза

За последний год агенты для программирования заметно прибавили: они умеют находить место поломки, править код и прогонять тесты. Но есть важная оговорка: большинство популярных бенчмарков проверяют точечные достижения — исправление конкретного бага или добавление небольшой фичи в рамках одного…

Сможет ли ИИ пройти сложный экзамен по финансовому анализу?

Экзамены CFA (Chartered Financial Analyst) в мире финансов — это марафон с тремя дистанциями. На первом уровне проверяют базовые знания и умение не путаться в терминах. На втором — заставляют разбирать кейсы, где важно применять формулы и логику в контексте. На третьем — ждут уже не просто…

Как ИИ-агенты решают задачи международной олимпиады по математике

В последние пару лет большие рассуждающие модели (LRM) заметно подтянулись в олимпиадной математике. На задачах уровня AIME (Американский Инновационный Математический Экзамен) им часто хватает одного длинного «прогона» рассуждений: модель пишет цепочку мыслей, проверяет ответ, иногда делает пару…

Как ИИ-агенты живут в "Станции" и делают научные открытия

Большинство сегодняшних подходов к «научному ИИ» выглядят как понятный пайплайн. Есть центральный управляющий алгоритм, есть метрика, есть короткий цикл: сгенерируй улучшение, запусти тест, выбери лучшее, повтори. В целом это работает, но одновременно убирает то, что делает науку наукой: долгую…

ИИ в белом халате: как он учится ставить диагнозы в виртуальной клинике

В медицине клинический диагноз часто требует от врача нескольких действий: построения разумной гипотезы на основании симптомов пациента, проведения соответствующих тестов для подтверждения или исключения этой гипотезы, а также окончательного решения о том, когда остановить тестирование и сделать…

Почему ИИ-агенты теряются в море MCP-серверов

Исследователи из Microsoft предложили новый бенчмарк для агентов, которые решают задачи не через браузер, а напрямую вызывают инструменты по протоколу MCP. Они собрали более 18 тысяч инструментов из Azure, GitLab, RocketChat, Plane и ownCloud, сопроводили каждую задачу правильным набором нужных…

Когда тесты пишутся сами: как ИИ превращает текст в рабочие сценарии тестирования

Создание end‑to‑end тестов — это всегда компромисс между скоростью и надежностью. Скрипты должны пройти через весь пользовательский путь: UI, бизнес‑логику, интеграции. Ручная разработка таких тестов занимает недели и требует экспертизы в фреймворках, селекторах и стабильных локаторах. Большие…

Что, если новые бенчмарки для ИИ станут появляться сами по себе?

Когда мы говорим о проверке возможностей ИИ в инженерии машинного обучения, чаще всего всплывают статичные бенчмарки: однажды собранные организаторами конкурсы, единый датасет, фиксированная метрика. Это удобно, но плохо масштабируется. Каждую задачу приходится долго выверять, приводить к общему…

Почему ИИ в программировании спотыкается в реальной работе: новый бенчмарк показал всю правду

За последние пару лет агенты на базе больших языковых моделей уверенно вошли в повседневную разработку: умеют читать репозитории, чинить баги, предлагать патчи и гонять тесты. На классическом SWE-Bench-Verified топовые системы уверенно берут более 70% задач с первой попытки. Проблема в том, что…

Что скрыто за характером LLM: читаем поведенческие отпечатки

Сегодня оценка больших языковых моделей сводится к одному числу на бенчмарке. Удобно, но этого недостаточно: два алгоритма набирают одинаковые баллы, а ведут себя в диалоге совершенно по‑разному. Исследователи предлагают посмотреть глубже — снять «поведенческий отпечаток» модели по нескольким…