i
ДАТАИСТ
Обзор · 2026-08-09

Почему лучший ИИ собрал ответ из разных данных с точностью лишь 66%

Обложка: Почему лучший ИИ собрал ответ из разных данных с точностью лишь 66%

Когда ИИ-агенту мало одной таблицы

Представьте обычный рабочий запрос: посчитать риск фонда, найти нужные записи по акциям или собрать медицинскую сводку. В жизни ответ редко лежит в одной чистой таблице. Что-то спрятано в SQLite, что-то — в длинном PDF, часть условий диктор проговаривает в видео, а вопрос вообще может быть на другом языке. Для человека это уже неприятная рутина. Для ИИ-агента — частый провал.

DataSpace — новый бенчмарк для ИИ-агентов, которые должны работать с разнородным рабочим пространством, а не с игрушечной задачей «сделай один SQL-запрос». Авторы собрали 410 задач, 7439 файлов, около 15 ГБ данных и заставили агента решать задачу целиком: найти нужные источники, вытащить факты, сопоставить сущности, посчитать метрики и вернуть готовую таблицу.

Ключевой результат: даже лучшие современные системы пока далеки от уверенной работы в таком режиме. Максимальная точность — 66,34%. То есть лучший участник ошибается примерно в каждой третьей задаче.

Это важно, если вы строите ИИ-агентов для аналитики, внутренних данных компании, финансовых сценариев или автоматизации дата-пайплайна. На аккуратных демонстрациях все выглядит убедительно. В реальном рабочем пространстве — уже нет.

🟠 DataSpace проверяет полный аналитический цикл

🟣 Лучший результат — 66,34%

🟠 Ошибка — примерно в каждой третьей задаче

🟣 Основной сценарий — разнородные локальные данные, а не один SQL-запрос

Что такое DataSpace

DataSpace — это бенчмарк, где ИИ-агент получает только вопрос на естественном языке и папку с локальным рабочим пространством. Внутри могут лежать CSV, JSON, SQLite, Markdown, PDF и видео. Задача агента — вернуть полную итоговую таблицу, которую можно проверить автоматически.

Это отличие от многих старых бенчмарков. Раньше один тест проверял SQL, другой — поиск по документам, третий — ответы по видео. Здесь все это склеено в один сценарий.

Условия у задач тоже ближе к реальности:

🟠 вопрос и данные могут быть на разных языках, включая китайский и английский

🟣 нужные артефакты не выделены заранее — агент сам должен понять, куда смотреть

🟠 ответом считается полная таблица

🟣 проверка детерминированная: либо таблица совпала по смыслу, либо нет

Авторы называют такого агента «решателем рабочего пространства». Он должен не просто извлечь факт, а разобраться в окружении.

Коротко по масштабу

🟠 410 задач

🟣 7439 артефактов

🟠 15,01 ГБ данных

🟣 6 типов носителей: CSV, JSON, SQLite, Markdown, PDF, видео

🟠 265 кросс-языковых задач

🟣 126 409 строк в эталонных ответах

Почему старых бенчмарков уже мало

У DataSpace практичная претензия к прежним тестам. Они обычно проверяют отдельную способность, а не полный аналитический цикл.

Если вы тестируете только Text-to-SQL, модель работает в почти стерильной среде: схема уже дана, релевантная база известна, ответ можно получить одним запросом. Если вы тестируете только длинные документы, проверяется в основном поиск и извлечение. Если вы делаете открытый аналитический отчет, то проверка часто расплывчатая.

В реальном бизнес-сценарии проблема сложнее:

🟠 нужные факты разбросаны по разным типам файлов

🟣 часть данных надо сначала найти, а потом еще сопоставить

🟠 документы и видео могут содержать не ответ, а только условия фильтрации

🟣 пользователь ждет готовую таблицу, а не свободный текст

Поэтому DataSpace фиксирует единый контракт: на выходе всегда должна быть полная таблица, а оценка должна быть формальной, без судьи-модели.

Интерфейс задачи DataSpace на примере риска фонда: агент объединяет правило из видео, бенчмарки из PDF и дневной NAV из SQLite.

Как этот бенчмарк строили

Самая интересная техническая часть — не только сами задачи, но и то, как их сделали. Авторы не создавали все вручную с нуля. Вместо этого они взяли исполнимые наборы Text-to-SQL из медицины и финансов, а затем превратили их в более грязные и реалистичные рабочие пространства.

Этот пайплайн называется DataSpace-Builder. У него четыре шага.

Как устроен пайплайн сборки

Сначала исходные задачи переводили в кросс-языковый режим. Причем переводили не только вопрос, но и саму базу, значения в колонках и SQL-логику. Это важный момент: если отдельно перевести вопрос и отдельно базу, можно сломать связи между сущностями, значениями и условиями.

Потом авторы делали локальную выборку данных для каждой задачи. Чтобы не использовать одни и те же базы в десятках похожих примеров. Но простая случайная выборка здесь опасна: можно выкинуть строку, которая нужна для соединения таблиц, или убрать значение из фильтра. Поэтому они добавили защитные ограничения, чтобы критичные связи и условия не пропадали.

Дальше данные раскладывали по носителям. Одни таблицы оставляли в CSV и JSON, другие упаковывали в SQLite, третьи превращали в длинные документы в Markdown и PDF. В отдельной ветке делали видео, куда могли уехать условия задачи или части ответа.

И наконец, каждую задачу проверяли люди. В работе участвовали 11 доменных экспертов. Они независимо решали задачу, сверяли эталонный ответ, настраивали правила проверки и исправляли проблемные случаи.

Из чего состоит пайплайн

🟠 кросс-языковая трансформация вопроса, базы и SQL

🟣 выборка строк с сохранением важных связей

🟠 маршрутизация по носителям: таблицы, документы, SQLite, видео

🟣 ручная проверка и исправление задач экспертами

Что именно проверяет DataSpace

Бенчмарк нагружает сразу несколько способностей, которые по отдельности часто кажутся уже решенными.

Во-первых, это поиск по рабочему пространству. Агент должен понять, какие файлы вообще нужны.

Во-вторых, извлечение и сопоставление. Нужно правильно вытащить поля из документа, понять, что одинаковые сущности могут называться по-разному, не перепутать единицы измерения и язык.

В-третьих, собственно аналитика: фильтрация, агрегация, сортировка, соединения таблиц, временные условия.

В-четвертых, материализация ответа. Это недооцененная часть. Даже если агент правильно понял задачу, он может вернуть не ту форму таблицы: потерять колонку, добавить лишнюю, перепутать порядок строк, сорвать формат дат или процентов.

По статистике самих задач:

🟠 фильтрация нужна в 78,3% задач

🟣 проекция колонок — в 82,4%

🟠 сортировка — в 51,0%

🟣 агрегация — в 35,6%

🟠 соединения — в 27,6%

🟣 понимание документов — в 135 задачах

🟠 понимание видео — в 97 задачах

Особенно показательно, что 60,5% задач требуют как минимум пять нетривиальных типов операций сразу. Это уже маленькая аналитическая цепочка.

🟠 DataSpace проверяет не один навык, а связку шагов

🟣 Частая проблема — не вычисление, а форма итоговой таблицы

🟠 В большинстве задач нужно несколько типов операций сразу

(a) Доступные и требуемые модальности.

Что показали эксперименты

Авторы протестировали шесть передовых мультимодальных моделей и пять агентных оболочек. В первом наборе они фиксировали одну и ту же агентную логику и меняли только базовую модель. Во втором — наоборот, фиксировали модель MiMo-V2.5 и меняли оболочку агента.

Главный факт: никто этот бенчмарк не закрыл.

Результаты по моделям

🟠 Grok 4.5 — 66,34%

🟣 GPT-5.6 Sol — 64,63%

🟠 Kimi K3 — 53,41%

🟣 MiMo-V2.5 — 39,27%

🟠 Claude Sonnet 5 — 32,93%

🟣 MiniMax M3 — 28,54%

Разброс большой, но важнее другое: даже лидер решает только две трети задач.

Есть и второй результат. GPT-5.6 Sol почти догоняет Grok 4.5 по точности, но тратит заметно меньше ресурсов: на 74,2% меньше токенов, на 50,3% меньше действий и на 39,2% меньше времени. То есть близкий результат можно получить гораздо компактнее.

Результаты по агентным оболочкам

Когда фиксировали одну и ту же модель, разброс между оболочками составил 15,36 процентного пункта. Это много.

Проще говоря: важно не только то, какая у вас LLM, но и как устроен сам агент — его системный промт, инструменты, управление контекстом, логика шагов, способ завершения задачи.

Для прикладной разработки это почти прямое указание: улучшать стоит не только модель, но и оболочку вокруг нее.

🟠 Лидер — Grok 4.5 с 66,34%

🟣 GPT-5.6 Sol почти не уступает по качеству, но заметно экономнее

🟠 Разница между оболочками — 15,36 п.п.

🟣 Конструкция агента влияет почти так же заметно, как базовая модель

Где системы проваливаются

Самая полезная часть — разбор ошибок. Авторы отдельно посмотрели на 136 провалов Grok 4.5, лучшей модели в контролируемом сравнении.

Картина получилась неожиданной. Основная проблема — не поиск источника и даже не вычисления.

Чаще всего агент проваливает задачу на последнем этапе:

🟠 в 52,2% ошибок проблема была в материализации ответа

🟣 в 44,1% всех разобранных провалов агент добавлял или терял колонки

🟠 еще 22,8% ошибок шли от неверного понимания того, какой именно результат просит задача

🟣 только 3 случая из 136 были связаны с выбором совсем не того источника данных

Часто главным барьером для ИИ-агента кажется поиск нужного файла. Но здесь видно другое: даже найдя правильные данные и иногда вычислив верный внутренний результат, агент не может надежно отдать точную финальную таблицу.

Если переводить на язык продукта, агенту мало понять смысл. Он должен еще строго соблюдать контракт ответа.

🟠 Главный тип ошибки — материализация ответа

🟣 Потеря или добавление колонок — 44,1% разобранных провалов

🟠 Неверный выбор источника данных — редкий случай

Пересечения требуемых семейств носителей.

Какие задачи самые трудные

Авторы отдельно разложили результаты по типам задач. Два фактора ухудшают качество почти у всех моделей.

Первый — мультимодальность. Если нужно объединять несколько типов носителей, точность падает у всех моделей на 1,8–14 процентных пунктов.

Второй — соединения таблиц. Если задача требует join, качество падает на 9,7–19,8 пункта.

Самый проблемный момент — не отдельный PDF и не отдельное видео, а сборка ответа из нескольких источников сразу.

Что сильнее всего бьет по качеству

🟠 объединение нескольких модальностей

🟣 соединения таблиц и сущностей

🟠 кросс-языковое сопоставление

🟣 точная сборка итоговой таблицы

При этом размер ответа сам по себе не всегда все объясняет. Многострочные или многоколоночные ответы не обязательно хуже. Гораздо важнее путь, которым к ним нужно прийти.

Почему это важно для практики

DataSpace полезен не только как еще один академический набор задач. Он точно проверяет тот сценарий, где сегодня пытаются применять ИИ-агентов в компаниях.

Если вы хотите, чтобы агент разбирал внутренние данные, финансовые документы, отчеты, регламенты и мультимедийные артефакты, вам нужен тест, где все это уже смешано. И где ошибка — это неверная таблица, из-за которой можно принять плохое решение.

Этот бенчмарк показывает несколько практических вещей:

🟠 одной умной модели недостаточно

🟣 дизайн агентной оболочки меняет результат почти так же заметно, как смена модели

🟠 мультимодальная интеграция пока остается узким местом

🟣 проверка должна учитывать типы, точность чисел, порядок строк и эквивалентные форматы

Еще один вывод: для надежной аналитики нужна не только генерация, но и строгая система проверки. Авторы сделали детерминированный оценщик, который умеет сравнивать таблицы по смыслу, а не только по буквальному виду заголовков. Это похоже на то, что потом понадобится и в продакшене.

Компромисс точности и эффективности базовой модели при фиксированном DataSpace-Agent; точки Парето соединены пунктиром.

Вывод

DataSpace показывает простой факт: ИИ-агенты пока заметно хуже справляются с реальной аналитикой, чем с изолированными демонстрационными задачами. Когда данные разбросаны по SQLite, документам, таблицам и видео, а ответ нужно собрать в точную итоговую таблицу, качество быстро падает.

Лучший результат в 66,34% означает, что до надежного рабочего режима еще далеко. Главные узкие места уже видны: интеграция нескольких модальностей, соединения таблиц, кросс-языковое сопоставление и точная материализация ответа.

Для разработчиков ИИ-агентов это прямой ориентир. Следующий шаг — улучшать не только базовые модели, но и агентные оболочки, инструменты, правила вывода и контроль того, в каком виде агент отдает результат. В задачах аналитики именно это решает, получится ли у вас полезный помощник или система, которая уверенно ошибается в каждой третьей задаче.

🟠 Лучший результат — 66,34%

🟣 Основные узкие места — мультимодальность, соединения, кросс-языковое сопоставление

🟠 Надежность зависит не только от модели, но и от устройства агента

ИИ-обзоры простыми словами

Каждый день читаем свежие статьи об ИИ и пересказываем главное естественным языком — без хайпа и воды. Если хотите понимать, куда движутся ИИ-агенты раньше остальных, — подписывайтесь.

Новые обзоры — каждый день

В Telegram