Когда ИИ-агенту мало одной таблицы
Представьте обычный рабочий запрос: посчитать риск фонда, найти нужные записи по акциям или собрать медицинскую сводку. В жизни ответ редко лежит в одной чистой таблице. Что-то спрятано в SQLite, что-то — в длинном PDF, часть условий диктор проговаривает в видео, а вопрос вообще может быть на другом языке. Для человека это уже неприятная рутина. Для ИИ-агента — частый провал.
DataSpace — новый бенчмарк для ИИ-агентов, которые должны работать с разнородным рабочим пространством, а не с игрушечной задачей «сделай один SQL-запрос». Авторы собрали 410 задач, 7439 файлов, около 15 ГБ данных и заставили агента решать задачу целиком: найти нужные источники, вытащить факты, сопоставить сущности, посчитать метрики и вернуть готовую таблицу.
Ключевой результат: даже лучшие современные системы пока далеки от уверенной работы в таком режиме. Максимальная точность — 66,34%. То есть лучший участник ошибается примерно в каждой третьей задаче.
Это важно, если вы строите ИИ-агентов для аналитики, внутренних данных компании, финансовых сценариев или автоматизации дата-пайплайна. На аккуратных демонстрациях все выглядит убедительно. В реальном рабочем пространстве — уже нет.
🟠 DataSpace проверяет полный аналитический цикл
🟣 Лучший результат — 66,34%
🟠 Ошибка — примерно в каждой третьей задаче
🟣 Основной сценарий — разнородные локальные данные, а не один SQL-запрос
Что такое DataSpace
DataSpace — это бенчмарк, где ИИ-агент получает только вопрос на естественном языке и папку с локальным рабочим пространством. Внутри могут лежать CSV, JSON, SQLite, Markdown, PDF и видео. Задача агента — вернуть полную итоговую таблицу, которую можно проверить автоматически.
Это отличие от многих старых бенчмарков. Раньше один тест проверял SQL, другой — поиск по документам, третий — ответы по видео. Здесь все это склеено в один сценарий.
Условия у задач тоже ближе к реальности:
🟠 вопрос и данные могут быть на разных языках, включая китайский и английский
🟣 нужные артефакты не выделены заранее — агент сам должен понять, куда смотреть
🟠 ответом считается полная таблица
🟣 проверка детерминированная: либо таблица совпала по смыслу, либо нет
Авторы называют такого агента «решателем рабочего пространства». Он должен не просто извлечь факт, а разобраться в окружении.
Коротко по масштабу
🟠 410 задач
🟣 7439 артефактов
🟠 15,01 ГБ данных
🟣 6 типов носителей: CSV, JSON, SQLite, Markdown, PDF, видео
🟠 265 кросс-языковых задач
🟣 126 409 строк в эталонных ответах
Почему старых бенчмарков уже мало
У DataSpace практичная претензия к прежним тестам. Они обычно проверяют отдельную способность, а не полный аналитический цикл.
Если вы тестируете только Text-to-SQL, модель работает в почти стерильной среде: схема уже дана, релевантная база известна, ответ можно получить одним запросом. Если вы тестируете только длинные документы, проверяется в основном поиск и извлечение. Если вы делаете открытый аналитический отчет, то проверка часто расплывчатая.
В реальном бизнес-сценарии проблема сложнее:
🟠 нужные факты разбросаны по разным типам файлов
🟣 часть данных надо сначала найти, а потом еще сопоставить
🟠 документы и видео могут содержать не ответ, а только условия фильтрации
🟣 пользователь ждет готовую таблицу, а не свободный текст
Поэтому DataSpace фиксирует единый контракт: на выходе всегда должна быть полная таблица, а оценка должна быть формальной, без судьи-модели.

Интерфейс задачи DataSpace на примере риска фонда: агент объединяет правило из видео, бенчмарки из PDF и дневной NAV из SQLite.
Как этот бенчмарк строили
Самая интересная техническая часть — не только сами задачи, но и то, как их сделали. Авторы не создавали все вручную с нуля. Вместо этого они взяли исполнимые наборы Text-to-SQL из медицины и финансов, а затем превратили их в более грязные и реалистичные рабочие пространства.
Этот пайплайн называется DataSpace-Builder. У него четыре шага.
Как устроен пайплайн сборки
Сначала исходные задачи переводили в кросс-языковый режим. Причем переводили не только вопрос, но и саму базу, значения в колонках и SQL-логику. Это важный момент: если отдельно перевести вопрос и отдельно базу, можно сломать связи между сущностями, значениями и условиями.
Потом авторы делали локальную выборку данных для каждой задачи. Чтобы не использовать одни и те же базы в десятках похожих примеров. Но простая случайная выборка здесь опасна: можно выкинуть строку, которая нужна для соединения таблиц, или убрать значение из фильтра. Поэтому они добавили защитные ограничения, чтобы критичные связи и условия не пропадали.
Дальше данные раскладывали по носителям. Одни таблицы оставляли в CSV и JSON, другие упаковывали в SQLite, третьи превращали в длинные документы в Markdown и PDF. В отдельной ветке делали видео, куда могли уехать условия задачи или части ответа.
И наконец, каждую задачу проверяли люди. В работе участвовали 11 доменных экспертов. Они независимо решали задачу, сверяли эталонный ответ, настраивали правила проверки и исправляли проблемные случаи.
Из чего состоит пайплайн
🟠 кросс-языковая трансформация вопроса, базы и SQL
🟣 выборка строк с сохранением важных связей
🟠 маршрутизация по носителям: таблицы, документы, SQLite, видео
🟣 ручная проверка и исправление задач экспертами
Что именно проверяет DataSpace
Бенчмарк нагружает сразу несколько способностей, которые по отдельности часто кажутся уже решенными.
Во-первых, это поиск по рабочему пространству. Агент должен понять, какие файлы вообще нужны.
Во-вторых, извлечение и сопоставление. Нужно правильно вытащить поля из документа, понять, что одинаковые сущности могут называться по-разному, не перепутать единицы измерения и язык.
В-третьих, собственно аналитика: фильтрация, агрегация, сортировка, соединения таблиц, временные условия.
В-четвертых, материализация ответа. Это недооцененная часть. Даже если агент правильно понял задачу, он может вернуть не ту форму таблицы: потерять колонку, добавить лишнюю, перепутать порядок строк, сорвать формат дат или процентов.
По статистике самих задач:
🟠 фильтрация нужна в 78,3% задач
🟣 проекция колонок — в 82,4%
🟠 сортировка — в 51,0%
🟣 агрегация — в 35,6%
🟠 соединения — в 27,6%
🟣 понимание документов — в 135 задачах
🟠 понимание видео — в 97 задачах
Особенно показательно, что 60,5% задач требуют как минимум пять нетривиальных типов операций сразу. Это уже маленькая аналитическая цепочка.
🟠 DataSpace проверяет не один навык, а связку шагов
🟣 Частая проблема — не вычисление, а форма итоговой таблицы
🟠 В большинстве задач нужно несколько типов операций сразу

(a) Доступные и требуемые модальности.
Что показали эксперименты
Авторы протестировали шесть передовых мультимодальных моделей и пять агентных оболочек. В первом наборе они фиксировали одну и ту же агентную логику и меняли только базовую модель. Во втором — наоборот, фиксировали модель MiMo-V2.5 и меняли оболочку агента.
Главный факт: никто этот бенчмарк не закрыл.
Результаты по моделям
🟠 Grok 4.5 — 66,34%
🟣 GPT-5.6 Sol — 64,63%
🟠 Kimi K3 — 53,41%
🟣 MiMo-V2.5 — 39,27%
🟠 Claude Sonnet 5 — 32,93%
🟣 MiniMax M3 — 28,54%
Разброс большой, но важнее другое: даже лидер решает только две трети задач.
Есть и второй результат. GPT-5.6 Sol почти догоняет Grok 4.5 по точности, но тратит заметно меньше ресурсов: на 74,2% меньше токенов, на 50,3% меньше действий и на 39,2% меньше времени. То есть близкий результат можно получить гораздо компактнее.
Результаты по агентным оболочкам
Когда фиксировали одну и ту же модель, разброс между оболочками составил 15,36 процентного пункта. Это много.
Проще говоря: важно не только то, какая у вас LLM, но и как устроен сам агент — его системный промт, инструменты, управление контекстом, логика шагов, способ завершения задачи.
Для прикладной разработки это почти прямое указание: улучшать стоит не только модель, но и оболочку вокруг нее.
🟠 Лидер — Grok 4.5 с 66,34%
🟣 GPT-5.6 Sol почти не уступает по качеству, но заметно экономнее
🟠 Разница между оболочками — 15,36 п.п.
🟣 Конструкция агента влияет почти так же заметно, как базовая модель
Где системы проваливаются
Самая полезная часть — разбор ошибок. Авторы отдельно посмотрели на 136 провалов Grok 4.5, лучшей модели в контролируемом сравнении.
Картина получилась неожиданной. Основная проблема — не поиск источника и даже не вычисления.
Чаще всего агент проваливает задачу на последнем этапе:
🟠 в 52,2% ошибок проблема была в материализации ответа
🟣 в 44,1% всех разобранных провалов агент добавлял или терял колонки
🟠 еще 22,8% ошибок шли от неверного понимания того, какой именно результат просит задача
🟣 только 3 случая из 136 были связаны с выбором совсем не того источника данных
Часто главным барьером для ИИ-агента кажется поиск нужного файла. Но здесь видно другое: даже найдя правильные данные и иногда вычислив верный внутренний результат, агент не может надежно отдать точную финальную таблицу.
Если переводить на язык продукта, агенту мало понять смысл. Он должен еще строго соблюдать контракт ответа.
🟠 Главный тип ошибки — материализация ответа
🟣 Потеря или добавление колонок — 44,1% разобранных провалов
🟠 Неверный выбор источника данных — редкий случай

Пересечения требуемых семейств носителей.
Какие задачи самые трудные
Авторы отдельно разложили результаты по типам задач. Два фактора ухудшают качество почти у всех моделей.
Первый — мультимодальность. Если нужно объединять несколько типов носителей, точность падает у всех моделей на 1,8–14 процентных пунктов.
Второй — соединения таблиц. Если задача требует join, качество падает на 9,7–19,8 пункта.
Самый проблемный момент — не отдельный PDF и не отдельное видео, а сборка ответа из нескольких источников сразу.
Что сильнее всего бьет по качеству
🟠 объединение нескольких модальностей
🟣 соединения таблиц и сущностей
🟠 кросс-языковое сопоставление
🟣 точная сборка итоговой таблицы
При этом размер ответа сам по себе не всегда все объясняет. Многострочные или многоколоночные ответы не обязательно хуже. Гораздо важнее путь, которым к ним нужно прийти.
Почему это важно для практики
DataSpace полезен не только как еще один академический набор задач. Он точно проверяет тот сценарий, где сегодня пытаются применять ИИ-агентов в компаниях.
Если вы хотите, чтобы агент разбирал внутренние данные, финансовые документы, отчеты, регламенты и мультимедийные артефакты, вам нужен тест, где все это уже смешано. И где ошибка — это неверная таблица, из-за которой можно принять плохое решение.
Этот бенчмарк показывает несколько практических вещей:
🟠 одной умной модели недостаточно
🟣 дизайн агентной оболочки меняет результат почти так же заметно, как смена модели
🟠 мультимодальная интеграция пока остается узким местом
🟣 проверка должна учитывать типы, точность чисел, порядок строк и эквивалентные форматы
Еще один вывод: для надежной аналитики нужна не только генерация, но и строгая система проверки. Авторы сделали детерминированный оценщик, который умеет сравнивать таблицы по смыслу, а не только по буквальному виду заголовков. Это похоже на то, что потом понадобится и в продакшене.

Компромисс точности и эффективности базовой модели при фиксированном DataSpace-Agent; точки Парето соединены пунктиром.
Вывод
DataSpace показывает простой факт: ИИ-агенты пока заметно хуже справляются с реальной аналитикой, чем с изолированными демонстрационными задачами. Когда данные разбросаны по SQLite, документам, таблицам и видео, а ответ нужно собрать в точную итоговую таблицу, качество быстро падает.
Лучший результат в 66,34% означает, что до надежного рабочего режима еще далеко. Главные узкие места уже видны: интеграция нескольких модальностей, соединения таблиц, кросс-языковое сопоставление и точная материализация ответа.
Для разработчиков ИИ-агентов это прямой ориентир. Следующий шаг — улучшать не только базовые модели, но и агентные оболочки, инструменты, правила вывода и контроль того, в каком виде агент отдает результат. В задачах аналитики именно это решает, получится ли у вас полезный помощник или система, которая уверенно ошибается в каждой третьей задаче.
🟠 Лучший результат — 66,34%
🟣 Основные узкие места — мультимодальность, соединения, кросс-языковое сопоставление
🟠 Надежность зависит не только от модели, но и от устройства агента
ИИ-обзоры простыми словами
Каждый день читаем свежие статьи об ИИ и пересказываем главное естественным языком — без хайпа и воды. Если хотите понимать, куда движутся ИИ-агенты раньше остальных, — подписывайтесь.
Новые обзоры — каждый день
В Telegram