i
Новости
Новости · 2026-09-22

C2C заменяет текстовую передачу данных между ИИ-моделями

@neuronium_ai @neuronium_ai

Исследователи из Университета Цинхуа и других китайских организаций предложили Cache-to-Cache (C2C) — способ обмена информацией между ИИ-моделями через внутренние представления в KV-кэшах, а не через промежуточный текст. В экспериментах метод повысил точность на 3,1–5,4 процентного пункта по сравнению с текстовой передачей и сократил задержку. Работа опубликована на ICLR 2026, а в сентябре команда планирует выпустить реализацию «agent-managed KV-Cache» вместе с системой обслуживания моделей.

Обложка: C2C заменяет текстовую передачу данных между ИИ-моделями

Текст становится узким местом

Системы из нескольких больших языковых моделей устроены по-разному. В совместной работе модели получают разные роли и обмениваются анализом, инструкциями или частичными решениями. В маршрутизации оркестратор переключается между моделями с разными способностями и стоимостью по мере продвижения диалога или рабочего процесса.

Обычно такие системы передают информацию между моделями в виде текстовых токенов. Исследователи указывают на три проблемы такого подхода.

Первая — потеря информации. Модель хранит контекст во внутренних числовых состояниях высокой размерности. Чтобы передать его через текст, она сжимает часть представления в последовательность токенов. Следующей модели приходится интерпретировать эту последовательность и заново строить собственное представление смысла, поэтому часть информации может исчезнуть.

Текст также бывает неоднозначным. Исследователи приводят пример с моделями Coder и Writer, которые совместно изменяют HTML-документ. Coder понимает, что тег `` указывает на определённое место в структуре документа, но его текстовая инструкция не передаёт эту информацию достаточно точно. В результате Writer размещает запрошенное содержимое не там, где нужно.

Наконец, текстовый обмен требует больших вычислений. Первая модель последовательно генерирует сообщение токен за токеном. Затем эти токены добавляются во вход второй модели, которой приходится обрабатывать увеличившийся контекст, прежде чем сформировать ответ. Чем длиннее передаваемый фрагмент, тем больше работы требуется обеим моделям. В системах с длинным контекстом или многочисленными передачами между ИИ-агентами накладные расходы быстро накапливаются.

KV-кэш как слой связи

C2C пытается убрать дополнительную генерацию текста и обработку сообщения получателем, используя представление, которое модели и так создают, — KV-кэш.

Когда большая языковая модель впервые обрабатывает промт, она проходит этап предварительной обработки, или префилла. Вход преобразуется во внутренние ключевые и значенческие представления. Они сохраняются в KV-кэше и повторно используются во время генерации ответа. В этих состояниях хранится информация, которую модель извлекла из контекста.

Сначала исследователи проверили, может ли KV-кэш быть средством связи. Эксперименты показали, что содержащуюся в нём информацию можно обогащать, не увеличивая длину кэша, а кэш одной модели — преобразовывать в пространство представлений другой.

На этом основан C2C. Обе модели обрабатывают один и тот же контекст. Одна получает роль «Передающего», другая — «Получателя». Обученный модуль объединения кэшей переводит кэш Передающего в пространство представлений Получателя, а затем объединяет его с собственным кэшем Получателя. Обучаемый шлюз определяет, какие слои Получателя должны принять дополнительную информацию.

В системах маршрутизации Получатель может использовать данные из кэша Передающего без промежуточного текстового сообщения. Обе модели по-прежнему обрабатывают общий контекст и создают собственные KV-кэши. В совместных системах C2C добавляет ещё один канал связи наряду с текстовым.

Результаты C2C

Исследователи проверили C2C на бенчмарках рассуждения и знаний:

MMLU-Redux;
OpenBookQA;
ARC-Challenge;
C-Eval.

В экспериментах модель Qwen3-0.6B оставалась Получателем, а три разные модели выступали Передающими. Средняя точность Получателя выросла примерно на 9,6–11,9 процентного пункта по сравнению с работой без дополнительной модели. Преимущество над текстовым обменом составило около 3,1–5,4 пункта.

Это результаты на бенчмарках, а не проверка рабочих нагрузок производственных ИИ-агентов. Задержку измеряли при размере пакета 1 на одной Nvidia A100.

3,1–5,4 п.п.преимущество над текстовым обменом
9,6–11,9 п.п.прирост точности против одиночной модели
3,46xускорение в одной конфигурации
14,41xмаксимальное ускорение

Выигрыш по задержке заметно зависел от пары моделей. В трёх основных конфигурациях с разными Передающими C2C оказался в 3,46, 1,51 и 14,41 раза быстрее текстового обмена. Результат в 14,41 раза получили с Qwen3-4B Base в роли Передающего. По словам исследователей, эта модель иногда игнорировала инструкции по текстовой коммуникации и генерировала более длинные, чем ожидалось, сообщения, из-за чего текстовый вариант оказался особенно медленным.

В одном из экспериментов при текстовом обмене Передающий создавал в среднем 80 коммуникационных токенов. Их генерация занимала 1 312 миллисекунд. Получившееся сообщение также увеличивало число токенов, которые должен был обработать Получатель. При использовании C2C требовалось около 90 миллисекунд на объединение кэшей, а генерировать текстовые токены не нужно было.

Метод сработал и тогда, когда модели различались архитектурой или специализацией. В тестах использовались пары Gemma–Qwen, Qwen Math–Qwen и Qwen Coder–Qwen. Во всех пяти описанных в эксперименте неоднородных конфигурациях и конфигурациях с переставленными ролями C2C превзошёл текстовый обмен.

Что требуется для внедрения C2C

C2C не требует файн-тюнинга участвующих больших языковых моделей. Исследователи замораживают Передающего и Получателя, а обучают только модуль объединения кэшей с помощью стандартной целевой функции предсказания следующего токена.

При этом связь между разными моделями требует инженерной доработки. У моделей могут отличаться токенизаторы, число слоёв и размерность представлений. C2C согласует токены, созданные разными токенизаторами, сопоставляет соответствующие слои трансформеров, а затем объединяет их кэши. На обучение такого моста также требуются первоначальные вычислительные затраты.

Команда опубликовала код и конфигурации C2C на GitHub по лицензии Apache 2.0, а предварительно обученные контрольные точки модуля объединения — на Hugging Face.

Есть и ограничение: C2C должен читать, преобразовывать и заменять внутренние состояния KV-кэша. Поэтому ему нужен стек инференса, который открывает доступ к этим внутренним данным. Сейчас метод прежде всего подходит командам, контролирующим собственный стек инференса, а не приложениям, которые соединяют модели только через закрытые API.

ИИ-модели могут общаться без токенов

C2C продолжает направление исследований, в котором ставится под вопрос роль текста как стандартного интерфейса внутри систем из нескольких моделей.

Один из примеров — работа Nvidia по переносу KV-кэша между моделями. Когда система переключается между моделями во время долгой сессии, новая модель обычно должна заново обработать накопленный контекст и построить собственный кэш. Исследователи Nvidia вместо этого переводят существующий кэш в формат целевой модели. Для совместимых пар моделей они сообщили об ускорении в 2,7–25 раз по сравнению с повторным префиллом.

Метод Nvidia переносит весь KV-кэш от исходной модели к целевой. C2C устроен иначе: обе модели обрабатывают контекст, после чего их кэши объединяются, чтобы Получатель мог использовать семантическое представление другой модели.

Ещё один пример — мультиагентный фреймворк RecursiveMAS, который заменяет текстовые сообщения непрерывными латентными представлениями, передаваемыми между ИИ-агентами. В его экспериментах инференс оказался максимум в 2,4 раза быстрее, а расход токенов снизился на 75,6% по сравнению с текстовой рекурсивной системой.

Механизмы различаются, но основаны на одной идее: модели могут обмениваться информацией эффективнее, если им не приходится сначала переводить всё в текст.

Пока C2C остаётся исследовательским результатом, а не производственной архитектурой. Метод требует доступа к внутренним данным моделей, а заявленный выигрыш измеряли на бенчмарках, а не на реальных корпоративных нагрузках ИИ-агентов.

Трамп: ИИ не нужно регулировать — с климатом отсутствие правил тоже работает Qualcomm представила два новых чипа для смартфонов с упором на ИИ Бывший авиадиспетчер в ужасе: новая ИИ-система будет галлюцинировать и вызовет катастрофу Meta признала: сходство Muse с OpenClaw не случайно OpenAI выпустила GPT-6 Sol и Luna, снизив стоимость API на 50% и более Трамп: после первой личной встречи отношения с Бёрнхэмом лучше, чем со Стармером GPT-6 Sol и Luna от OpenAI вдвое дешевле, но почти не прибавили в производительности OpenAI представила GPT-6 Sol и Luna — с более низкой ценой и меньшим числом ошибок Почему все говорят о Jev — ИИ, который не ведёт диалогов Anthropic: Claude Opus 5.5 обошла Fable 5.1 в агентных тестах при API на 60% дешевле Как получить свою долю в компенсации Apple на $250 млн по делу Siri Говорить необязательно: Jev показывает ценность моделей принятия решений Насколько безопасно жить рядом с дата-центром? Возможные риски Tokenmaxxing: опасный новый тренд, который бизнесу пора остановить Оптический проект MIT подстёгивает ловкость роботов Не дайте блеску генеративного ИИ заслонить лёгкие победы предсказательного ИИ От дашбордов к решениям: ИИ меняет правила игры в SaaS ИИ помогает метаосознанности следить за осознанностью и сдерживать бездумность Грузовик-робот уверяет: его ИИ ездит по шоссе без предварительного обучения Агентный ИИ может найти свой идеальный полигон в женском спорте

Ежедневные новости об ИИ

Каждый день отбираем важные новости об ИИ и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.

Только важное — каждый день

В Telegram