В записи в блоге OpenAI рассказала, что обнаружила и остановила кампанию так называемой состязательной дистилляции. Злоумышленники нацелились на защищённые рассуждения моделей — внутренние шаги, которые ИИ выполняет перед ответом. Обычно пользователю показывают только итог.
При дистилляции одна модель учится на полном выводе другой. Он включает не только ответы, но и цепочки рассуждений более сильной модели. Эти промежуточные шаги особенно ценны: по словам OpenAI, в них может содержаться информация, намеренно исключённая из итогового ответа, а сами рассуждения помогают воспроизводить способности модели.
По данным OpenAI, сначала, 1 июля, активность была небольшой. 24 и 25 июля число запросов резко выросло: более 4 000 пользователей отправили 16 000 запросов, следуя типичному шаблону извлечения данных. Дальнейшая проверка выявила сеть из более чем 15 000 аккаунтов с похожим поведением. OpenAI утверждает, что полностью заблокировала их к 28 июля. В примечании компания уточнила: речь идёт о попытках извлечения, и это не означает, что все они оказались успешными.
Основную группу участников OpenAI связала с людьми, ассоциированными с Moonshot AI — компанией, выпускающей языковую модель Kimi. При этом, по словам компании, пока неясно, происходили ли все обнаруженные действия из одного источника. Ранее Anthropic тоже сообщала о похожих попытках со стороны китайских ИИ-компаний.
Как извлекали скрытые рассуждения
По словам OpenAI, злоумышленники копировали зашифрованные рассуждения из одного диалога, а затем в отдельном диалоге просили модель расшифровать их и вывести открытым текстом.
Исследователь Йоахим Шеффер и его команда уже описывали этот метод в научной работе. Поставщики ИИ отправляют рассуждения клиентам в виде зашифрованных пакетов данных, которые те затем передают вместе с дополнительными запросами. Исследователи выяснили, что пакеты используют общие ключи шифрования, поэтому их можно переносить между сессиями и пользователями, а также между разными моделями одного поставщика. В результате более слабая и дешёвая модель того же семейства может выступать «оракулом расшифровки» и слово в слово выводить скрытые рассуждения более сильной модели.
OpenAI назвала исследователей и подтвердила, что описанные ими способы атаки действительно работали. По словам компании, результаты команды помогли быстрее внедрить защитные меры.
OpenAI сообщила, что заблокировала мошеннические аккаунты, ужесточила регистрацию и закрыла уязвимость, которая позволяла повторно использовать и читать чужие зашифрованные рассуждения. Кроме того, компания начала проверять потоковые ответы и задерживать те, которые могут раскрыть рассуждения. OpenAI также поделилась результатами через Форум передовых моделей и государственные каналы: проблема касается не только её собственных моделей.
Защита API не закрывает облачные платформы
На этом история не закончилась. В тот же день исследователи опубликовали обновление своей работы. «Мы снова украли рассуждения», — написал Шеффер в X. По его словам, защита собственного API не защищает всю экосистему облачных поставщиков, которые тоже предоставляют доступ к моделям.
Во время повторной проверки 13 сентября атака не сработала через собственные API OpenAI и Anthropic. Но на Microsoft Azure она сработала со всеми проверенными моделями OpenAI, включая новую GPT-6 Astra, и с моделями Anthropic вплоть до Sonnet 5. Для извлечения рассуждений хватило одной попытки. Шеффер отметил, что это были те же модели, но уровень защиты зависел от платформы, через которую к ним обращались.
Исследователи описали и второй, ещё более простой способ, который разработчик Джан Бёлюк публично показал в демке. Модели дают виртуальный блокнот как инструмент и просят записать туда рассуждения. Затем пользователь может прочитать написанное. По словам исследователей, этот способ сработал со всеми моделями OpenAI, а также с Opus 4.8 и Sonnet 5. Рассуждения не раскрыли только Opus 5, Fable 5 и Fable 5.1. Полученный текст был очень похож на результат атаки с расшифровкой; исследователи считают, что его, вероятно, можно было бы использовать для дистилляции с такой же пользой.
Исследователи назвали внедрённые меры разрозненными и поверхностными. Многие из них опираются на хрупкое сопоставление конкретных шаблонов запросов, а до облачных платформ некоторые защиты доходили лишь через несколько дней. GPT-6 Astra появилась на сторонних платформах без каких-либо мер защиты. Согласно хронологии исследователей, OpenAI добавила защиту для конечной точки Azure только 27 сентября. Для моделей Anthropic заявленный способ извлечения перестал воспроизводиться на Azure с 28 сентября.
Шеффер считает, что защитные исправления должны охватывать все типы атак и все облачные платформы, на которых размещены модели. Иначе злоумышленники смогут выбирать путь с самой слабой защитой. В научной работе исследователи идут дальше: облачным поставщикам, которые не обеспечивают сопоставимую защиту, не следует разрешать предоставлять доступ к моделям с рассуждениями. Иначе открытые лазейки фактически позволят обходить экспортные ограничения на уровне API. OpenAI согласна, что модели на платформах партнёров должны быть защищены так же, как в её собственных сервисах, и говорит, что работа ещё не завершена.
Ранее мы рассказывали о первоначальном обнаружении этой уязвимости исследовательской командой. В последнем выпуске рассылки ИИ Radar о китайских языковых моделях дистилляции посвящён отдельный подробный разбор. OpenAI ожидает, что попытки извлечения станут сложнее по мере улучшения передовых моделей и роста числа участников, которые ищут дешёвые способы копировать их возможности.
Читайте также
Аналитики предупреждают: дата-центры могут стать бомбой замедленного действия на $6 трлн
Как старейший ИИ-стартап пытается защитить себя от пузыря изнутри
ИИ научился «читать мысли» и восстанавливать увиденное по снимкам мозга
ИИ-чат-боты снимают хиджабы с изображений мусульманок по просьбе пользователей
Забудьте о «сверхразуме»: из-за ошибки ИИ в этом месяце мир едва не оказался на пороге третьей мировой войны
Barclays масштабирует Claude, чтобы модернизировать работу и улучшить обслуживание клиентов
Знакомьтесь: робот, который заботится о 74-летней Вере у неё дома
Голосовой ИИ-стартап ElevenLabs удвоил оценку — до $22 млрд
Как ИИ может резко усилить угрозы выборам в Юго-Восточной Азии
Новые товарные рекомендации Instinct вызывают у части пользователей отторжение
Гэвин Ньюсом подписал законы, защищающие работников Калифорнии от угрозы ИИ
Глава хедж-фонда пожертвовал Carnegie Mellon University $3 млрд — исторический дар
Секрет Destro AI — согласовать работу людей и роботов
Защита ИИ тормозит разработчиков
Valor, Atreides и Sequoia вложились в ИИ-стартап Flow Engineering при оценке в $750 млн
Google представила Gemini 4 Argon и вернула лидерство в бенчмарках у OpenAI и Anthropic — пока доступ ограничен
Глава Банка Англии: на фоне растущей угрозы нужно сохранить право вмешиваться в работу ИИ
OpenAI и Synopsys создают ИИ-модель, которая проектирует чипы на уровне опытного инженера
Restate привлекла $20 млн на фоне растущей потребности в надёжной инфраструктуре для ИИ-агентов
Поводов беспокоиться о разработке биологического оружия хватает и без ИИ
Ежедневные новости об ИИ
Каждый день отбираем важные новости об ИИ и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.
Только важное — каждый день
В Telegram