i
Новости
Новости · 2026-10-01

OpenAI пресекла кампанию по краже рассуждений своих моделей, но на Azure уловка сработала

@neuronium_ai @neuronium_ai

OpenAI сообщила, что пресекла скоординированную кампанию по извлечению скрытых рассуждений своих моделей. С 1 июля активность росла, а 24 и 25 июля достигла 16 000 запросов от более чем 4 000 пользователей. Компания связала основную группу с людьми, связанными с Moonshot AI, разработчиком языковой модели Kimi, и сообщила, что закрыла более 15 000 аккаунтов. Однако исследователи обнаружили, что 13 сентября похожие атаки всё ещё работали на Microsoft Azure: там удалось получить рассуждения всех проверенных моделей OpenAI, включая GPT-6 Astra, и моделей Anthropic вплоть до Sonnet 5.

Обложка: OpenAI пресекла кампанию по краже рассуждений своих моделей, но на Azure уловка сработала

В записи в блоге OpenAI рассказала, что обнаружила и остановила кампанию так называемой состязательной дистилляции. Злоумышленники нацелились на защищённые рассуждения моделей — внутренние шаги, которые ИИ выполняет перед ответом. Обычно пользователю показывают только итог.

При дистилляции одна модель учится на полном выводе другой. Он включает не только ответы, но и цепочки рассуждений более сильной модели. Эти промежуточные шаги особенно ценны: по словам OpenAI, в них может содержаться информация, намеренно исключённая из итогового ответа, а сами рассуждения помогают воспроизводить способности модели.

По данным OpenAI, сначала, 1 июля, активность была небольшой. 24 и 25 июля число запросов резко выросло: более 4 000 пользователей отправили 16 000 запросов, следуя типичному шаблону извлечения данных. Дальнейшая проверка выявила сеть из более чем 15 000 аккаунтов с похожим поведением. OpenAI утверждает, что полностью заблокировала их к 28 июля. В примечании компания уточнила: речь идёт о попытках извлечения, и это не означает, что все они оказались успешными.

Основную группу участников OpenAI связала с людьми, ассоциированными с Moonshot AI — компанией, выпускающей языковую модель Kimi. При этом, по словам компании, пока неясно, происходили ли все обнаруженные действия из одного источника. Ранее Anthropic тоже сообщала о похожих попытках со стороны китайских ИИ-компаний.

Как извлекали скрытые рассуждения

По словам OpenAI, злоумышленники копировали зашифрованные рассуждения из одного диалога, а затем в отдельном диалоге просили модель расшифровать их и вывести открытым текстом.

Исследователь Йоахим Шеффер и его команда уже описывали этот метод в научной работе. Поставщики ИИ отправляют рассуждения клиентам в виде зашифрованных пакетов данных, которые те затем передают вместе с дополнительными запросами. Исследователи выяснили, что пакеты используют общие ключи шифрования, поэтому их можно переносить между сессиями и пользователями, а также между разными моделями одного поставщика. В результате более слабая и дешёвая модель того же семейства может выступать «оракулом расшифровки» и слово в слово выводить скрытые рассуждения более сильной модели.

OpenAI назвала исследователей и подтвердила, что описанные ими способы атаки действительно работали. По словам компании, результаты команды помогли быстрее внедрить защитные меры.

OpenAI сообщила, что заблокировала мошеннические аккаунты, ужесточила регистрацию и закрыла уязвимость, которая позволяла повторно использовать и читать чужие зашифрованные рассуждения. Кроме того, компания начала проверять потоковые ответы и задерживать те, которые могут раскрыть рассуждения. OpenAI также поделилась результатами через Форум передовых моделей и государственные каналы: проблема касается не только её собственных моделей.

Защита API не закрывает облачные платформы

На этом история не закончилась. В тот же день исследователи опубликовали обновление своей работы. «Мы снова украли рассуждения», — написал Шеффер в X. По его словам, защита собственного API не защищает всю экосистему облачных поставщиков, которые тоже предоставляют доступ к моделям.

Во время повторной проверки 13 сентября атака не сработала через собственные API OpenAI и Anthropic. Но на Microsoft Azure она сработала со всеми проверенными моделями OpenAI, включая новую GPT-6 Astra, и с моделями Anthropic вплоть до Sonnet 5. Для извлечения рассуждений хватило одной попытки. Шеффер отметил, что это были те же модели, но уровень защиты зависел от платформы, через которую к ним обращались.

Исследователи описали и второй, ещё более простой способ, который разработчик Джан Бёлюк публично показал в демке. Модели дают виртуальный блокнот как инструмент и просят записать туда рассуждения. Затем пользователь может прочитать написанное. По словам исследователей, этот способ сработал со всеми моделями OpenAI, а также с Opus 4.8 и Sonnet 5. Рассуждения не раскрыли только Opus 5, Fable 5 и Fable 5.1. Полученный текст был очень похож на результат атаки с расшифровкой; исследователи считают, что его, вероятно, можно было бы использовать для дистилляции с такой же пользой.

Исследователи назвали внедрённые меры разрозненными и поверхностными. Многие из них опираются на хрупкое сопоставление конкретных шаблонов запросов, а до облачных платформ некоторые защиты доходили лишь через несколько дней. GPT-6 Astra появилась на сторонних платформах без каких-либо мер защиты. Согласно хронологии исследователей, OpenAI добавила защиту для конечной точки Azure только 27 сентября. Для моделей Anthropic заявленный способ извлечения перестал воспроизводиться на Azure с 28 сентября.

Шеффер считает, что защитные исправления должны охватывать все типы атак и все облачные платформы, на которых размещены модели. Иначе злоумышленники смогут выбирать путь с самой слабой защитой. В научной работе исследователи идут дальше: облачным поставщикам, которые не обеспечивают сопоставимую защиту, не следует разрешать предоставлять доступ к моделям с рассуждениями. Иначе открытые лазейки фактически позволят обходить экспортные ограничения на уровне API. OpenAI согласна, что модели на платформах партнёров должны быть защищены так же, как в её собственных сервисах, и говорит, что работа ещё не завершена.

Ранее мы рассказывали о первоначальном обнаружении этой уязвимости исследовательской командой. В последнем выпуске рассылки ИИ Radar о китайских языковых моделях дистилляции посвящён отдельный подробный разбор. OpenAI ожидает, что попытки извлечения станут сложнее по мере улучшения передовых моделей и роста числа участников, которые ищут дешёвые способы копировать их возможности.

Аналитики предупреждают: дата-центры могут стать бомбой замедленного действия на $6 трлн Как старейший ИИ-стартап пытается защитить себя от пузыря изнутри ИИ научился «читать мысли» и восстанавливать увиденное по снимкам мозга ИИ-чат-боты снимают хиджабы с изображений мусульманок по просьбе пользователей Забудьте о «сверхразуме»: из-за ошибки ИИ в этом месяце мир едва не оказался на пороге третьей мировой войны Barclays масштабирует Claude, чтобы модернизировать работу и улучшить обслуживание клиентов Знакомьтесь: робот, который заботится о 74-летней Вере у неё дома Голосовой ИИ-стартап ElevenLabs удвоил оценку — до $22 млрд Как ИИ может резко усилить угрозы выборам в Юго-Восточной Азии Новые товарные рекомендации Instinct вызывают у части пользователей отторжение Гэвин Ньюсом подписал законы, защищающие работников Калифорнии от угрозы ИИ Глава хедж-фонда пожертвовал Carnegie Mellon University $3 млрд — исторический дар Секрет Destro AI — согласовать работу людей и роботов Защита ИИ тормозит разработчиков Valor, Atreides и Sequoia вложились в ИИ-стартап Flow Engineering при оценке в $750 млн Google представила Gemini 4 Argon и вернула лидерство в бенчмарках у OpenAI и Anthropic — пока доступ ограничен Глава Банка Англии: на фоне растущей угрозы нужно сохранить право вмешиваться в работу ИИ OpenAI и Synopsys создают ИИ-модель, которая проектирует чипы на уровне опытного инженера Restate привлекла $20 млн на фоне растущей потребности в надёжной инфраструктуре для ИИ-агентов Поводов беспокоиться о разработке биологического оружия хватает и без ИИ

Ежедневные новости об ИИ

Каждый день отбираем важные новости об ИИ и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.

Только важное — каждый день

В Telegram