i
ДАТАИСТ
Новости · 2026-09-04

GPT-6 Astra от OpenAI реже галлюцинирует, но уязвима к скрытым инъекциям в запросы

@neuronium_ai @neuronium_ai

OpenAI представила GPT-6 Astra — модель, которая заметно реже допускает фактические ошибки и лучше блокирует атаки через запросы, чем предшественники. В тестах на прямые внедрения инструкций в запрос она показала защиту на уровне 99,99%, а против известных попыток получить вредные ответы отказывалась выполнять запросы в 91,5–98,3% случаев. Но при многоходовых атаках защита снижалась примерно до 67%, а при скрытых инструкциях в документах Astra поддавалась атаке хотя бы один раз в 8,5% сценариев. Для надёжного применения ИИ-агентов этого пока недостаточно.

Обложка: GPT-6 Astra от OpenAI реже галлюцинирует, но уязвима к скрытым инъекциям в запросы

Ошибки и прямые атаки

Согласно системной карточке OpenAI, GPT-6 Astra делает гораздо меньше фактических ошибок, чем GPT-5.6 Sol. OpenAI проверяла модель на диалогах ChatGPT, которые пользователи ранее отметили как содержащие неправильные ответы. Это особенно проблемные случаи, поэтому их показатели нельзя считать типичными для повседневного использования. Astra значительно реже воспроизводила такие ошибки — особенно при низкой задержке и невысоком уровне рассуждения.

GPT-6 Astra (розовая) реже галлюцинирует, чем модели GPT-5, при всех настройках задержки

GPT-6 Astra (розовая) реже галлюцинирует, чем модели GPT-5, при всех настройках задержки

Источник: the-decoder.com

В тестах на прямые внедрения инструкций в запрос, когда пользователь пытается манипулировать моделью собственными инструкциями, Astra достигла почти полной защиты — 99,99%. OpenAI связывает этот результат с методом GPT-Red: автоматизированный атакующий пытается взломать модель во время обучения, помогая усилить её защиту.

Устойчивость к попыткам обойти ограничения оказалась сопоставимой. На фиксированном наборе известных атак, нацеленных на получение опасных ответов о биологии, насилии и кибербезопасности, Astra отказывалась выполнять запросы в 91,5–98,3% случаев.

Если атакующий меняет стратегию на протяжении нескольких раундов диалога, защита Astra снижается примерно до 67%. Иными словами, настойчивый противник может получить хотя бы один проблемный ответ примерно в каждой третьей попытке. Предыдущие модели набрали в том же тесте чуть меньше 50%. OpenAI уточняет, что проверка проходила на базовой модели без производственных уровней защиты — например, классификаторов, которые используются в готовом продукте.

Атаки через документы

Astra улучшила защиту от косвенных внедрений инструкций в запрос — атак, при которых вредная инструкция спрятана внутри документа, который читает ИИ. Внешнее тестирование провела компания Gray Swan на 1810 специально отобранных атаках из IPI Arena. При 15 попытках для каждого сценария Astra удавалось обойти хотя бы один раз в 8,5% случаев. GPT-5.6 Sol провалила 27% таких сценариев. Claude Opus 5 показала результат 4,8% в той же проверке, но тоже не обеспечила полной защиты.

Показатели успешности атак с косвенным внедрением промптов согласно IPI Arena компании Gray Swan

Показатели успешности атак с косвенным внедрением промптов согласно IPI Arena компании Gray Swan

Источник: the-decoder.com

В объединённом тесте Gray Swan за первый и второй кварталы показатели оказались выше, чем в более ранних результатах. Ранее Anthropic сообщала лишь о 2% успешных атак — тогда использовался только более простой тест за первый квартал. В нём GPT-5.6 Sol также получила лучший результат — 20%. Кроме того, Anthropic запускала все модели с включённым расширенным рассуждением. Вместе с более широким набором проверок это может объяснять разницу между результатами.

Риск для ИИ-агентов

Хотя Gray Swan использовала отобранные вручную атаки, получившиеся показатели должны беспокоить команды корпоративной безопасности. Astra можно обмануть с помощью внедрённой инструкции примерно в одном из 12 сценариев. Opus 5 справляется лучше, но всё равно проваливает около одного сценария из 21.

Риск увеличивается по мере того, как ИИ-агенты начинают самостоятельно писать код, работать с инструментами и управлять компьютерами — именно такие сценарии проверяла Gray Swan. Кроме того, агентов создают для круглосуточной работы в большом масштабе, а чтение и обработка документов становятся одной из их основных задач.

Ежедневные новости об ИИ

Каждый день отбираем важные новости об ИИ, роботах и метавселенных и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.

Только важное — каждый день

В Telegram