Разработчики рассказали об этом на фоне попыток OpenAI сократить число отказов на безвредные запросы и одновременно усилить защиту более способных моделей. На сцене компания представила GPT-6.1 Sol: по её словам, модель приближается к GPT-6 Astra в программировании и работе с компьютером, но стандартная стоимость токенов у неё в пять раз ниже.
OpenAI также заявила, что модели GPT-6 реже прежних отказывают на безвредные запросы. При этом в системной карточке Sol указано, что OpenAI относит саму модель к критическому уровню кибербезопасности и использует для неё тот же набор защитных мер, что и для GPT-6 Astra. В карточке Astra говорится, что это первая модель OpenAI, достигшая критического уровня киберспособностей в рамках фреймворка Preparedness. По оценке компании, с подходящими инструментами и доступом модель может самостоятельно находить и использовать неизвестные уязвимости в хорошо защищённых системах. Как сообщила The Wall Street Journal, OpenAI отменила выпуск GPT-6.1 Astra из-за опасений по поводу безопасности.
OpenAI признала VentureBeat, что защитные ограничения могут мешать легитимной работе. Компания сообщила, что GPT-6 Astra и GPT-6.1 Sol реже, чем модели серии GPT-5, отказывают на безвредные запросы, однако дополнительные проверки безопасности всё ещё могут замедлять, приостанавливать или останавливать обычную работу — в том числе защитные задачи в кибербезопасности. OpenAI продолжает настраивать защиту, чтобы сократить ненужные перебои.
По мере снижения стоимости моделей отказы обходятся разработчикам временем.
Спутник, которого нет
Алехандро Карраско учится на втором курсе магистратуры на факультете аэронавтики и астронавтики MIT и работает в областях, которые могут вызывать срабатывание защитных ограничений: программное обеспечение и космос. Вместе с лабораторией Стэнфорда он исследовал, можно ли поручить агентам на основе больших языковых моделей управлять симулированными космическими аппаратами и превзойдут ли они алгоритмы обучения с подкреплением в управлении полётом.
Карраско рассказал, что не сталкивался с прямым отказом, но иногда его запросы подозревают в опасных намерениях.
«Поскольку я работаю на факультете космических исследований, модель иногда думает, что я занимаюсь военными задачами. Я работаю со спутником, но она не понимает, что спутник симулированный», — пояснил он.
По его словам, модели порой считают, что запросы связаны с чувствительными данными или допуском к оборонным проектам, хотя такого допуска у него нет. Среди ведущих ИИ-лабораторий он отдельно отметил Anthropic: по его оценке, Claude отказывает заметно чаще.
Карраско считает, что ситуацию усугубляет история переписки. Если модель уже начала воспринимать его работу как подозрительную, вернуть разговор в нужное русло трудно. Когда он понимает, что чат зашёл в тупик или приближается к отказу, то просто переключается на другую модель.
Роботизированные руки и SSH-подключения
Мартин Кемка, который разрабатывает робототехнические проекты, рассказал, что ограничения срабатывают даже на обычных этапах работы.
«Я часто сталкивался с блокировками, когда работал над самыми обычными робототехническими проектами. Например, получал отказы, когда хотел создать интерфейс для роботизированной руки или подключиться по SSH к другой машине», — сказал Кемка.
Карраско работал с роботизированными руками, в том числе с открытой моделью SO-101 и UR5 от Universal Robots. По его наблюдениям, ограничения чаще возникают при запросах на доступ к устройству. Когда он просит модель работать с параметрами реального оборудования, проверок становится больше. Несколько месяцев назад одна модель не отказала ему напрямую, но потребовала явно указать, что он разрешает ей доступ к собственной камере и датчикам.
При этом Кемка не испытывал проблем с Astra в симуляторе MicroVerse. Там он обучал виртуальных роботов удерживать равновесие, играть в сумо и незаметно обходить охрану. По его словам, отказы начинаются, когда он просит модель работать с физическим оборудованием или подключаться к другой машине.
Отмена подписки из-за отказов
Элвис Саравиа, сооснователь DAIR.ИИ и автор «Руководства по разработке промтов», сказал, что серьёзно относится к рискам этой технологии.
«Я создаю продукты, но думаю и о безопасности. Я также думаю о вреде, который можно причинить», — отметил он.
Вместе с тем Саравиа назвал отказы большой проблемой для технических специалистов вроде него и сказал, что такой опыт вызывает раздражение. Ему не нравится, когда защитные ограничения мешают людям создавать нужные им вещи.
По словам Саравии, особенно очевидные отказы в итоге заставили его отменить подписку Anthropic. Теперь он пользуется GPT-6 Astra, которую считает наименее склонной к отказам среди передовых моделей, с которыми работал.
Когда блокируют задачи по безопасности
Рохан Балкондека работает в Xsolla и VibeGrow — ИИ-агенте для роста бизнеса, одним из основателей которого он стал. Его команда в основном пишет код с помощью Codex от OpenAI и Claude от Anthropic. Балкондека говорит, что запросы по кибербезопасности особенно часто приводят к отказам.
«Им не нравится слово „кибер“. Стоит сказать „кибербезопасность“ — и они просто отвечают: „Нет“», — сказал он.
По словам Балкондеки, большая часть кода, который нужно проверять его команде, поступает от участников проектов с открытым исходным кодом. Проверка стороннего кода на уязвимости — одна из задач, на которой срабатывают защитные ограничения. Он заметил, что проблема обострилась с последним поколением передовых моделей, в частности с моделями Fable от Anthropic и линейкой GPT-6 от OpenAI.
OpenAI указала на Daybreak Access — программу доверенного доступа для подходящих корпоративных клиентов и специалистов по кибербезопасности. По словам компании, она позволяет выполнять разрешённые защитные задачи: проверять безопасность кода, оценивать уязвимости, реагировать на инциденты и анализировать вредоносные программы.
Anthropic ранее признавала, что её защитные системы иногда дают ложные срабатывания. В моделях Fable предусмотрено перенаправление запросов по кибербезопасности и биологии, отмеченных как рискованные, к менее способным моделям. После запуска Fable 5 в июне разработчики пожаловались, что система блокирует безвредные промты. Anthropic признала, что выбрала неверный баланс.
В этом месяце компания сообщила, что в Fable 5.1 защита разрешает искать уязвимости в исходном коде и должна примерно на 60% сократить число вмешательств в одной сессии Claude Code. При этом тестирование на проникновение, создание эксплойтов и некоторые виды поиска уязвимостей в двоичных файлах по-прежнему перенаправляются с Fable.
К моменту публикации Anthropic не ответила на запрос VentureBeat о комментарии.
Как выручают модели с открытыми весами
Когда закрытые модели отказывают, команда Балкондеки обращается к открытым, в том числе к Kimi от Moonshot AI. По его словам, раньше команда пробовала такие модели из-за стоимости, а отказы добавили ещё одну причину ими пользоваться.
Карраско применяет Qwen от Alibaba в исследованиях. Он говорит, что для многих задач лучше подходит быстрая небольшая модель, запущенная локально, а не передовая — особенно если участники сообщества уже выполнили файн-тюнинг под нужную область. Кемка привёл в пример приложение Apfel: оно предоставляет локальный API к языковой модели, которую Apple поставляет в последней версии macOS.
Для Балкондеки открытые модели — запасной вариант, когда закрытые не берутся за нужную команде работу. «Мы используем открытые модели для таких задач, когда закрытые, например Anthropic и OpenAI, отказывают. Кто-то должен это сделать: невозможно сесть и проверить всё вручную», — сказал он.
Читайте также
Valor, Atreides и Sequoia вложились в ИИ-стартап Flow Engineering при оценке в $750 млн
Google представила Gemini 4 Argon и вернула лидерство в бенчмарках у OpenAI и Anthropic — пока доступ ограничен
Глава Банка Англии: на фоне растущей угрозы нужно сохранить право вмешиваться в работу ИИ
OpenAI и Synopsys создают ИИ-модель, которая проектирует чипы на уровне опытного инженера
Restate привлекла $20 млн на фоне растущей потребности в надёжной инфраструктуре для ИИ-агентов
Поводов беспокоиться о разработке биологического оружия хватает и без ИИ
Meta экономит миллиарды на налогах в США, называя ИИ-дата-центры экспериментами
Клон Jev от OpenAI может помочь лаборатории остановить роение её агентов
Google заменяет Gems на Skills, вслед за OpenAI и Anthropic переходя к промтам для ИИ-агентов
Пьющие собственную мочу помешаны на ИИ и ищут у чат-ботов подтверждение, что это чудодейственное средство от всех болезней
Reddit отключает RSS и закрывает публичный API из-за ИИ-ботов
Демократы в Сенате заблокировали законопроект об энергопотреблении дата-центров
Новый продукт OpenAI с треском провалился во время живой демонстрации на сцене
Meta оспорила утверждение, что Muse без разрешения прочитал личные сообщения пользователя
«Президент Соединённых Штатов»: в соглашении Белого дома по ИИ нашли орфографическую ошибку
Федеральная торговая комиссия США расследует ведущие ИИ-лаборатории после многочисленных взломов вышедших из-под контроля агентов
Прогноз рисков космической погоды для электросетей
DoorDash запустила ИИ-агента, которому можно написать и заказать еду
Китайская ИИ-отрасль сплачивается: Deepseek выпустила открытое ПО для чипов Ascend от Huawei
Если к 2027 году вы не обеспечите себе настоящий суверенитет, в 2028-м можете не выжить
Ежедневные новости об ИИ
Каждый день отбираем важные новости об ИИ и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.
Только важное — каждый день
В Telegram