i
Новости
Новости · 2026-09-30

Защита ИИ тормозит разработчиков

@neuronium_ai @neuronium_ai

На Dev Day OpenAI говорила о скорости и снижении расходов, но разработчики на конференции обсуждали другое: сколько времени уходит на обход защитных ограничений моделей. По их словам, системы OpenAI и Anthropic иногда считают рискованной обычную работу с аэрокосмическим ПО, робототехникой и кибербезопасностью. Из-за отказов приходится менять запросы, начинать новые чаты или переносить задачи на другие модели. Опрос JetBrains среди более чем 15 000 разработчиков показал, что 90% используют ИИ-агентов для программирования на работе хотя бы раз в неделю, а 68% — каждый день.

Обложка: Защита ИИ тормозит разработчиков

Разработчики рассказали об этом на фоне попыток OpenAI сократить число отказов на безвредные запросы и одновременно усилить защиту более способных моделей. На сцене компания представила GPT-6.1 Sol: по её словам, модель приближается к GPT-6 Astra в программировании и работе с компьютером, но стандартная стоимость токенов у неё в пять раз ниже.

OpenAI также заявила, что модели GPT-6 реже прежних отказывают на безвредные запросы. При этом в системной карточке Sol указано, что OpenAI относит саму модель к критическому уровню кибербезопасности и использует для неё тот же набор защитных мер, что и для GPT-6 Astra. В карточке Astra говорится, что это первая модель OpenAI, достигшая критического уровня киберспособностей в рамках фреймворка Preparedness. По оценке компании, с подходящими инструментами и доступом модель может самостоятельно находить и использовать неизвестные уязвимости в хорошо защищённых системах. Как сообщила The Wall Street Journal, OpenAI отменила выпуск GPT-6.1 Astra из-за опасений по поводу безопасности.

OpenAI признала VentureBeat, что защитные ограничения могут мешать легитимной работе. Компания сообщила, что GPT-6 Astra и GPT-6.1 Sol реже, чем модели серии GPT-5, отказывают на безвредные запросы, однако дополнительные проверки безопасности всё ещё могут замедлять, приостанавливать или останавливать обычную работу — в том числе защитные задачи в кибербезопасности. OpenAI продолжает настраивать защиту, чтобы сократить ненужные перебои.

По мере снижения стоимости моделей отказы обходятся разработчикам временем.

Спутник, которого нет

Алехандро Карраско учится на втором курсе магистратуры на факультете аэронавтики и астронавтики MIT и работает в областях, которые могут вызывать срабатывание защитных ограничений: программное обеспечение и космос. Вместе с лабораторией Стэнфорда он исследовал, можно ли поручить агентам на основе больших языковых моделей управлять симулированными космическими аппаратами и превзойдут ли они алгоритмы обучения с подкреплением в управлении полётом.

Карраско рассказал, что не сталкивался с прямым отказом, но иногда его запросы подозревают в опасных намерениях.

«Поскольку я работаю на факультете космических исследований, модель иногда думает, что я занимаюсь военными задачами. Я работаю со спутником, но она не понимает, что спутник симулированный», — пояснил он.

По его словам, модели порой считают, что запросы связаны с чувствительными данными или допуском к оборонным проектам, хотя такого допуска у него нет. Среди ведущих ИИ-лабораторий он отдельно отметил Anthropic: по его оценке, Claude отказывает заметно чаще.

Карраско считает, что ситуацию усугубляет история переписки. Если модель уже начала воспринимать его работу как подозрительную, вернуть разговор в нужное русло трудно. Когда он понимает, что чат зашёл в тупик или приближается к отказу, то просто переключается на другую модель.

Роботизированные руки и SSH-подключения

Мартин Кемка, который разрабатывает робототехнические проекты, рассказал, что ограничения срабатывают даже на обычных этапах работы.

«Я часто сталкивался с блокировками, когда работал над самыми обычными робототехническими проектами. Например, получал отказы, когда хотел создать интерфейс для роботизированной руки или подключиться по SSH к другой машине», — сказал Кемка.

Карраско работал с роботизированными руками, в том числе с открытой моделью SO-101 и UR5 от Universal Robots. По его наблюдениям, ограничения чаще возникают при запросах на доступ к устройству. Когда он просит модель работать с параметрами реального оборудования, проверок становится больше. Несколько месяцев назад одна модель не отказала ему напрямую, но потребовала явно указать, что он разрешает ей доступ к собственной камере и датчикам.

При этом Кемка не испытывал проблем с Astra в симуляторе MicroVerse. Там он обучал виртуальных роботов удерживать равновесие, играть в сумо и незаметно обходить охрану. По его словам, отказы начинаются, когда он просит модель работать с физическим оборудованием или подключаться к другой машине.

Отмена подписки из-за отказов

Элвис Саравиа, сооснователь DAIR.ИИ и автор «Руководства по разработке промтов», сказал, что серьёзно относится к рискам этой технологии.

«Я создаю продукты, но думаю и о безопасности. Я также думаю о вреде, который можно причинить», — отметил он.

Вместе с тем Саравиа назвал отказы большой проблемой для технических специалистов вроде него и сказал, что такой опыт вызывает раздражение. Ему не нравится, когда защитные ограничения мешают людям создавать нужные им вещи.

По словам Саравии, особенно очевидные отказы в итоге заставили его отменить подписку Anthropic. Теперь он пользуется GPT-6 Astra, которую считает наименее склонной к отказам среди передовых моделей, с которыми работал.

Когда блокируют задачи по безопасности

Рохан Балкондека работает в Xsolla и VibeGrow — ИИ-агенте для роста бизнеса, одним из основателей которого он стал. Его команда в основном пишет код с помощью Codex от OpenAI и Claude от Anthropic. Балкондека говорит, что запросы по кибербезопасности особенно часто приводят к отказам.

«Им не нравится слово „кибер“. Стоит сказать „кибербезопасность“ — и они просто отвечают: „Нет“», — сказал он.

По словам Балкондеки, большая часть кода, который нужно проверять его команде, поступает от участников проектов с открытым исходным кодом. Проверка стороннего кода на уязвимости — одна из задач, на которой срабатывают защитные ограничения. Он заметил, что проблема обострилась с последним поколением передовых моделей, в частности с моделями Fable от Anthropic и линейкой GPT-6 от OpenAI.

OpenAI указала на Daybreak Access — программу доверенного доступа для подходящих корпоративных клиентов и специалистов по кибербезопасности. По словам компании, она позволяет выполнять разрешённые защитные задачи: проверять безопасность кода, оценивать уязвимости, реагировать на инциденты и анализировать вредоносные программы.

Anthropic ранее признавала, что её защитные системы иногда дают ложные срабатывания. В моделях Fable предусмотрено перенаправление запросов по кибербезопасности и биологии, отмеченных как рискованные, к менее способным моделям. После запуска Fable 5 в июне разработчики пожаловались, что система блокирует безвредные промты. Anthropic признала, что выбрала неверный баланс.

В этом месяце компания сообщила, что в Fable 5.1 защита разрешает искать уязвимости в исходном коде и должна примерно на 60% сократить число вмешательств в одной сессии Claude Code. При этом тестирование на проникновение, создание эксплойтов и некоторые виды поиска уязвимостей в двоичных файлах по-прежнему перенаправляются с Fable.

К моменту публикации Anthropic не ответила на запрос VentureBeat о комментарии.

Как выручают модели с открытыми весами

Когда закрытые модели отказывают, команда Балкондеки обращается к открытым, в том числе к Kimi от Moonshot AI. По его словам, раньше команда пробовала такие модели из-за стоимости, а отказы добавили ещё одну причину ими пользоваться.

Карраско применяет Qwen от Alibaba в исследованиях. Он говорит, что для многих задач лучше подходит быстрая небольшая модель, запущенная локально, а не передовая — особенно если участники сообщества уже выполнили файн-тюнинг под нужную область. Кемка привёл в пример приложение Apfel: оно предоставляет локальный API к языковой модели, которую Apple поставляет в последней версии macOS.

Для Балкондеки открытые модели — запасной вариант, когда закрытые не берутся за нужную команде работу. «Мы используем открытые модели для таких задач, когда закрытые, например Anthropic и OpenAI, отказывают. Кто-то должен это сделать: невозможно сесть и проверить всё вручную», — сказал он.

Valor, Atreides и Sequoia вложились в ИИ-стартап Flow Engineering при оценке в $750 млн Google представила Gemini 4 Argon и вернула лидерство в бенчмарках у OpenAI и Anthropic — пока доступ ограничен Глава Банка Англии: на фоне растущей угрозы нужно сохранить право вмешиваться в работу ИИ OpenAI и Synopsys создают ИИ-модель, которая проектирует чипы на уровне опытного инженера Restate привлекла $20 млн на фоне растущей потребности в надёжной инфраструктуре для ИИ-агентов Поводов беспокоиться о разработке биологического оружия хватает и без ИИ Meta экономит миллиарды на налогах в США, называя ИИ-дата-центры экспериментами Клон Jev от OpenAI может помочь лаборатории остановить роение её агентов Google заменяет Gems на Skills, вслед за OpenAI и Anthropic переходя к промтам для ИИ-агентов Пьющие собственную мочу помешаны на ИИ и ищут у чат-ботов подтверждение, что это чудодейственное средство от всех болезней Reddit отключает RSS и закрывает публичный API из-за ИИ-ботов Демократы в Сенате заблокировали законопроект об энергопотреблении дата-центров Новый продукт OpenAI с треском провалился во время живой демонстрации на сцене Meta оспорила утверждение, что Muse без разрешения прочитал личные сообщения пользователя «Президент Соединённых Штатов»: в соглашении Белого дома по ИИ нашли орфографическую ошибку Федеральная торговая комиссия США расследует ведущие ИИ-лаборатории после многочисленных взломов вышедших из-под контроля агентов Прогноз рисков космической погоды для электросетей DoorDash запустила ИИ-агента, которому можно написать и заказать еду Китайская ИИ-отрасль сплачивается: Deepseek выпустила открытое ПО для чипов Ascend от Huawei Если к 2027 году вы не обеспечите себе настоящий суверенитет, в 2028-м можете не выжить

Ежедневные новости об ИИ

Каждый день отбираем важные новости об ИИ и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.

Только важное — каждый день

В Telegram