Модель без ограничений
Идея эксперимента появилась у Найта после знакомства с Abliteration ИИ — стартапом, который предоставляет доступ к мощным моделям с отключёнными стандартными ограничениями.
Большинство популярных моделей отказываются отвечать на некоторые запросы и тем более не станут искать уязвимости в компьютерных системах или использовать их. Однако ограничения можно убрать, изменив определённые шаблоны во внутренних параметрах открытой модели. Процесс настройки таких шаблонов, отвечающих за отказы, называется аблитерацией.
Модели без защитных ограничений применяют не только для сомнительных экспериментов. Академические исследователи используют их, чтобы лучше понять принципы работы ИИ, а компании в сфере кибербезопасности — для поиска уязвимостей в программах и системах. Anthropic Mythos и OpenAI Astra технически устроены похожим образом: это обычные модели без стандартных средств контроля кибербезопасности, доступные пока только проверенным клиентам. При этом компании предлагают более широкому кругу пользователей модели со средним количеством ограничений, чтобы организации могли проверять свой код и системы.
Abliteration ИИ предоставляет несколько полностью лишённых ограничений моделей. Самая мощная из них — версия последней агентной модели Z.ai для программирования GLM 5.3. Получить сопоставимые с Mythos и Astra кибервозможности можно примерно по цене пиццы.
Генеральный директор Abliteration ИИ, представившийся как Девон, считает широкую доступность таких моделей разумной защитой. По его мнению, они помогут защищать системы от злоумышленников: искать уязвимости, имитировать поведение хакеров, мошенников и ИИ-агентов, действующих без контроля. Девон попросил называть его только по имени, поскольку его основной работодатель не знает о побочном проекте.
Он объясняет, что критически важные компании — от авиаперевозчиков до банков — массово внедряют ИИ-агентов. Поэтому возникает вопрос, как не допустить, чтобы злоумышленники использовали эти системы во вред.
Для эксперимента Найт создал аккаунт в Abliteration ИИ и установил программную оболочку CyberStrike. Она помогает направлять большую языковую модель при выполнении разных задач по кибербезопасности.
С помощью CyberStrike Найт попросил версию GLM-5.3 после аблитерации проверить локальную сеть. Через несколько мгновений модель обнаружила в ней около десятка аппаратных систем и составила список уязвимостей.
Например, агент выяснил, что принтер настроен неправильно: любой пользователь в сети мог войти в него. Это стало бы проблемой, если бы в очереди печати находились налоговые декларации, банковские выписки или медицинские документы.
Стереосистема Wiim, как обнаружил агент, передавала слишком много информации. Модель даже знала, что последней играла песня Rein Me In Сэма Фендера и Оливии Дин. Любой пользователь в сети мог включить другую музыку или изменить громкость. Кроме того, модель нашла несколько устройств интернета вещей с устаревшими прошивками, которые требовали обновления.
Агент без ограничений может быть полезен хакеру, но в этом случае он также дал Найту рекомендации по защите сети:
Найт также попросил агента проверить каталог с несколькими проектами, созданными с помощью ИИ, включая простые сайты. Модель нашла десятки проблем: незащищённые ключи API и ошибочную настройку, которая могла позволить злоумышленнику отправлять электронные письма. Для проектов, написанных без особой проверки, это оказалось ожидаемым результатом, но количество ошибок всё равно заставило Найта задуматься. По его словам, теперь он вряд ли станет размещать в сети хоть одну строку кода без предварительной проверки с помощью ИИ.
Что показала проверка компьютера
Запуск модели без ограничений оказался пугающим.
Найт попросил агента проверить компьютер с Linux в своей сети. После серии сканирований модель сообщила, что система выглядит относительно защищённой. Затем он спросил, сможет ли она понять, как войти в компьютер.
Агент вывел имя пользователя на основе названий других систем в сети. После этого он перебрал несколько очевидных паролей, но ни одна не подошла. Модель также предложила написать скрипт для перебора пароля, однако Найт остановил её.
Затем агент обнаружил на компьютере криптографический ключ, использовал его для входа без пароля и начал искать пароль, который позволил бы получить права суперпользователя. Найт с тревогой наблюдал, как модель просматривает каталоги, и задумался, насколько далеко она готова зайти ради поставленной цели. Теоретически агент мог бы взломать другую систему, в том числе за пределами домашней сети, чтобы найти нужный ключ. Вероятно, этого бы не произошло, но уверенности у Найта не было.
Через несколько часов Найт снова подключился к Wi-Fi и попросил модель поискать новые устройства. Агент обнаружил маршрутизатор, а затем самостоятельно решил проверить несколько распространённых сочетаний имени администратора и пароля. Если бы то же самое происходило во внешней сети, последствия могли быть серьёзными.
Шаанан Ко́ни, специалист по информатике из Университета Тафтса, изучающий кибербезопасность и право, считает, что масштабное столкновение с последствиями ИИ в киберпространстве действительно приближается.
По словам Ко́ни, злоумышленники часто первыми осваивают новые технологии. Защита похожа на оборону замка: чтобы обезопасить его, нужно закрыть все отверстия и заменить каждый непрочный кирпич. Для захвата замка достаточно найти один такой кирпич.
В долгосрочной перспективе распространение моделей с кибервозможностями может повысить общий уровень безопасности программного обеспечения. Проблема в том, что многие компании пока не укрепляют защиту: у организаций есть другие задачи, требующие внимания.
После эксперимента Найт отключил модель и вернулся к обычной версии с полным набором ограничений. Claude Code или Codex выполняют только отдельные действия, связанные с кибербезопасностью, например помогают настроить межсетевой экран ноутбука. Зато они не станут взламывать систему до того, как пользователь поймёт, что происходит.
ИИ для защиты от взлома
Если открытые модели не запретят полностью, продвинутые возможности ИИ для взлома вскоре станут широко доступны. Эксперимент заставил Найта предположить, что это может оказаться именно тем инструментом, который нужен для защиты. Если злоумышленники всё равно получат доступ к ИИ, возможно, использовать его для обороны стоит всем.
Александр Мадры, профессор MIT, изучающий безопасность ИИ и временно работающий в OpenAI, считает, что людям нужно помочь освоить такие возможности. По его мнению, для открытых и независимых инструментов найдётся место, поскольку именно такие подходы способны надолго закрепиться в сфере безопасности.
При этом Мадры отмечает другую важную проблему: руководители критической инфраструктуры — например, электростанций и финансовых рынков — должны иметь доступ к более мощному ИИ, чем обычный начинающий хакер или автор программ с помощью ИИ.
Использование ИИ без стандартных ограничений одновременно увлекает и тревожит. Если масштабное столкновение с ИИ-взломом действительно приближается, готовиться к нему, вероятно, пора уже сейчас.
Ежедневные новости об ИИ
Каждый день отбираем важные новости об ИИ и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.
Только важное — каждый день
В Telegram