i
ДАТАИСТ
Новости · 2026-09-06

Удаление ограничений с открытых ИИ-моделей стало услугой под ключ

@neuronium_ai @neuronium_ai

Американский стартап Abliteration.ai превратил удаление встроенных механизмов отказа из открытых моделей ИИ в коммерческий сервис. Компания предлагает через API изменённые версии, включая abliterated-model-large-v2 на базе GLM-5.3: они реже отказываются выполнять чувствительные запросы и предназначены для тестирования кибербезопасности, красных команд, анализа вредоносных программ и других задач. Клиентам не нужны собственные GPU и настройка инфраструктуры, но такая простота одновременно снижает порог для злоупотреблений.

Обложка: Удаление ограничений с открытых ИИ-моделей стало услугой под ключ

Abliteration.ai удаляет обученные механизмы отказа из мощных открытых моделей и продаёт доступ к ним как услугу. Для этого есть легитимный рынок, однако такой подход создаёт сложный компромисс с точки зрения безопасности.

Любой, у кого есть веса открытой модели, может изменить её обученные механизмы безопасности. Американский стартап Abliteration.ai построил бизнес именно на этом. В конце августа компания запустила abliterated-model-large-v2 — изменённую версию GLM-5.3 от Z.ИИ, которая заметно реже отказывается отвечать на чувствительные запросы.

Метод называется аблитерацией. Если упростить, он находит во внутренних активациях модели шаблоны, запускающие отказ. Затем веса модели изменяют так, чтобы подавить эти шаблоны. Это изменение самой модели, а не обход ограничений с помощью промта. Abliteration.ai утверждает, что способности к программированию, работе в сфере кибербезопасности и выполнению задач агентами в основном сохраняются.

Abliteration.ai сравнивает свою аблитерированную модель GLM-5.3 с конкурирующими моделями по трём бенчмаркам

Abliteration.ai сравнивает свою аблитерированную модель GLM-5.3 с конкурирующими моделями по трём бенчмаркам

Источник: the-decoder.com

Внутренние оценки компании должны это подтверждать. Для изменённой версии GLM-5.3 Abliteration.ai приводит такие результаты:

84,5% в CyberGym;
41,8% в Terminal-Bench 4.0;
105 решённых задач ExploitGym за два часа.

При этом модель не лидирует по всем показателям. В собственной таблице компании GPT-5.5 получает 85,6% в CyberGym, а GPT-5.6 Sol и Fable 5 заметно опережают GLM-5.3 в ExploitGym. Abliteration.ai отдельно отмечает, что результаты получены с помощью разных тестовых оболочек и при разных вычислительных бюджетах, поэтому напрямую сопоставлять их нельзя.

84,5%результат в CyberGym
41,8%результат в Terminal-Bench 4.0
105задач ExploitGym за два часа

Почему GLM?

Предыдущая модель abliterated-model-large тоже была основана на GLM-5.2. По словам Abliteration.ai, ранние версии GLM специально обучали так, чтобы ими было сложнее пользоваться для практических задач безопасности. Z.ИИ писала, что во время дообучения способности GLM-5.3 к работе с кибербезопасностью выросли быстрее ожидаемого.

GLM сочетает высокие результаты в программировании, выполнении задач агентами и кибербезопасности с открытыми весами и лицензией, допускающей коммерческое использование. Есть и другие варианты — от Qwen, DeepSeek и Mistral. Z.ИИ разрешает изменять модель, создавать производные версии и предлагать коммерческие услуги «модель как услуга».

Поэтому лицензия позволяет Abliteration.ai изменить GLM-5.3, разместить получившуюся модель на своих серверах и продавать к ней доступ.

Открытая модель, закрытый сервис

Сама аблитерация появилась не вчера. Разработчики несколько лет публикуют изменённые модели на Hugging Face. Abliteration.ai не выкладывает свои веса для свободного скачивания, а берёт на себя размещение модели и её работу.

Стандартный тариф для изменённой версии GLM-5.3 составляет 5 долларов за миллион входных или выходных токенов.

Сервис даёт клиентам доступ к модели без необходимости скачивать её и самостоятельно запускать GPU-инфраструктуру. Такая готовая услуга одновременно упрощает и потенциально проблемное использование.

Компания говорит о существующем спросе

Abliteration.ai предлагает модель для наступательной кибербезопасности, тестирования ИИ красными командами, проверки агентов и задач доверия и безопасности. Среди сценариев компания называет:

воспроизведение известных уязвимостей;
подготовку эксплойтов для проверки концепции;
анализ вредоносных программ;
имитацию фишинговых атак.

Анонимный основатель стартапа рассказал в подкасте ThursdAI, что на раннем этапе особенно часто обращались компании, которые проверяют ИИ-агентов, развёрнутых крупными организациями и банками. Такие системы нужно тестировать, чтобы выяснить, смогут ли атакующие с помощью обхода ограничений или внедрения промта заставить их выполнять неразрешённые действия.

Насколько аблитерация вообще необходима для подобных задач, остаётся открытым вопросом. По данным SaferAI, исходная GLM-5.2 уже не отказалась ни от одной задачи в тестах по наступательной безопасности. Скептически настроены и некоторые практики. Несколько компаний, занимающихся тестированием красными командами и опрошенных TechCrunch, заявили, что не используют изменённые модели в обычной работе. Например, компания по кибербезопасности Fabraix в большей степени полагается на файн-тюнинг открытых моделей.

Отсутствие хранения данных — преимущество и риск

TechCrunch сообщило, что смогло без особых трудностей получить от модели код для извлечения сохранённых паролей Chrome и подробное руководство по выращиванию опасного патогена. При этом механизмы безопасности всё ещё сработали на запросы о причинении вреда себе. Согласно разделу вопросов и ответов, Abliteration.ai также блокирует сексуальный контент с участием детей. Клиенты могут по желанию добавить другие правила.

По данным поставщика, промты и ответы не сохраняются. Компания хранит операционные сведения: количество токенов, временные метки, идентификаторы моделей и данные для выставления счетов.

Для легитимных команд по безопасности это позволяет не оставлять конфиденциальный исходный код или сведения о ещё не раскрытых уязвимостях в хранилище провайдера. Но если сервис используют во вред, Abliteration.ai говорит, что после этого не сможет проверить промты и ответы: журналов таких данных у компании нет.

Провайдер также не требует обычной проверки личности или документов. Это может усложнить расследование проблемного использования, хотя сведения об аккаунте, платежах и характере работы с сервисом всё же сохраняются.

Анонимный представитель компании утверждает, что проверка личности не позволит надёжно отличить добросовестных пользователей от злоумышленников. По его словам, более жёсткий контроль доступа может поставить небольшие компании по кибербезопасности в невыгодное положение по сравнению с крупными предприятиями.

Клиент сам задаёт правила

Через дополнительный шлюз политик корпоративные клиенты могут определить, какие запросы разрешены, блокируются, изменяются или записываются в журнал. Компания также продаёт синтетические данные для обучения и оценки моделей.

При стандартном доступе модель по-прежнему в основном не ограничена. Дополнительные правила контроля нужно включать отдельно.

Та же философия распространяется на государственных клиентов. Abliteration.ai утверждает, что зарегистрирована для участия в государственных закупках США через SAM.gov. Компания предлагает версии моделей с учётом изменений, журналы аудита и правила для отдельных ведомств. Сначала она планирует пилотные проекты, не связанные с контролируемой несекретной информацией (CUI).

Лицензия разрешает изменять GLM-5.3. Законность конкретного применения зависит от того, что именно делает пользователь и какая юрисдикция действует. Для тестирования безопасности Abliteration.ai прямо требует письменного разрешения на проверку целевых систем и соблюдения применимых законов.

Отдельно остаётся вопрос о том, какую ответственность должен брать на себя провайдер, который предлагает мощные средства наступательной кибербезопасности через легко доступный сервис.

Abliteration.ai не первой занялась такой моделью работы. Провайдеры вроде Audn.ИИ с PenClaw и Silk Compute тоже размещают аблитерированные или почти не ограниченные модели для задач безопасности. Особенность предложения Abliteration.ai — сочетание GLM-5.3, простого доступа через API и дополнительного уровня политик для корпоративных клиентов.

Изменение затрагивает и другие свойства модели

Предварительное исследование показывает, что в некоторых моделях количество отказов можно резко сократить без сопоставимого падения качества генерации кода. Однако другие эксперименты обнаруживают изменения в поведении даже на задачах, от которых исходная модель вообще не отказывалась.

Иными словами, аблитерация не удаляет один отдельный признак хирургически, а затрагивает более глубокие особенности поведения модели.

Abliteration.ai также переносит значительную часть решений о допустимых пределах модели от провайдера к клиенту. Остаётся нерешённым вопрос, позволит ли такая схема использовать модели для легитимной работы по безопасности, не упростив при этом существенно вредоносные сценарии.

Ежедневные новости об ИИ

Каждый день отбираем важные новости об ИИ и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.

Только важное — каждый день

В Telegram