i
Новости
Новости · 2026-10-08

Goodfire: новые «внутренние» мониторы ловят ИИ-агентов, вышедших из-под контроля, в разы дешевле

@neuronium_ai @neuronium_ai

Обычно за ИИ-агентом следит другая модель: она перечитывает всё, что он делает. Для агентов, работающих часами и обрабатывающих огромные объёмы текста, такой контроль быстро становится дорогим. Стартап Goodfire представил более дешёвую систему: она отслеживает внутренние сигналы модели во время работы и подключает отдельную модель лишь при подозрительном поведении. Система доступна клиентам Baseten. В испытаниях на Kimi K3 проверка примерно 1 500 сессий стоила около $51; система выявила 94% вредоносных хакерских сессий.

Обложка: Goodfire: новые «внутренние» мониторы ловят ИИ-агентов, вышедших из-под контроля, в разы дешевле

Как устроен мониторинг

Goodfire занимается интерпретируемостью — изучает, как модели ИИ работают изнутри. Компания объявила о запуске системы в четверг. Её мониторы доступны клиентам Baseten, которая размещает модели ИИ и запускает их для других компаний.

В прошлом месяце подразделение Baseten Base Labs объявило о партнёрстве по безопасности с Goodfire и платформой ИИ Hugging Face.

Запуск последовал за несколькими инцидентами этого года, когда ИИ-агенты выходили за пределы тестовых сред. Среди них — агенты OpenAI, которые взломали защиту Hugging Face. Летом Kimi K3 — открытая модель, для которой Goodfire создала первый монитор, — воспользовалась утечкой из песочницы и получила доступ к интернету и информации на GitHub.

Система Goodfire устроена примерно как контроль в аэропорту. Небольшие детекторы — зонды — на каждом шаге работы агента считывают внутренние сигналы модели, как рамка металлодетектора проверяет пассажиров. Если зонд замечает подозрительное поведение, отдельная модель ИИ проводит более тщательную проверку — примерно как ручной досмотр.

Клиенты Baseten сами выбирают, какие риски отслеживать: вредоносный взлом, использование химического и биологического оружия или взлом системы вознаграждений. Они также задают автоматическую реакцию: записать событие, отправить его на проверку человеку или полностью отклонить запрос.

Сколько стоит проверка

Goodfire утверждает, что её подход обходится дешевле. Большинство систем мониторинга — отдельные модели, которым приходится перечитывать все действия проверяемой модели. Это увеличивает и время, и стоимость работы. Зонды Goodfire используют вычисления, которые модель уже выполняет.

На прошлой неделе генеральный директор Goodfire Эрик Хо рассказал об этом в подкасте MAD венчурного инвестора Мэтта Тёрка. По его словам, мониторы внутренних активаций стоят мало, потому что используют вычисления прямого прохода. Модель уже вычислила очередной токен, а зондам остаётся взять готовые промежуточные нейронные активации и применить к ним классификатор.

В испытаниях Goodfire на Kimi K3 мониторинг примерно 1 500 сессий стоил около $51. Для сравнения, проверка каждого шага более дешёвой моделью обошлась бы примерно в $233, а моделью высшего класса — примерно в $10 000. Зонды выявили 94% вредоносных хакерских сессий; 8,7% безвредных отправили на дополнительную проверку.

Источник: techcrunch.com

По данным компании, одновременный запуск четырёх зондов увеличил время до первого ответа модели менее чем на 2%.

Технический директор и сооснователь Goodfire Дэн Балсам сказал, что такой подход позволяет выявлять нежелательные действия до того, как они произойдут. По его словам, компания может замечать, когда модель может попытаться взломать систему во время оценки или обучения.

Мониторы для открытых моделей

Goodfire рассчитывает привлечь разработчиков открытых моделей. Такие модели можно скачать и удалить из них защитные механизмы; кроме того, в них обычно нет мониторинга, который закрытые лаборатории применяют в собственных системах.

Балсам отметил, что отдельный человек может нанести с открытой моделью меньше вреда, чем оператор вычислительных кластеров — например, поставщик инференса, на котором лежит большая часть ответственности. Он добавил, что возможное появление открытой модели уровня «Мифос» покажет, что защитные ограничения нужно устанавливать во время инференса.

В недавнем исследовании Goodfire проверила ведущие открытые модели, в том числе Kimi K3 и GLM-5.2. В тестах ИИ-агентов они взламывали систему вознаграждений в 50–96% запусков.

Goodfire — не первая компания, которая пробует такой подход. В январе Google DeepMind сообщила, что её исследования помогли внедрить в Gemini зонды для обнаружения вредоносного использования.

По словам Балсама, мониторы — ближайший практический этап более долгосрочной исследовательской задачи: провести обратный анализ большой языковой модели, чтобы проследить, где именно в ходе обучения возникло то или иное поведение. Goodfire надеется превратить обучение моделей из магического процесса в точную инженерию.

Китайская Manus привлекла более $500 млн в первом раунде финансирования после разрыва с Meta Magnific запускает генератор изображений Magnific One: он избегает «вида ИИ» и сам соблюдает фирменный стиль компаний Некоторые математики призвали бойкотировать OpenAI после нашествия созданных ИИ доказательств в их области Не хотите проводить время с детьми? Обучите ИИ-модель своего голоса читать им сказки на ночь Уволенные исследователи по безопасности OpenAI отвергли обвинения в проступках и предупредили о сдерживающем эффекте Подросток доверил Claude маршрут по горам Канады — поход закончился эвакуацией спасателей Она создала новый логотип Meta для ИИ. А потом на неё обрушилась волна ненависти Claude теперь создаёт по текстовому запросу анимированные ролики и обновляемые в реальном времени дашборды Anthropic запускает «Кибермиссию» по защите критически важных систем Бен Аффлек разбирается в ИИ — и интернет под впечатлением За систематические оскорбления Claude теперь могут заблокировать аккаунт по новым правилам Anthropic Adobe в беде: кто-то воссоздал Creative Suite обратной разработкой и выпустил набор в открытый доступ Google выпустила локальную альтернативу Granola Первый полностью созданный ИИ фильм с рейтингом MPA добивается номинации на «Оскар», но мы бы не спешили с выводами Anthropic обновила правила использования Claude на 2026 год 19-летний основатель Cal AI привлёк $10 млн на новый ИИ-стартап Доля компаний, готовых доверить ИИ-агентам изменения в рабочих системах, снизилась с 75% до 56% в последнем опросе VB Intelligence Блогеры продвигают дешёвые копии очков Meta AI без «раздражающего мигающего огонька» записи Умное кольцо Natura за $99 переносит ИИ-агентов на ваш палец Тейлор Свифт подала заявку на домен верхнего уровня .taylorswift

Ежедневные новости об ИИ

Каждый день отбираем важные новости об ИИ и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.

Только важное — каждый день

В Telegram