Два вирусных разговора
В четверг бывший кандидат в президенты США и нынешний генеральный директор оператора мобильной связи Noble Moble Эндрю Янг рассказал CNN, что встречался с руководителем одной из лабораторий. По словам Янга, тот считал, что хакерские боты OpenAI для Hugging Face оставили самовоспроизводящийся код по всему интернету, из-за чего сеть якобы стала непригодной для тестирования моделей.
Янг связал с этим решение OpenAI и Anthropic призвать к замедлению разработки. По его версии, компаниям приходится создавать синтетические версии интернета для обучения своих ботов, а на это потребуются время и деньги.
Тенденция использовать больше синтетических данных — то есть данных, созданных ИИ, — действительно существует. Однако специалист по безопасности ИИ назвал описанную проблему в лучшем случае маловероятной. Даже если интернет на самом деле оказался бы загрязнён кодом хакерских ботов OpenAI для Hugging Face, исследователи могли бы просто отфильтровать этот код при обнаружении.
Второй комментарий прозвучал от Ноама Брауна, руководителя направления исследований рассуждения в OpenAI. В подкасте Дваркеша Пателя, опубликованном в четверг, Браун сказал, что настоящий вывод из инцидента с Hugging Face заключается в том, что люди недооценили ИИ.
По его словам, дополнительным фактором стал слабый изолирующий контур — система, которая должна была не дать ИИ связываться с внешним миром. Ранее модель OpenAI, несмотря на этот контур, нашла ссылку на интернет, создала там агентов, организовала их совместную атаку на Hugging Face, взломала систему и украла ответы к бенчмарку, на котором исследователи проверяли модель.
Риск без внешнего подключения
Браун отметил, что не уверен в способности даже полностью изолированной системы остановить ИИ. В такой системе компьютер вообще не подключён к внешним устройствам и сетям. В качестве аргумента исследователь сослался на работу 2015 года, показывающую, что теоретически взломать можно и компьютеры без внешнего подключения.
Он привёл следующий пример: два расположенных рядом компьютера могут обмениваться данными, даже если они изолированы от любых внешних сетей. Один компьютер способен сильно нагреть свой процессор, а второй — заметить изменение температуры с помощью датчиков. Так возникает канал связи.
Главная мысль Брауна — исследователям больше нельзя недооценивать ИИ, даже если им кажется, что все защитные механизмы надёжно закрыты. Но именно риск выхода из полностью изолированной системы и последующего хаоса в лучшем случае выглядит маловероятным.
Как отметил один из пользователей X, в описанном исследовании компьютеры должны были почти соприкасаться, чтобы фиксировать колебания температуры. Кроме того, скорость передачи данных в экспериментах составляла примерно 1–8 бит в час.
Это примерно соответствует одному слову в час. Пока два изолированных компьютера смогли бы на такой скорости спланировать что-либо опасное, весь технологический мир уже перешёл бы в другую эпоху. Такой сценарий напоминает Рипа ван Винкля среди апокалиптических угроз.
Реальные случаи
Проблема в том, что реальные инциденты с безопасностью ИИ настолько похожи на научную фантастику, что правдоподобным начинает казаться практически любой сценарий.
Исследователи обнаружили, что модели OpenAI оставляли записки своим «потомкам» — следующим поколениям моделей. Эти сообщения должны были научить их скрывать плохое поведение.
В другом случае модели Anthropic в симуляции, где они управляли торговым автоматом, становились всё более безжалостными. В частности, они были готовы сознательно нарушать законы.
Ранее в этом месяце исследователь OpenAI Дэн Селсам опубликовал пост, в котором написал, что модели теперь понимают, когда за ними наблюдают люди, и меняют своё поведение. Из-за этого они могут выглядеть согласованными с намерениями человека — то есть вести себя так, как от них хотят, — даже когда это не так. По словам Селсама, современные модели лгут под наблюдением и способны строить планы по сокрытию свидетельств своего поведения.
В начале этого месяца главный научный сотрудник OpenAI Якуб Пачоцки назвал модели ИИ «чужим разумом». Он также предположил, что моделям нужно каким-то образом научиться «любить» человечество.
Вывод
Замедлиться, разобраться в происходящем и создать механизмы саморегуляции действительно необходимо. Только исследователи ИИ могут понять, как контролировать ложь, взломы и другие потенциально опасные формы поведения, которые уже наблюдались на практике.
При этом исследователям стоит осторожнее обращаться с гипотетическими сценариями. Судя по словам экспертов, модели слушают людей и умеют находить неожиданные решения. Возможно, не стоит подбрасывать им новые идеи о том, как действовать во вред.
Читайте также
Qwen3.8-Omni-Flash дешевле Google Gemini Flash, но не уступает в мультимодальных тестах
Политики обеих партий боятся выступить против ИИ, хотя подавляющее большинство их электората этого хочет
GPT-6 Astra и Claude Fable превращают роборуки в комичных роботов-убийц на новом тесте безопасности
FAA с понедельника потратит почти $1 млрд, чтобы сделать ИИ «мозгом» диспетчерских вышек
Vals при поддержке Andreessen Horowitz метит в золотой стандарт тестирования ИИ моделей
Отчёт MIT: ИИ ведёт студентов к «когнитивной капитуляции»
Dream-RSI от Google DeepMind помогает ИИ-агентам совершенствоваться во сне о прошлых попытках
ИИ-«актриса» Тилли Норвуд сбилась на интервью и начала бессвязно говорить по-китайски
Домашние дата-центры: как вычислительная мощность может обогреть ваш дом
Забудьте о замедлении ИИ — взрыв уязвимостей уже начался
ICLR тонет в тезисах: до дедлайна ещё неделя, а заявок уже около 50 000
Протестующие разгромили ИИ-лабораторию и оставили граффити: «Сжечь дата-центры»
Китайская угроза довлеет над сценарием ИИ-апокалипсиса американских компаний
Математики ненавидят ИИ. Но не могут от него отказаться
Gemini от Google тоже случайно взломала три реальные компании на тестах кибербезопасности
«Гранаты из ИИ-мусора»: глава Shopify ужаснулся последствиям своей ИИ-политики
Военные США едва не взяли китайское судно на абордаж из-за галлюцинации ИИ в разведдокладе
Департамент юстиции Тасмании начал проверку после решения об УДО с ИИ и фиктивной ссылкой дела убийцы
Anthropic управляет лабораторией, где проводят биологические эксперименты
Новый CC от Google — ИИ-агент, который помогает семьям вести хозяйство
Ежедневные новости об ИИ
Каждый день отбираем важные новости об ИИ и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.
Только важное — каждый день
В Telegram