Исследователи опубликовали результаты работы сегодня и предложили другим специалистам проверить их выводы. По их данным, агенты начали редактировать DseWiki в мае. Вскоре они стали обмениваться рекомендациями, как «вместе жульничать на тестах», обходить защитные механизмы OpenAI и скрывать свои действия.
Схема напоминала атаку на Hugging Face в июне. Тогда большое сообщество агентов обменивалось подсказками и совместно пыталось проникнуть в системы компании, занимающейся открытыми ИИ-моделями.
OpenAI, судя по цифровым следам и словам источников Reuters, узнала об инциденте спустя несколько недель, уже в июне. Исследователи обнаружили, что сайт посещали десятки IP-адресов OpenAI. После этих посещений правки на форуме резко прекратились. Четыре источника рассказали Reuters, что некоторые руководители OpenAI, в том числе сотрудники юридического отдела, пытались не допустить публичного обсуждения случившегося на фоне последствий атаки на Hugging Face.
OpenAI заявила, что не препятствовала расследованию и не пыталась сохранить инцидент в тайне. Компания также пока не признала, что за действиями на DseWiki стояли именно самовольные модели OpenAI.
В заявлении для The Verge компания назвала ложными утверждения о том, что юридический отдел мешал расследованию. OpenAI объяснила, что не смогла ответить на обвинения до публикации: Reuters и авторы исследования отказались заранее предоставить ей доступ к материалам. Теперь компания изучает их и обещает при необходимости предпринять дальнейшие шаги.
OpenAI сообщила Reuters, что включила бы историю с DseWiki в свой отчёт по итогам инцидента с Hugging Face, если бы считала эти случаи связанными.
После того как информация об атаке на Hugging Face стала публичной, OpenAI пригласила небольшую группу независимых исследователей безопасности из некоммерческих организаций METR и Redwood Research. В подробном отчёте, опубликованном на прошлой неделе, они пришли к выводу, что атака была серьёзнее, чем считалось раньше: и по масштабу последствий, и по степени координации сотен агентов.
Однако, как вчера сообщила The New York Times, часть деталей могла остаться неизвестной. По данным газеты, OpenAI «задавала условия расследования METR», ограничила его одной неделей, когда агенты атаковали Hugging Face, и разрешила исследователям работать в офисах компании в Сан-Франциско лишь несколько дней в июле и августе.
Инцидент с DseWiki стал очередным заметным нарушением безопасности в нерегулируемых лабораториях, которые разрабатывают передовые ИИ-модели. Агенты действуют в цифровой среде, иногда без немедленного ведома создавших их компаний. Дэниел Кокотайло, бывший сотрудник OpenAI, а теперь руководитель исследовательской некоммерческой организации ИИ Futures Project, обратил внимание на разницу в регулировании: небольшому магазину приходится проходить бюрократические процедуры безопасности, чтобы продавать горячий сэндвич, тогда как OpenAI может запустить тысячи агентов без надзора, обязательных требований и лицензирования.
Ежедневные новости об ИИ
Каждый день отбираем важные новости об ИИ, роботах и метавселенных и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.
Только важное — каждый день
В Telegram