Он скачал всё искусство Cara, а потом стал защищать художников
С начала 2023 года фотограф Jingna Zhang и небольшая команда волонтёров развивают Cara — социальную сеть и приложение-портфолио, куда пришли около 1,5 млн художников. Их объединяет протест против несанкционированного использования работ для обучения ИИ. Но 13 августа платформа пережила три крупные выгрузки данных: первая охватила почти всю публичную библиотеку Cara — 12 млн изображений объёмом 12 ТБ, вторая собрала 8,5 млн ссылок и метаданные, третья — 123 тыс. изображений и пользовательские сведения. Анонимный автор первой выгрузки раскаялся, удалил архив и вместе с Zhang начал создавать открытый инструмент Lantern, который ищет работы художников в общедоступных наборах данных для обучения ИИ.
С начала 2023 года фотограф Jingna Zhang и небольшая команда волонтёров поддерживают Cara — социальную сеть и приложение для публикации портфолио. За это время к платформе присоединились около 1,5 млн художников. Их привлекло то, что Cara выступает против несанкционированного использования работ для обучения ИИ и позволяет показывать искусство без передачи его крупным технологическим компаниям для эксплуатации.
Знакомьтесь: фотограф, стоящий за приложением для социальных сетей для всех, кому надоел ИИ Meta
Источник: wired.com
Cara фильтрует изображения, созданные ИИ, и предлагает инструменты защиты. Среди них — Glaze, который маскирует стиль изображения, попавшего к сборщикам данных, чтобы затруднить имитацию. Но полностью предотвратить скачивание работ почти невозможно. Только в этом месяце, начиная с 13 августа, Cara подверглась трём крупным выгрузкам данных. Из-за них выросли расходы на серверы, а художники, перебравшиеся на платформу с Instagram, забеспокоились ещё сильнее: опубликованный там контент прямо доступен Meta для использования в качестве данных обучения.
Первая атака стала публичной после того, как её автор выложил в разделе Reddit r/DefendingAIArt архив объёмом 12 ТБ. В нём находились 12 млн работ с Cara — фактически почти вся публичная библиотека изображений платформы. Пользователь MandarinDawnPoppy994 написал в уже удалённом посте, что это был «весёлый проект», а вся операция обошлась ему менее чем в $10.
Zhang рассказала WIRED, что команда узнала о выгрузке от самих пользователей, которые отмечали аккаунт Cara. По её словам, сборщик данных хвастался своей находкой и призывал других пользователей присоединиться, чтобы сделать что-либо с этим набором. Это вызвало бурные споры на форумах, посвящённых ИИ, о допустимости его действий.
Zhang считает произошедшее целенаправленной и болезненной атакой. Она также отметила, что законодательство пока не успевает за подобными способами массового сбора данных, поэтому сборщики нередко могут считать свои действия технически законными. Параллельно Zhang участвует в двух коллективных исках от имени художников: один направлен против Stability ИИ, Midjourney и других компаний, второй — против Google. В обоих случаях утверждается, что генераторы изображений обучались на защищённых авторским правом работах.
Позже выяснилось, что человек, скачавший всё искусство с Cara, пожалел о своём поступке и согласился вместе с Zhang разработать открытый инструмент для защиты художников.
Тем временем другие сборщики продолжили пользоваться уязвимостями Cara и ограниченными ресурсами команды. Хотя некоторые сторонники ИИ выступали против атак на платформу, Zhang считает, что действия MandarinDawnPoppy994 могли подтолкнуть других к похожим «копирующим» атакам.
Вторая выгрузка собрала около 8,5 млн ссылок на работы с Cara, а также метаданные: имена пользователей, названия и теги. Всё это загрузили на Hugging Face — платформу для разработчиков ИИ.
После того как Hugging Face получила множество требований удалить данные, компания заявила, что попросит пользователя CaptiveDreamer убрать персональные метаданные. Однако удалить сами веб-адреса она отказалась: копий произведений на Hugging Face нет, а ссылки ведут на изображения, которые художники сами опубликовали на Cara. Компания также сообщила, что новые жалобы на тех же основаниях не изменят решение.
22 августа третий сборщик получил 123 тыс. изображений с Cara, а вместе с ними — текстовые публикации и биографии пользователей, содержавшие персональную информацию. Затем данные появились на сайте Academic Torrents.
После этого Zhang запустила на GoFundMe сбор средств на юридические расходы. Цель составила $120 тыс.; деньги должны были пойти на изучение различных способов защиты Cara с помощью законодательства о кибербезопасности и авторском праве. К четвергу удалось собрать более $100 тыс. Zhang также сообщила, что Cara ищет дополнительную юридическую помощь.
Что может сделать Cara
Zhang расстраивает не только сам сбор данных, но и неопределённость вокруг того, какие меры она и команда Cara действительно способны принять против злоумышленников. Некоторые пользователи уже удалили портфолио и ушли с платформы.
По словам Zhang, команда внедрила доступные меры защиты, стараясь не сделать сервис неудобным. Среди временных решений появились, например, обязательные входы в аккаунт. Но сама Zhang признаёт: это не решает проблему, которая существует во всём интернете.
Она также опасается, что люди, обвиняющие её в серии атак, не учитывают: Cara почти наверняка скачивали и раньше, как и любой другой сайт. Платформа не может гарантировать полную безопасность.
Уход пользователей Zhang готова принять, если так им спокойнее. Но она не хочет создавать впечатление, будто на другой платформе их работы будут защищены лучше. По её словам, крупные сервисы скачивают ещё чаще, и от этого ситуация кажется ей ещё тяжелее.
Неожиданный союзник
Zhang отдельно напоминает WIRED, что не собиралась становиться технологическим основателем — это произошло случайно. Но теперь в борьбе с выгрузками у неё появился неожиданный союзник: человек, который запустил августовскую волну атак.
Она связалась с ним, добилась извинений и удаления набора данных. По словам Zhang, он увидел, насколько сильно пострадали люди, и решил помочь команде.
Он использует псевдоним Heft и учится в Северной Америке. У него есть опыт в разработке программного обеспечения, а также интерес к цифровому сохранению и архивным проектам. Из-за угроз деанонимизации и убийства, которые, по его словам, последовали после истории с Cara, он попросил WIRED называть его только одним из сетевых имён.
В разговоре через Discord Heft рассказал, что изначально скачивание данных с Cara было для него всего лишь техническим проектом. Публиковать архив он не планировал.
Позже он всё же решил использовать набор, чтобы спровоцировать пользователей Reddit, и, по его словам, увлёкся провокациями в комментариях. Heft понимал, что это вызовет раздражение у художников с Cara, но не ожидал, насколько тяжёлой окажется реакция. Он увидел сообщения о панических атаках и о том, что люди удаляли свои портфолио из интернета.
В личных разговорах с художниками Heft лучше понял, насколько тесно их работы связаны с ними самими и как много для них значит право владеть собственным творчеством.
Он признал, что сознательно выбрал Cara целью и жестоко, необдуманно представил результат в своей публикации. По его словам, он не учёл последствий, которые выйдут далеко за пределы обычного раздражения.
Сначала Heft хотел проверить, получится ли использовать эти данные для обучения ИИ. Однако он не верил, что 12 млн изображений действительно применят для обучения модели: для этого, по его мнению, такой объём недостаточен, а коммерческие лаборатории обычно используют крупномасштабные выгрузки из интернета, собранные организациями вроде LAION.
Пользователи могут загружать большие наборы данных на Hugging Face, отметил Heft, но считает крайне маловероятным, что OpenAI или Anthropic просматривают каждый новый набор на платформе, чтобы использовать его для обучения.
Что такое Lantern
Отказавшись от теоретических рассуждений и решив исправить ситуацию, Heft присоединился к серверу Cara в Discord в качестве технического помощника. Он начал разбирать, почему многие предложенные способы защиты, скорее всего, не сработают.
Zhang говорит, что Heft тратит время на объяснение структурных уязвимостей, из-за которых возможна массовая выгрузка данных. Когда в обсуждении появляется новый инструмент или вариант оформления, он показывает, как буквально за несколько минут сможет обойти такую защиту.
Heft убеждён, что сделать сайт полностью недоступным для сборщиков данных невозможно. Поэтому вместе с Zhang он работает над инструментом, который помогает обнаружить проблему уже после того, как данные были выгружены.
Lantern создаёт для изображения «односторонний отпечаток», не сохраняя саму работу на платформе. Инструмент регулярно проверяет новые общедоступные наборы изображений, созданные для обучения ИИ. Если работа художника оказывается в одном из них, он получает уведомление и ссылку на набор данных. После этого художник может потребовать удалить изображение или подать официальное требование о снятии материала.
Lantern только начинает работу и остаётся несовершенным обходным решением, появившимся в условиях отсутствия понятного регулирования. Zhang и Heft хотят дать художникам больше контроля и понимания того, как их материалы собирают по всему интернету, даже если правила сайта, как у Cara, прямо это запрещают. Поскольку Lantern распространяется с открытым исходным кодом, любой желающий может участвовать в разработке.
Zhang надеется, что последствия этой серии выгрузок привлекут внимание законодателей к вопросам, которые выходят за пределы авторского права. По её словам, авторское право — лишь одна часть сложной проблемы.
Она считает, что атаки на авторов с помощью ИИ станут повседневными. При этом в большинстве случаев нападавшие не будут извиняться и тем более пытаться исправить нанесённый ущерб.
Ежедневные новости об ИИ
Каждый день отбираем важные новости об ИИ, роботах и метавселенных и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.
Только важное — каждый день
В Telegram
