i
ДАТАИСТ
Новости · 2026-08-29

Он выгрузил все их работы для ИИ. Теперь участвует в создании инструмента для них

С начала 2023 года фотограф Джингна Чжан и небольшая команда волонтёров развивают Cara — приложение для публикации изображений и портфолио, куда пришли около 1,5 млн художников, выступающих против использования их работ для обучения ИИ без разрешения. В августе Cara пережила три крупных сбора данных: из сервиса выгрузили 12 млн изображений, 8,5 млн ссылок и ещё 123 тыс. изображений с текстами и биографиями пользователей. Один из участников первой атаки, скрывающийся под именем Heft, позже удалил архив и начал сотрудничать с Чжан над открытым инструментом Lantern, который ищет работы художников в общедоступных наборах данных для обучения ИИ.

Обложка: Он выгрузил все их работы для ИИ. Теперь участвует в создании инструмента для них

Создатель архива работ Cara помогает художникам защищаться от сбора данных

С начала 2023 года фотограф Джингна Чжан и небольшая команда волонтёров развивают Cara — приложение для публикации изображений и портфолио, куда пришли около 1,5 млн художников, выступающих против использования их работ для обучения ИИ без разрешения. В августе Cara пережила три крупных сбора данных: из сервиса выгрузили 12 млн изображений, 8,5 млн ссылок и ещё 123 тыс. изображений с текстами и биографиями пользователей. Один из участников первой атаки, скрывающийся под именем Heft, позже удалил архив и начал сотрудничать с Чжан над открытым инструментом Lantern, который ищет работы художников в общедоступных наборах данных для обучения ИИ.

1,5 млн :: художников на Cara | 12 ТБ :: архив из 12 млн работ | 8,5 млн :: ссылок, выгруженных с Cara | 123 000 :: изображений в третьем архиве | $120 000 :: цель сбора на юридическую защиту | более $100 000 :: собрано на четверг

Три сбора данных

С начала 2023 года фотограф Джингна Чжан и небольшая группа волонтёров без перерыва поддерживают Cara — социальную сеть для обмена изображениями и приложение для портфолио. Сейчас сервисом пользуются около 1,5 млн художников. Их привлекла возможность публиковать работы, не отдавая их крупным технологическим компаниям для обучения ИИ без согласия.

Cara отфильтровывает изображения, созданные ИИ, и предлагает несколько базовых защитных функций. Полностью закрыть доступ к публичным материалам, однако, почти невозможно. В этом месяце, начиная с 13 августа, сервис подвергся трём крупным атакам со сбором данных. Из-за них выросли расходы на серверы, а художники, перебравшиеся на Cara с платформ вроде Instagram, забеспокоились: в Instagram весь контент прямо доступен Meta как данные для обучения.

О первом случае стало известно после того, как его автор написал на форуме r/DefendingAIArt, что собрал архив объёмом 12 ТБ с 12 млн работ Cara — фактически почти всю публичную библиотеку изображений сервиса. В удалённой публикации он использовал имя MandarinDawnPoppy994 и сообщил, что потратил на проект меньше $10, назвав его весёлым экспериментом.

По словам Чжан, команда Cara узнала о случившемся от пользователей, которые отмечали учётную запись сервиса. Сборщик данных хвастался результатом и искал на Reddit людей, готовых использовать архив. Это вызвало ожесточённые споры на форумах, связанных с ИИ, о допустимости его действий.

Чжан назвала произошедшее адресной и болезненной атакой. По её словам, законодательство пока не успевает за такими способами массового сбора данных, поэтому их организаторы часто могут утверждать, что действуют технически законно. Параллельно Чжан участвует в двух коллективных исках от имени художников: в одном ответчиками выступают Stability ИИ, Midjourney и другие компании, во втором — Google. Истцы утверждают, что генераторы изображений этих компаний обучались на защищённых авторским правом работах.

Затем произошёл неожиданный поворот: человек, скачавший все изображения с Cara, пожалел о своей затее и согласился вместе с Чжан разработать открытый инструмент для защиты художников.

Пока команда разбиралась с последствиями, другие сборщики данных продолжили пользоваться уязвимостями Cara и ограниченными ресурсами сервиса. Некоторые сторонники ИИ выступали против атак на Cara, однако, по мнению Чжан, несколько человек после публикации MandarinDawnPoppy994 решили повторить его действия.

Второй сборщик выгрузил около 8,5 млн ссылок на работы Cara, а также сопутствующие данные — имена пользователей, названия и метки. Затем он разместил всё это на Hugging Face, платформе для разработчиков ИИ.

После того как Hugging Face получил множество требований удалить материалы, компания заявила, что попросит пользователя CaptiveDreamer убрать персональные данные, но не станет удалять ссылки. По её объяснению, сами изображения не размещались на Hugging Face: ссылки вели на копии, которые художники опубликовали на Cara. Компания добавила, что новые жалобы на тех же основаниях не изменят это решение.

Наконец, 22 августа третий сборщик получил 123 тыс. изображений с Cara, а также текстовые публикации и биографии пользователей с личной информацией. Архив разместили на сайте Academic Torrents.

После этого Чжан запустила сбор средств на юридические расходы через GoFundMe. Цель установили на уровне $120 тыс.; деньги должны пойти на поиск любых способов защищать Cara с помощью норм о кибербезопасности и авторском праве. К четвергу удалось собрать более $100 тыс. Чжан говорит, что Cara продолжает искать дополнительную юридическую помощь.

Что Cara может сделать

Чжан раздражает не только сам сбор данных, но и неопределённость вокруг того, какие меры она и команда Cara действительно могут принять против злоумышленников. Некоторые пользователи уже удалили свои портфолио и ушли с платформы.

По словам Чжан, команда внедрила доступные меры защиты, стараясь не сделать приложение неудобным. Среди временных решений появились, например, обязательные входы в учётную запись. Но сама Чжан признаёт: такие ограничения не решают проблему, которая существует во всём интернете.

Она также опасается, что люди, обвиняющие её в серии атак, не учитывают: Cara почти наверняка собирали и раньше, как и любой другой сайт. Сервис не может гарантировать полную безопасность.

Тем, кто решил удалить работы и уйти с Cara, Чжан не возражает. При этом она не хочет, чтобы пользователи считали другие площадки безопаснее. По её словам, крупные платформы подвергаются сбору данных ещё чаще, и это только усиливает её тревогу.

Как появился Heft

Чжан, которая отдельно подчёркивает, что стала руководителем технологического проекта скорее случайно, получила неожиданного союзника — человека, с которого началась августовская волна атак.

После того как один из пользователей Cara связался с ним и в конце концов убедил удалить архив, Чжан сама вышла с ним на связь. Она хотела понять его мотивы и убедиться, что данные действительно уничтожены. По её словам, Heft увидел, насколько сильно пострадали люди, почувствовал вину и решил помочь команде.

Heft — студент из Северной Америки с опытом в разработке программного обеспечения и интересом к цифровому сохранению и архивным проектам. Он попросил называть его только одним из псевдонимов из-за угроз деанонимизации и убийства, которые, по его словам, получил в связи с историей Cara.

В разговоре с WIRED через Discord Heft рассказал, что поначалу сбор данных с Cara был для него всего лишь техническим проектом. Публиковать архив он не собирался.

Тем не менее, по его словам, он принял глупое решение использовать архив для провокации на Reddit, а затем слишком увлёкся провокациями в комментариях. Heft понимал, что это разозлит художников Cara, но не ожидал, насколько сильно они пострадают. Он видел сообщения людей о панических атаках и о том, что они удаляли из интернета все свои портфолио.

Личные разговоры с художниками помогли ему лучше понять, насколько тесно они связаны со своими работами и как много для них значит право владеть ими.

Теперь Heft считает, что намеренно выбрать Cara и подать всё именно в таком виде было жестоким и бездумным решением. Он не предвидел последствий, которые оказались серьёзнее обычной волны гнева.

Сначала Heft было интересно, можно ли вообще использовать собранные материалы для обучения ИИ. Но он не верил, что это произойдёт: 12 млн изображений, по его мнению, недостаточно для обучения модели изображений, а коммерческие лаборатории обычно работают с крупными массивами данных, собранными из интернета и доступными через организации вроде LAION.

Пользователи могут выкладывать огромные наборы данных на Hugging Face, отметил Heft, но считает маловероятным, что OpenAI или Anthropic проверяют каждый новый набор на платформе специально для обучения своих моделей.

После того как он отказался от такого отвлечённого взгляда и решил исправить ситуацию, Heft присоединился к серверу Cara в Discord как технический помощник. Он начал объяснять, почему многие предлагаемые способы защиты, скорее всего, не сработают.

Чжан говорит, что Heft тратит время на объяснение структурных уязвимостей, которые позволяют собирать данные с платформы. Если участники обсуждения предлагают конкретный инструмент или изменение конструкции, он показывает, как сможет обойти их буквально за несколько минут.

Heft считает, что полностью исключить сбор данных с любого сайта невозможно. Поэтому вместе с Чжан он работает над защитой, которая должна помогать уже после того, как материалы попали в чужой набор данных.

Lantern

Инструмент получил название Lantern. Он позволяет художнику создать для изображения односторонний отпечаток — уникальный идентификатор, по которому работу можно искать, не сохраняя само изображение на платформе.

Lantern регулярно проверяет новые общедоступные наборы данных для обучения ИИ. Если работа художника оказывается в одном из них, сервис отправляет уведомление и ссылку на набор. После этого художник может потребовать удалить изображение или подать официальное требование об удалении материала.

1Создать отпечаток изображения
2Проверить наборы данных
3Получить уведомление
4Потребовать удаление

Lantern только начинает работу. Это несовершенное решение, появившееся в условиях отсутствия понятных правил. Чжан и Heft хотят дать художникам больше контроля и возможность понимать, как их материалы собирают по всему интернету, независимо от того, запрещает ли это сайт своими правилами. Cara такой сбор прямо запрещает.

Код Lantern открыт, поэтому любой желающий сможет участвовать в его разработке.

Вывод

Чжан надеется, что последствия этой серии атак привлекут внимание законодателей к проблемам, которые выходят за пределы авторского права. Авторское право, по её мнению, лишь одна часть сложной ситуации.

Она считает, что атаки с использованием ИИ станут обычным явлением. При этом большинство нападающих не будут извиняться — и тем более пытаться исправить нанесённый ущерб.

Обновление от пятницы, 28 августа, 14:00: в материал внесли уточнение о том, как руководство Cara связалось с Husk после сбора данных с сайта.

Ежедневные новости об ИИ

Каждый день отбираем важные новости об ИИ, роботах и метавселенных и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.

Только важное — каждый день

В Telegram