i
ДАТАИСТ
Новости · 2026-09-18

Руководитель Microsoft назвал сбор данных для ИИ «крупнейшей кражей труда в истории человечества» — рассекреченные материалы дела

@neuronium_ai @neuronium_ai

Нерассекреченные материалы по иску The New York Times к OpenAI и Microsoft показывают: руководители компаний признавали, что массовый сбор материалов для обучения ИИ может быть кражей и угрожает издателям. Документы описывают обход платных стен, создание наборов данных из миллионов веб-страниц и удаление уведомлений об авторских правах. По данным Microsoft, её ИИ-сервис Copilot снизил переходы на сайт The New York Times на 93% по сравнению с обычным поиском Bing, а наборы данных OpenAI содержали более 91 692 копий работ изданий.

Обложка: Руководитель Microsoft назвал сбор данных для ИИ «крупнейшей кражей труда в истории человечества» — рассекреченные материалы дела

В иске, который The New York Times подала против OpenAI и Microsoft три года назад, один из руководителей Microsoft в личной переписке назвал практику обучения ИИ «кражей». Руководители OpenAI, в свою очередь, писали, что продукты компании создают «экзистенциальную угрозу» издателям и журналистам, чьи материалы использовались для обучения моделей.

Новые материалы также описывают, как компании, предположительно, получали и использовали этот контент:

обходили платные стены так, чтобы это оставалось незаметным;
массово собирали веб-страницы для обучающих наборов данных;
намеренно удаляли уведомления об авторских правах из материалов до их передачи модели.

Большая часть новых сведений содержится в меморандуме The New York Times, а не в самих приложениях к делу: они по-прежнему закрыты. Поэтому приведённые в документе высказывания опубликованы без исходного контекста.

Спор о добросовестном использовании

Нерассекреченный документ стал новым этапом трёхлетнего разбирательства. Изначально The New York Times обвинила OpenAI и Microsoft в нарушении авторских прав: компании обучали генеративные модели на материалах издания.

Юридический статус использования защищённых авторским правом материалов для обучения ИИ пока не определён однозначно. При этом судьи в основном благосклонно относились к аргументу ИИ-компаний о добросовестном использовании. Это правовое правило позволяет применять чужие произведения без разрешения в отдельных случаях — например, для пародии, освещения новостей или критики.

Ранее в этом месяце администрация Дональда Трампа представила документ в поддержку использования OpenAI защищённых авторским правом материалов без лицензии для обучения больших языковых моделей.

Однако несколько новых признаний противоречат другим условиям добросовестного использования. В частности, такое использование не должно заменять оригинальную работу или наносить ущерб её рынку.

По данным самой Microsoft, сервис Copilot, который компания называет «системой ответов», снизил долю переходов на домен The New York Times максимум на 93% по сравнению с традиционным поиском Bing.

Во внутренней презентации Microsoft, подготовленной в январе 2024 года директором по прикладным исследованиям Брентом Хехтом, это снижение названо «порочным кругом». По оценке автора документа, оно одновременно ухудшает работу моделей Microsoft и всего интернета.

В документе говорится, что конечный продукт компании оказался способен угрожать экономической основе поставщиков, от которых зависит его работа. В случае с бизнесом больших языковых моделей речь идёт о цепочке поставок контента.

На допросе под присягой в начале этого года генеральный директор Microsoft Сатья Наделла заявил, что любой материал за платной стеной должен лицензироваться теми, кто хочет использовать его для дополнения контекста или обучения. Он также сказал: если бы знал, что OpenAI собирала данные за платной стеной и обучала на них модели, то воспользовался бы правом Microsoft потребовать от компании переобучить эти модели.

Продукты могут заменить новости

Другие признания противоречат уже иным критериям добросовестного использования. Руководитель ChatGPT в OpenAI Ник Тёрли писал во внутреннем сообщении, что продукты вроде чат-бота создают для издателей «экзистенциальную угрозу»: они в значительной степени заменяют оригинальные материалы, а по мере улучшения будут делать это всё чаще.

Президент OpenAI Грег Брокман описывал модели как особенно хорошо работающие с новостями. Сатья Наделла под присягой также согласился, что разговор с чат-ботом заменяет переход на исходный сайт: пользователь получает сведения прямо на платформе ИИ.

Такие формулировки указывают, что технология может напрямую конкурировать с оригинальными материалами, а не преобразовывать их для нового использования.

В одном из документов Microsoft говорится о реальном риске того, что генеративный ИИ существенно нарушит занятость людей, создавших данные, на которых обучалась базовая модель.

Масштаб копирования

Документы впервые показывают, что только промежуточные обучающие наборы OpenAI содержали более 91 692 копий произведений, опубликованных The New York Times, Daily News и Center for Investigative Reporting.

Набор данных, созданный на основе Common Crawl, включал более 2 миллионов документов только с сайта nytimes.com.

Во внутренней записке от января 2023 года Брент Хехт назвал происходящее «ошеломляющей кражей беспрецедентного масштаба» и «крупнейшей кражей труда в истории человечества».

Как компании собирали материалы

В материалах дела подробно описано, как OpenAI и Microsoft получали контент истцов, в том числе собирая его из индекса Bing.

OpenAI передала Microsoft полный обучающий набор данных GPT-3. Microsoft использовала его, чтобы оценить способы внедрения моделей OpenAI в собственные коммерческие продукты. В свою очередь, Microsoft передавала OpenAI обучающие данные через инициативы Project Taxi и Project Mango.

По версии истцов, компании собрали данные Project Mango в обучающий набор, содержавший копии как минимум 160 903 уникальных произведений новостных издателей.

Чтобы повысить эффективность сбора данных, сотрудники OpenAI, предположительно, разработали способ незаметного обхода платных стен. Когда исследователь OpenAI Ник Райдер сообщил Грегу Брокману о найденном способе обойти платную стену nytimes.com, Брокман ответил, что это хорошо.

Сотрудники OpenAI также, предположительно, создавали обучающие наборы WebText и WebText2, в которых непропорционально большую долю занимали собранные новостные материалы. Кроме того, они извлекали миллионы статей из Common Crawl — открытого бесплатного хранилища данных веб-сканирования.

Материалы дела описывают и намеренное удаление уведомлений об авторских правах из обучающих данных до их передачи модели. Исследователи, как утверждается, не хотели, чтобы модель выдавала пользователям такие уведомления.

Адвокат New York Daily News Стивен Либерман заявил, что опубликованные сведения впервые показывают: OpenAI и Microsoft понимали, что действуют неправильно.

OpenAI и Microsoft не ответили на запросы о комментарии.

Crusoe привлекла $3,9 млрд на огромные дата-центры и малые модульные «фабрики ИИ» Виртуальные миры, где обучают роботов PrismML надеется, что её крошечная LLM изменит наше обращение с ИИ Вот как может выглядеть апокалипсис ИИ Робототехника: компании наперегонки улучшают системы обучения роботов Pinterest показала новую функцию Restyle — ИИ поможет переделать комнату Директор Microsoft назвал ИИ «крупнейшей кражей труда в истории человечества» — рассекреченные документы суда Проблему неуправляемых ИИ-агентов может решить ещё больше ИИ Будущее учебной практики: учителя создают интерактивы с генеративным интерфейсом Метрики для оценки темпов развития ИИ в передовых лабораториях ООН обратилась к Google, чтобы подготовить глобальные данные для ИИ-агентов Проект правил: ИИ сможет собирать всё, что публикуют австралийцы. Как вас это затронет? Anthropic приближает Claude Code к автономному кодингу с новыми параллельными агентами Инфлюенсеры снимают на ИИ-очки Meta манипулятивный джойбейт с людьми на улице Даже короля Англии одолевают сомнения по поводу ИИ Господство ИИ не предопределено — мы можем изменить ситуацию к лучшему Спор о замедлении ИИ омрачил праздник Salesforce OpenAI, по сообщениям, близка к решению второй задачи тысячелетия — гипотезы Ходжа Base Labs объединилась с Hugging Face и Goodfire ради безопасности ИИ с открытыми весами The Spin | Роботам ещё далеко до идеальной дусры, но ИИ уже меняет крикет

Ежедневные новости об ИИ

Каждый день отбираем важные новости об ИИ и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.

Только важное — каждый день

В Telegram