Как ИИ-компании тайно скупали и пиратили миллионы книг

В начале 2024 года Anthropic запустила секретный «Project Panama» — массовую закупку и сканирование книг для обучения своих ИИ-моделей. Суть проекта: купить книги оптом, срезать корешки, отсканировать страницы, бумагу — на переработку. Бюджет — десятки миллионов долларов. Детали всплыли из четырёх тысяч страниц судебных материалов по иску авторов против Anthropic — компании стоимостью $183 млрд.

Параллельно выяснилось, что ещё до Project Panama сооснователь Anthropic Бен Манн лично скачивал книги с пиратской библиотеки LibGen, а потом восторженно рассылал коллегам ссылку на новый пиратский сайт: «как нельзя кстати!!!». Anthropic настаивает: на пиратских данных коммерческие модели не обучались.

Схожая история — у Meta. Внутренняя переписка фиксирует, как сотрудники скачивали миллионы книг через торренты, сознавая риски. «Скачивать торренты со служебного ноутбука как-то неправильно», — написал один инженер. Чтобы скрыть следы, использовались арендованные серверы Amazon. Операция, судя по документам, была санкционирована лично Цукербергом.

OpenAI факт скачивания LibGen признала, но заявила, что удалила файлы до релиза ChatGPT.

В августе Anthropic согласилась выплатить $1,5 млрд в рамках мирового соглашения — без признания вины. Авторам, чьи книги попали в пиратские базы, причитается около $3 000 за произведение. Суд при этом постановил: само обучение ИИ на книгах законно — это «трансформативное использование».

На фото: так выглядит пиратство в промышленных масштабах

Как ИИ-компании тайно скупали и пиратили миллионы книг
В начале 2024 года Anthropic запустила секретный «Project Panama» — массовую закупку и сканирование книг для обучения своих ИИ-моделей | Сетка — социальная сеть от hh.ru Как ИИ-компании тайно скупали и пиратили миллионы книг
В начале 2024 года Anthropic запустила секретный «Project Panama» — массовую закупку и сканирование книг для обучения своих ИИ-моделей | Сетка — социальная сеть от hh.ru