ИИ самый главный вор контента 🤬

Наткнулся на такую новость:

В Австралии власти заявили о жёсткой защите авторов от AI-компаний, а против Google и OpenAI идут новые иски и требования санкций по делам об использовании контента для обучения моделей.

С одной стороны, обучение ИИ на чужом контенте нарушает авторские права, но с другой стороны, на чём же тогда учить модели?

Если мы хотим, чтобы модели писали красивым языком, понимали стиль, генерили сильные изображения, разбирались в науке, медицине, праве и других сложных областях, их всё равно нужно учить на контенте, который создали люди.

Другого источника качества у нас просто нет))

Но, представим, что ИИ взял и скопировал откуда-то текст и чуть его видоизменил. Получается, уже плагиат🤔

Вопрос оплаты и согласия авторов, конечно, важный, но мне пока сложно представить, как это можно честно и технически нормально реализовать в мировом масштабе🥲

Датасеты огромные, контента — море.

Найти каждого автора, всё это отследить, со всеми договориться и превратить в рабочую систему будет сильно сложнее, чем многие себе представляют.

При этом я не думаю, что ценность человеческого контента исчезнет. Книги будут читать, музыку будут слушать, фильмы будут смотреть. И интерес к конкретным авторам тоже никуда не денется

Так что да, права авторов учитывать нужно. Но система, где каждое обучение модели проходит через 100500 согласований со всем миром, выглядит довольно утопично

Интересно, а что вы думаете, насколько важно учитывать авторские права в этом вопросе?