Закон об ИИ глазами автора

В Госдуму в конце июня внесли проект закона "О поддержке развития технологий искусственного интеллекта". Я внимательно прочитал сам законопроект и сопроводительные документы, а также попросил разъяснить некоторые моменты коллег-юристов. И как автор статей и книг после прочтения и анализа поймал себя на мысли, что вопросов у меня оказалось больше, чем ответов.

Наверное, самая сейчас обсуждаемая в Сети норма этого закона касается обучения больших языковых моделей на произведениях, защищенных авторским правом. Но даже если оставить в стороне громкие заголовки про "легализацию пиратства" (крупные видеохостинги пестрят видео на эту тему от разных создателей контента), документ вызывает лично у меня несколько гораздо более интересных вопросов:

Во-первых, автор не получает возможности сказать: "Нет, я не хочу, чтобы мои работы использовали для обучения ИИ". В проекте просто нет механизма отказа. Нет реестра запретов и нет процедуры удаления произведений из обучающих наборов.

Во-вторых, отсутствует требование к прозрачности. Если, к примеру, мои статьи попадут в датасет, я, скорее всего, никогда об этом не узнаю. Закон не обязывает разработчиков раскрывать состав обучающих данных или хотя бы уведомлять правообладателей.

В-третьих, не предусмотрена никакая компенсация. Если произведения используются как сырье для коммерческой модели, автор не получает ни вознаграждения, ни возможности участвовать в распределении созданной стоимости.

По словам коллег с юридической практикой есть здесь и чисто юридический вопрос. Закон фактически вводит новое исключение из авторского права отдельным федеральным законом, но при этом разработчики прямо пишут, что изменения в другие федеральные законы, включая часть IV Гражданского кодекса, не потребуются. Я и те коллеги, у которых я просил разъяснения, не уверены, что такая конструкция не породит серьезных споров уже в судах.

Наконец, документ очень многое оставляет "на потом". Кто именно получит доступ к государственным наборам данных? Какие требования будут предъявляться к их обезличиванию? Как будет проверяться происхождение обучающих материалов? Ответы предлагается определить будущими постановлениями Правительства.

При этом было бы неправильно думать, что Россия столкнулась с этой проблемой первой. В США вокруг обучения ИИ уже идут многочисленные судебные процессы, поскольку специального регулирования там пока нет. В Европейском союзе действует механизм "Text and Data Mining", но и там продолжаются споры о том, насколько он применим к современным генеративным моделям. Великобритания вообще попыталась пойти по пути использования произведений по умолчанию с возможностью отказа со стороны авторов, однако после масштабной критики со стороны творческого сообщества была вынуждена пересмотреть этот подход.

И знаете что? Я хорошо понимаю мотив законопроекта. Современные модели невозможно обучать на нескольких тысячах лицензированных текстов. Если мы так стремимся к суверенным (sic!) конкурентоспособным моделям ИИ, вопрос обучения действительно нужно как-то решать.

Но именно поэтому лично мне хочется увидеть не только поддержку разработчиков, но и понятный баланс интересов авторов. То же самое право отказаться. Или право узнать. Право на компенсацию. Или хотя бы открытую дискуссию о том, почему государство считает, что этими правами можно пожертвовать.

Пока же у меня складывается ощущение, что закон подробно отвечает на вопрос "как помочь разработчикам?", но почти не отвечает на вопрос "что получает взамен автор?"