LLM - на этот раз убил книги
В мире AI лаб очередной скандал. Оказалось, что нейро-слоп уже пронзил интернет, аки микро-пластик наши океаны, т.е. избавиться от него и отделить одно от другого уже представляется маловозможным, а модели обучать надо.
Что с этим придумали делать компании? Правильно, закупать любые текстовые издания до 2022го года, массово сканировать, обучать LLM, а затем уничтожать. Заодно, по законам США, это не является нарушением авторского права - как покупатель, дескать, делай с книгой что хочешь, это подпадает под добросовестное использование. Такая вот очередная, серая, законодательная зона к которой мир не был готов с приходом Ai. Если быть более конкретным, то в новостном фокусе сейчас - так называемый Project Panama от Anthropic, но это не значит, что они единственные, кто совершает подобное.
Ну и что спросите вы? Всё-таки это не уничтожение само по себе, ещё напечатают, всё чисто, красиво и во вторичную переработку. Но есть ньанс. Селлеры заявляют, что закупка происходит без разбору - редкие, старые издания, да и буквально единственные оставшиеся копии мало-известных авторов уходят в шредер.
Есть правда и немного и позитивных новостей, но от OpenAi. Они вроде и занимаются тем же самым, но в партнёрстве с Microsoft - уже выложили в открытый доступ почти миллион отцифрованных книг на разных языках: https://www.wired.com/story/harvard-ai-training-dataset-openai-microsoft/ Проблема правда, что все эти книги, это только те, что не подпадают под авторское право (ака 70 лет, после смерти их автора).
Почему же остальные этого не делают этого - не выкладывают сканы или например, не раздают эти книги после сканирования? Я определил 4 фактора: 1. Быстрое промышленное сканирование, когда корешки книг уничтожаются под прессом, что во многом помогает ускорить процесс. 2. Fair deal политика, что покупая 1 единицу товара, ты не имеешь право его копировать, но можешь трансформировать в цифру для личного использования, соотвественно физическую копию обязан уничтожить. Ну и понятно, что если бы это не вскрылось публично, то можно себя не ограничивать только изданиями, на которые больше не действует копирайт. 3. Не желание компаний делиться материалами, для обучения моделей конкурентов.
· 02.08
Вообще-то делают и выкладывают и прям тут - в России. И не только книги, но и фильмы, и архивы... даже церковные книги с записями о рождении и крещении. И всё это без уничтожения оригиналов! Но без дальнейшей передачи в обучение "ии"... Но и без качественной каталогизации полученной информации... я пытался "продвинуть" в эту область свои идеи о создании глобального информационого каталога качественной информации, но не получилось...
0
ответить
коммент скрыт — часть юзеров считает его токсичным или некорректным
коммент удалён
· 02.08
Да, но это скорее разовые истории, как и с OpenAi кейсом, что никак не отменяет сам факт, что не все компании так делают
0
ответить
коммент скрыт — часть юзеров считает его токсичным или некорректным
ответ удалён
· 02.08
"разовые истории" - это про "нас" или про "их"? Есть много разных сканированных архивов, но нет системы и общего каталога информации.... поэтому нет и знания о том, что всё это Есть.
Например по некоторым кладбищам есть базы захоронений... С учётом архивов "церковных книг" - уже пространство для тех, кто собирает свой "под" И кстати - как пример построения "базы Знаний" по предлагаемому мной подхожу https://www.walks.ru/wm\_dr/
0
ответить
коммент скрыт — часть юзеров считает его токсичным или некорректным
ответ удалён
· 02.08
Мне лично не известно, по какому принципу какой-нибудь Гигачат или Алиса в данный момент обучается, так что катигорически заявлять не буду
0
ответить
коммент скрыт — часть юзеров считает его токсичным или некорректным
ответ удалён