Говорим с прошлым
talkie-1930 - языковая модель на 13B параметров, обученная только на текстах до 1931 года. Никаких упоминаний ядерной бомбы, интернета, полетов в космос. Зато много газет, журналов, писем и патентов того времени. Это самая крупная винтажная LM на сегодня. Обучена на 260B токенов исторических текстов. Граница 1930-го выбрана не случайно: в США работы переходят в общественное достояние (public domain) через 95 лет после публикации - то есть в 2026-м легально доступны только тексты, изданные до конца 1930-го. Параллельно авторы тренировали "modern twin" на современных веб-данных - с той же архитектурой и тем же бюджетом FLOPs, чтобы было с чем сравнивать.
По факту - всё ещё эпоха GPT-2. До GPT-3 винтажные модели пока не дотягивают, и упирается всё в данные. 260B токенов - потолок текущего корпуса. Всё упирается в данные. Основанный на нейросетях OCR портит данные галлюцинациями о современных событиях. Классическое распознавание не дотягивает по качеству. Следующий шаг авторов - GPT-3-level модель к лету. До уровня GPT-3.5 можно будет добраться, только если расширить корпус до 1+ триллиона токенов исторических текстов.
Только вот зачем? Винтажные LM - это в первую очередь исследовательский инструмент, а не продукт. На них проверяют ровно то, что на современных моделях проверить нельзя из-за загрязнения данных: - Способность предсказывать будущее. Берут ~5000 описаний событий из рубрики New York Times "В этот день", считают "удивлённость" модели на каждом. Чем дальше во времени событие - тем более неожиданное оно для модели. - Способность к открытиям. Может ли модель, обученная до 1911-го, самостоятельно прийти к общей теории относительности (Эйнштейн, 1915)? Пока нет. Но это конкретный эксперимент, а не философствование на конференциях. - Обобщение за пределы обучения. Может ли модель, никогда не видевшая компьютера, написать код на Python по нескольким примерам в контексте? Оказывается, может - но пока только однострочники и мелкие правки чужих функций. В одном из тестов модель реализовала функцию декодирования шифра, получив в контексте функцию кодирования. - Чистый сигнал о роли данных. Все современные LM так или иначе обучены на вебе - напрямую или через дистилляцию. Что в их поведении - про язык вообще, а что - про этот конкретные данные? На винтажных моделях можно выяснить как именно влияет тип данных на характер модели.
У них на сайте есть чат, очень интересно помучать его вопросами. Я вот спрашивал про полёт человека в космос, модель искренне считает, что это из разряда невозможного. Забавно. А ведь лет через 50 такой же эксперимент будут проводить с текущим Opus 4.7 или ChatGPT 😂
· 04.05
прикольный эксперимент. интереснее всего вот эта штука - что модель без знания о компьютерах может в контексте написать однострочники на python. это хорошо показывает что language modeling - не про запоминание фактов, а про что-то более фундаментальное в структуре текста. любопытно что будет когда дотянут до gpt-3 уровня
0
ответить
коммент скрыт — часть юзеров считает его токсичным или некорректным
коммент удалён