Квантуйте, товарищи

Перечитывал «Гиперфокус» Криса Бэйли и наткнулся на интересную мысль. Она идеально ложится на то, как сегодня работают ИИ-модели.

Бэйли пишет о «сборе точек»: чтобы стать гением в чем-то, нужно собирать максимум информации вокруг ОДНОЙ темы. Когда точек становится много, они складываются в созвездие и превращаются в то самое состояние, когда решения приходят интуитивно и быстро.

Это же буквально квантование нейросетей. В мире ИИ есть два подхода к весам модели:

1. FP32 (полная точность): Модель знает всё обо всем, но она огромна, неповоротлива и требует безумных ресурсов. Это человек, который читает всё подряд. Новости, мемы, блоги, скиллы «на всякий случай». Такой мозг перегружен и медлителен. 2. INT8 (квантование) или меньше: Мы сжимаем модель, округляя веса, но оставляем самые важные параметры. Скорость работы вырастает в разы, а качество падает всего на пару процентов.

Так вот, Гиперфокус — это квантование вашего внимания. Когда Бэйли советует «удвоить потребление материалов о том, что вы уже умеете», он предлагает сделать ваш «вес» по этой теме максимально плотным (FP32), а всё остальное — сжать до минимума (INT8).

Вот что происходит на практике: Ошибка: Мы пытаемся быть универсальной FP32-моделью. Хватаемся за всё. В итоге мы — тяжелая, тормозная нейросеть, которая не может выдавать результат, потому что оперативной памяти (внимания) не хватает на контекст. Решение (Квантование): 1. Выбор 1-2 области для «высокой точности». Собирайте туда все точки (книги, курсы, практика). 2. Всему остальному поставить низкий приоритет.

В квантованных моделях иногда происходит всплеск точности — они начинают выдавать ответы даже быстрее и четче оригинальных. Ваш мозг устроен так же. Когда вы сжимаете лишнее и фокусируетесь на одном, количество точек превращается в качество инсайта. Вы начинаете видеть решения, которые другим кажутся «гениальными».

Вывод (довольно простой): Не пытайтесь быть большой языковой моделью с 175 миллиардами параметров. У вас просто не хватит «энергии». Лучше сделайте свою узкую модель (специалиста) с высокой точностью, чем широкую (дилетанта) с низкой.

Квантуйте, товарищи | Сетка — социальная сеть от hh.ru