LLM не понимают язык. Но именно это даёт нам асимметричное преимущество. Предущий пост =https://set.ki/post/hXo5Jck

Из эпистемологического тупика — невозможности перейти от формы к смыслу — следует неочевидный, но крайне прагматичный вывод.

Если нейросети принципиально остаются в плоскости оптимизации формы, то соревнование сводится к эффективности вычислений. Не к объёму данных, не к числу параметров, а к тому, сколько операций нужно сделать для результата.

И здесь у команд без бесконечного бюджета появляется исторический шанс.

Три технологии, которые меняют ландшафт:

1. SSA (Subquadratic Sparse Attention)

Классический трансформер требует O(n²) операций — каждое слово сравнивается с каждым. SSA вместо всех попарных сравнений выбирает для каждого запроса только k релевантных токенов.

На контексте в 1M токенов ускорение против стандартного внимания достигает 52 раз. Задача переезжает с кластера из сотен GPU на 2–4 карты. Стоимость инференса падает с сотен долларов за запрос до центов.

2. Фильтрация корпуса

Для задач логического вывода большая часть обучающих данных — шаблонный шум. Фильтрация по критериям связности может сократить объём в 50–100 раз. На тестах рассуждения точность не падает, а иногда растёт за счёт снижения шума.

Время пре-тренировки сокращается пропорционально. Оборудование — менее дорогое.

3. LoRA + SSA

LoRA позволяет дообучать модель под конкретную задачу, изменяя менее 1% параметров. В связке с SSA это даёт:

· переключение адаптеров под разные задачи без перезагрузки модели, · дообучение на одном GPU за часы вместо недель на кластере, · распространение адаптеров (мегабайты) вместо модели (сотни гигабайт).

Комбинированный эффект

Сложение трёх подходов даёт сокращение требований к оборудованию на 2–3 порядка. Задачи, доступные только крупным кластерам, становятся выполнимыми на инфраструктуре университета или средней лаборатории.

Это не компенсация «грубой силой». SSA принципиально делает меньше операций.

Провокация:

Пока мейджоры вкладывают миллиарды в скейлинг, SSA + LoRA позволяют решать те же задачи на оборудовании на порядки дешевле.

Вопрос: это временное окно, которое закроется, когда гиганты внедрят те же решения? Или мы вступаем в эпоху, где архитектурная эффективность побеждает объём ресурсов? #ИИ #Нейросети #Технологии #Будущее #Наука #AICommunity #TechNews #ArtificialIntelligence #MachineReasoning #BigTech