Как я ускорил локальную модель (или только сделал вид)

Правильный ответ — в скобках. Модель не стала быстрее ни на миллисекунду. Изменилось то, чем занят человек, пока она думает — и этого хватило, чтобы Эрви начала ощущаться отзывчивее облачных сервисов. Почему это работает? Проблема не в железе Локальная модель на 4 млрд параметров думает от 1 до 15 секунд. Облачная отвечает за полсекунды на промышленных ускорителях. Этот разрыв не закрыть оптимизацией. Можно выиграть 20% на квантовании, ещё 10% на кэшировании, но 15 секунд не превратятся в полсекунды. Но я заметил: людей раздражает не само ожидание, а пустота ожидания. Три секунды неподвижного экрана воспринимаются как «сломалось». Те же три секунды, занятые разговором, почти не ощущаются. Что делает Эрви r72 — Эрви, включи музыку.

— Включаю. Какое настроение сегодня?

— Да так, устал что-то.

— Понимаю. Поставила спокойное. Между второй и четвёртой репликой прошло четыре секунды. Человек их не ждал — он отвечал на вопрос. Другой пример: — Кто выиграл выборы?

— Уже ищу. Ты как думаешь, кто?

— Думаю, тот же, что и в прошлый раз.

— Поняла. Вот официальные данные: … Поиск всё это время шёл в фоне. Как это устроено 1. Подтверждение должно быть мгновенным.

Фразу «включаю» нельзя ждать от основной модели — иначе пауза просто переместится. Её формирует дешёвый вызов на основе уже известного маршрутизатору намерения. Лимит — 40 токенов. 2. Работа идёт параллельно.

Мост и основная задача не ждут друг друга. Если задача готова быстрее 0,35 секунды, мост вообще не появляется. 3. Ответ человека не создаёт новый ход.

Он нужен, чтобы занять паузу. Реплика сохраняется в контексте, но не вызывает отдельный ответ — иначе пользователь получил бы два ответа подряд. 4. Никаких заготовок.

«Уже делаю» десятью способами быстро начнёт повторяться. Формулировку каждый раз придумывает модель, а решение о том, нужен ли мост, принимает контур управления. Почему это не обман Эрви не говорит, что закончила, пока не закончила. Она говорит «включаю», а не «включила». Работа действительно идёт. Если человек сказал, что устал, это сохраняется в контексте и может повлиять на дальнейший ответ. Обманом было бы сказать «готово» до получения результата. Так Эрви не делает. По сути, это обычное человеческое поведение: если попросить коллегу что-то найти, он скажет «сейчас гляну» и продолжит разговор, пока ищет. Чего этот приём не делает Он не ускоряет модель. 15 секунд остаются 15 секундами. Он не улучшает качество — слабую модель мост не превращает в сильную. Он не нужен для коротких задач — там это была бы лишняя болтовня. И он не заменяет оптимизацию. Сначала нужно сделать быстрым всё, что можно сделать быстрым. Команды вроде «пауза» или «выключи компьютер» Эрви выполняет без обращения к модели. Главное Отзывчивость интерфейса ≠ скорость вычислений. Мы привыкли измерять производительность секундами. Человек измеряет её количеством пустого ожидания. Иногда правильный ответ лежит не в профилировщике, а в том, чем занят человек, пока машина работает. В Эрви r72 модель и компьютер остались прежними. Изменилось только взаимодействие — и ощущение стало другим. Эрви — локальный ИИ-агент для Windows. Работает на вашем компьютере, без облака и подписок. eirven.foxyhosty.ru