Болезни LLM
Работая с LLM, я заметил ряд характерных «болезней» этих моделей. Ниже — исключительно мой личный опыт использования бесплатных моделей, без углубления в технические причины. Платными версиями я не пользовался уже около полутора лет. Возможно, некоторые из описанных проблем решаются корректировкой промпта или иными методами. Критика приветствуется.
Наблюдаемые проблемы
1. Галлюцинации при недостатке данных. Если задавать вопросы по новой или слабо представленной в обучающем датасете теме, модель генерирует информацию, не имеющую ценности. При этом более крупные модели выдают такие ложные сведения с большей видимостью достоверности.
2. Избыточная фиксация на деталях. Например, при написании детской сказки достаточно один раз упомянуть синий шарф на шее поросёнка — и модель будет вставлять этот шарф в каждую последующую генерацию без необходимости, даже если это не требуется.
3. Нестабильность результатов на малых моделях. При одном и том же запросе, но с изменением лишь одной конкретной переменной (например, имени файла), в одном случае получается корректное решение, а во втором — совершенно иной ответ.
4. Чрезмерная активность при доработках. Модель склонна брать на себя максимум, но при этом снижается качество решения непосредственно поставленной задачи. Например, вы даёте участок кода и указываете строки для правки. На первом проходе задача может быть выполнена удовлетворительно. Однако при попытке внести уточнения модель начинает править другие фрагменты и выдавать множество дополнительных рекомендаций, не относящихся к делу. Помогает добавление в промпт фраз вроде «Ответь кратко» или «Ответь строго по проблеме».
Выводы для себя Чем жёстче мы ограничиваем модель, сужая её фокус на конкретной задаче, тем выше качество результата. В этой связи интерес представляют инструменты вроде GitHub Spec Kit или OpenSpec, но для их эффективного применения требуется предварительная детальная спецификация. На данном этапе в моих задачах часто проще выполнить работу самостоятельно или с минимальной помощью ИИ-чата. Если заведомо известно, что тема новая или слабо освещена в обучающих данных, рассчитывать на высокое качество ответов не приходится.