Почему на одни и те же запросы ИИ отвечает по разному?

А что, если я вам скажу, что текущие модели - это zip архив всех интернет запросов и результатов выдачи, комбинированные миллионы раз?

Недавно наткнулся на статью от бывшего СТО OpenAI - Миры Мураты. Текст довольно большой, но хочу поделиться, что понравилось мне.

Если коротко, LLM дают разные ответы из-за округления в GPU вычислениях. Например, когда в excel вы можете увидеть, что 2+1=2

• LLM может выдавать 1 запрос = 1 ответ. Но тогда пропадёт магия «живой нейронки». А B2B наоборот не нужны «живые нейронки», им нужны стабильные решения.

• «Гениальный» ответ LLM - это комбинация уже существующих запросов, которые в таком формате вы бы не додумались соединить. Это как услышать крутую песню, которую собрали из 50-и забытых вами песен.

• xAI уволили 500 спецов по ии и ищут 2000 узких спецов. Условно, мы видим как отрасль пришла от: «а давай те натренируем ИИ на всем интернете», до «ой, а как теперь понять, что там происходит и это не ахинея?»

• Open AI втыкает по 10000 safety токенов к вашим запросам, чтобы не нести бред. Это как спросить у другого человека: «сколько времени?», а перед ответом человек минут 10 будет размышлять о вашем вопросе, объясняя сам себе его суть.

Конечно, для простоты я много что опускаю и этот пост не претендует на точное техническое описание. Но это и вправду может помочь тем, кто антропоморф_изирует ИИ._

Ссылка на первоисточник: https://thinkingmachines.ai/blog/defeating-nondeterminism-in-llm-inference/