Почему «самая вероятная» фраза иногда оказывается слишком короткой
В некоторых системах перевода и распознавания речи ответ ищут методом beam search: модель держит несколько продолжений и сравнивает их общий балл. Вероятность каждого нового токена меньше единицы. При перемножении вероятностей — или сложении их логарифмов — длинная фраза получает дополнительный минус просто за длину. Поэтому поиск может предпочесть короткое завершение, даже если более длинное звучит полнее.
Это корректируют нормализацией длины или отдельной настройкой штрафа. «Лучший по баллу» не всегда означает «лучший для читателя»: иногда в оценку незаметно встроена любовь к краткости.