One ruler to measure them all: Benchmarking multilingual long-context language models (arxiv 2025)
В статье исследуется, как язык влияет на качество моделей. Обычно, помимо очевидных факторов, связанных с самой моделью и промптингом, влияние оказывает токенизатор. Из-за него, например, русский текст при том же объеме информации будет занимать больше токенов , чем английский. Кто-то даже из-за этого старается писать на английском.
Тем интереснее итог - лучшие результаты показал польский язык (88%), русский на 5м месте (84%), а английский 83.9%. И разница более значимая на задачах с длинным контекстом. Но не все так однозначно: тк тестировали слабые модели Gemini-1.5-Flash, Qwen 2.5 72B и тд