Исследователи Яндекса представили новую метрику RATE для оценки машинного перевода, которая помогает не только находить фактические ошибки, но и улучшать естественность и стиль перевода до уровня живой речи.

RATE (Refined Assessment for Translation Evaluation) — это система, которая изначально проектировалась под реальные пользовательские сценарии, а не только под формальные метрики. Ее задача — фиксировать те недочеты, которые заметны людям: неуместный тон, слишком официальная или, наоборот, чересчур разговорная подача, стилистические несоответствия.

Метрика оценивает перевод по трем основным критериям: точность передачи смысла, естественность языка и соответствие стилю оригинала. RATE учитывает не только факт ошибки, но и ее тяжесть, различая легкие неточности и сильные искажения смысла.

На данных конкурса WMT RATE показал, что способен находить до семи раз больше ошибок, чем распространенные подходы MQM и ESA. Это означает, что классические системы оценки пропускают множество шероховатостей, которые пользователи замечают сразу, особенно в области стиля и тона.

Эксперименты показали, что современные модели уже хорошо справляются с точностью перевода, но по естественности человеческий перевод до сих пор остается ориентиром. При этом YandexGPT (Alice AI LLM) смог приблизиться к человеческому уровню по естественности и обойти целый ряд крупных моделей, включая Claude 3.5 и GPT‑4.

Внутри компании RATE уже используют для тонкой настройки переводов под разные сценарии — от деловой переписки до неформального общения. Такая метрика позволяет развивать модели, которые фокусируются на качестве с позиции пользователя, а не только на формальных числах в отчете.

Исследователи Яндекса представили новую метрику RATE для оценки машинного перевода, которая помогает не только находить фактические ошибки, но и улучшать естественность и стиль перевода до уровня живо... | Сетка — социальная сеть от hh.ru