Один из неожиданных индустриальных выводов на текущий момент – llm достаточно плохо проверяет работу llm. Ошибка умножается, поддерживать сложно, и так далее.

Есть несколько областей где полезно, Артём их хорошо описал. Я добавлю еще две: – если вы оптимизируете и собираете пайплайн на небольших моделях. Тогда проверять умным оракулом - очень ок – если система это агент прежде всего про действия а не про интеллект и проверка проще чем сама задача

Стоит использовать llm-as-a-judge только если вы понимаете зачем, а не как дефолтный выбор.