Один из неожиданных индустриальных выводов на текущий момент – llm достаточно плохо проверяет работу llm. Ошибка умножается, поддерживать сложно, и так далее.
Есть несколько областей где полезно, Артём их хорошо описал. Я добавлю еще две: – если вы оптимизируете и собираете пайплайн на небольших моделях. Тогда проверять умным оракулом - очень ок – если система это агент прежде всего про действия а не про интеллект и проверка проще чем сама задача
Стоит использовать llm-as-a-judge только если вы понимаете зачем, а не как дефолтный выбор.
· 26.03
Да все так, но если проверять разные(одну совершенно другой) ллм то результат лучше
0
ответить
коммент скрыт — часть юзеров считает его токсичным или некорректным
коммент удалён