AbGen

AbGen: Evaluating Large Language Models in Ablation Study Design and Evaluation for Scientific Research

Мы представляем AbGen — первую специализированную оценку возможностей больших языковых моделей (LLM) в разработке абляционных исследований для научных целей. АбГен состоит из 1500 примеров экспертной разметки, полученных из 807 статей по обработке естественного языка. В рамках этой проверки языковая модель должна создать детальное проектирование абляционного эксперимента для определенного модуля или процесса на основании предоставленного исследовательского контекста. Оценивая ведущие LLM, такие как DeepSeek-R1-0528 и o4-mini, мы обнаружили значительный разрыв между этими моделями и человеческими экспертами в аспектах значимости, достоверности и обоснованности предлагаемых проектов экспериментов. Помимо этого, мы показали, что нынешние автоматизированные системы оценивания не подходят для нашей задачи, так как демонстрируют значительное расхождение с результатами человеческой экспертизы. Для дальнейшего изучения проблемы мы создали AbGen-Eval — метаоценочную систему, предназначенную для проверки надежности широко используемых автоматических методов оценки результатов LLM на нашем задании. Проведенное исследование с использованием различных систем типа «LLM-судья» на AbGen-Eval предлагает важные выводы для будущих разработок более эффективных и надежных систем оценки LLM применительно к сложным научным задачам.

https://arxiv.org/pdf/2507.13300https://github.com/yale-nlp/AbGen