Языковые модели оценивают компетентность пользователя ещё до генерации ответа. От этой внутренней оценки может зависеть сложность предоставляемой информации.

Это показало исследование «Кого языковые модели считают компетентным? Механистический анализ профессиональной предвзятости».

Авторы Keren Fuentes и Aaron Mueller проверили три модели с открытыми весами: Gemma-2-2B, Gemma-2-9B и Llama-3-8B. Для эксперимента они собрали 2 000 вопросов по 20 профессиям. В отдельных опытах анализировалось до 10 000 ответов на каждую демографическую группу.

Исследователи выделили во внутренних состояниях моделей направление, связанное с восприятием пользователя как специалиста или новичка. Если человек называл профессию, соответствующую вопросу, его внутренняя оценка компетентности повышалась почти во всех профессиональных категориях.

Когда этот сигнал искусственно усиливали, Gemma-2-9B и Llama-3-8B начинали давать более сложные ответы. В отдельном опыте такое вмешательство меняло решения моделей о найме кандидатов.

Пол, раса и уровень дохода также могли влиять на внутреннюю оценку компетентности. Однако в готовых ответах эти различия проявлялись значительно реже. Самое заметное влияние на сложность текста обнаружили у признака уровня дохода.

При этом исследование не доказывает существование универсальной системы оценки во всех языковых моделях. Проверены только три модели и ограниченный набор шаблонов. Вероятность продолжения общения с пользователем авторы также не изучали.

Первоисточник: https://arxiv.org/abs/2608.20347

Языковые модели оценивают компетентность пользователя ещё до генерации ответа. От этой внутренней оценки может зависеть сложность предоставляемой информации | Сетка — социальная сеть от hh.ru