Со-автор RLHF и ChatGPT 15 сентября выпустил модель, которая не пишет текст вообще. Jev от TypeSafe AI отвечает решением и числом уверенности. $0.042 за миллион токенов.
У нас ровно такая задача: закрывает ли резюме требование вакансии. Считает свой кросс-энкодер на 278M, на процессоре.
Поставил Jev на наш отложенный набор. 2000 пар, 82 вакансии, 17 центов, четыре минуты.
0.868 ROC-AUC против наших 0.883. Бутстрэп по вакансиям: разность 0.014, интервал [-0.030; 0.067]. Ноль внутри, модели неразличимы. Zero-shot, на русском, впервые видя наши данные.
Калибровка, главное заявление Jev, при этом вдвое хуже нашей: ECE 0.117 против 0.071.
А потом я разложил набор по видам меток и понял, что мерил не совсем то.
40% отрицательных меток у нас поставлены за молчание резюме: "Kafka не упомянута" значит "навыка нет". Этот дефект мы промпту запретили ещё в сентябре. На таких парах Jev нас обходит, 0.929 против 0.920. На честных проседает сильнее, 0.827 против 0.858.
Часть его согласия с нами - совпадение предрассудков, а не качество.
Ставить Jev к себе всё равно нельзя, открытых весов нет. Забрать стоит другое: бенчмарк, где метки ставила одна модель, а проверяют другую, меряет заодно и их общие ошибки. На итоговом числе этого не видно.
Разбор: https://iconicompany.com/ru/research/jev-system-one-vs-fine-tuned-cross-encoder