Про Jev, ныне хайпующий

Чёт последние несколько дней всё AI-комьюнити говорит про Jev. Полез смотреть, ожидая очередную "новую модель, которая на 4% лучше GPT в каком-нибудь очередном бенчмарке", а там внезапно вообще другое.

Jev — это System One Model. Я с таким раньше не сталкивался ваще) Что за систем ван? Если очень грубо, System 1 — быстро посмотреть на что-то и почти сразу принять решение, System 2 — сесть и ДУМАТЬ.

Большие LLM типа GPT/Claude как раз заточены под второе. Им даёшь задачу, они рассуждают, генерируют ответ, пользуются тулами, вот это всё. А Jev не умеет генерировать текст вообще :) Т.е. его нельзя воткнуть в OpenCode и пойти с ним обсуждать, почему опять сломалась авторизация.

Он про classify / score / rank. Условно: вот тебе сообщение из чата — это спам или нет? Насколько оно токсичное по шкале от 1 до 5? К какой категории относится тикет? Какой из этих документов больше подходит под запрос?

Внимательный подписчик сразу заметит: погодите, а классификаторы-то существуют примерно сто лет, что тут нового? Чем оно отличается?

Ответ: по сути ничем. В этом и прикол.

Раньше под такие задачи обучали отдельные ML-классификаторы. Потом появились general-purpose LLM и оказалось сильно проще просто отправить текст в GPT с промтом "это positive или negative?" вместо того, чтобы под каждую такую фигню обучать отдельную модель.

Ну и понеслось. Классификация, скоринг, роутинг тикетов, модерация — везде можно просто дёрнуть LLM API. Работает же.

Jev делали, чтобы с такими штуками было работать также удобно, как с LLM — описал критерии человеческим языком и ничего отдельно не обучаешь — но выкинуть всё ненужное для таких задач.

Вот, например, чувак сделал на нём realtime moderation чата: https://www.reddit.com/r/vibecoding/comments/1wk8jco/using_jev_for_realtime_live_chat_moderation/

Там каждое сообщение на лету гоняется через Jev и получает оценки по нужным критериям. Собственно, как раз под этим постом и спросили "а чем это отличается от sentiment classifier?". Ответ был примерно "it isn't, that's the point" :)

Она ещё и стоит копейки: $0.042 за миллион input-токенов, output бесплатный. Т.е. если условная классификация одного тикета съедает 1000 токенов, то 10 000 таких тикетов обойдутся примерно в 42 цента. Миллион — в $42.

Сами TypeSafe для своих System One workflows вообще заявляют в среднем 444x разницу в цене с LLM, а в демке на главной один и тот же workflow у них стоит $0.000081 на Jev против $0.01388 на LLM. Понятно, что это их собственный бенчмарк и там можно подобрать выгодный сценарий, но порядок цифр всё равно внушает.

Хочется взять какую-нибудь реальную задачу и тупо сравнить Jev с обычной дешёвой LLM по качеству / скорости / деньгам.

Проблема стандартная: игрушка есть, а задачи под неё нет 😆 В вейтлист я заранее записался, доступ уже дали, так что осталось дождаться подходящего кейса) Но потыкать хочется)