Прочитал документ от Google по промпт-инжинирингу
Гугл выкатил большую доку по prompt engineering. Вроде всё знал, но кое-что щёлкнуло)) Ожидал каких-то откровений — а понял, что всё уже где-то видел: Zero-shot, Chain of Thought, System/Role prompting, даже ReAct с API-запросами не то чтобы что-то новое.
Но! Поймал себя на мысли: я это знаю, я это понимаю, а использую — не всё. Что не использую — хотя стоит: 🔸 Температура и sampling Управлять рандомностью вывода — круто, но в реальных интерфейсах (чатах типа гопоты, продуктах) — этого просто нет. Не вывел в UI = не настроишь и польза только для API, но ведь у меня есть AskExp и не настроил. Почему?
🔸 Few-shot примеры Работают офигенно. Но... кто будет вставлять три примера руками каждый раз? UX то позволяет, можно же заранее сгенерить примеры? Я не пробовал, но может и стоит.
🔸 System/Role prompting Вот это работает 100%. Особенно если задаёшь “Ты — эксперт, говори строго и по делу”. Использую давно в ChatGPT и недавно начал использовать в сервисе — реально другая манера ответа. Важно роль задавать нормально, а не просто говорить, что ты ты синьёр, а то может воспринять так, что он мистер из Испании видел такой чат
🔸 Chain of Thought “Думай пошагово” — звучит тупо, но даёт точный результат.
Мне 3 года, партнёру в 3 раза больше. Сейчас мне 20. Сколько ему?
Модель может ответить 63, дать некорректный результат, а с пошаговым мышлением выдаст 29
А вот про что реально задумался — это BLEU и ROUGE. Это такие метрики, которые Google приводит в разделе про автоматическую генерацию промптов. Ты можешь: ▫️Сгенерировать 10 промптов ▫️Получить от них 10 вариантов ответа ▫️Сравнить их с эталонным ответом по BLEU и ROUGE
BLEU = насколько совпадают фразы (точность) ROUGE = насколько смысл не потерян (полнота)
Давно уже начал делать черновой промпт в одном чате, а потом вставлять его в другой — по сути делаю свой prompt-generator. Можно ещё в ChatGPT улучшить, если это правило засунуть в проект чтобы просто по черновикам сразу генерил промпт. Вот это точно сделаю сегодня (скрин приложил куда это писать). Но я генерировал один промпт. И вот тут как раз хочется понять, что генерить их нужно несколько и потом сранивать какой промпт работает лучше через BLEU и ROUGE
Документ от Google напомнил, что дело не в магии промпта, а в том, насколько ты проектируешь взаимодействие Промпт — это не текст, это часть интерфейса. BLEU и ROUGE — это как твоя внутренняя аналитика:они помогают понять, насколько ты реально приближаешь модель к нужному результату