«Либо модель стала честнее, либо просто научилась лучше лгать. Отличить мы не смогли.»

Так авторы сценария AI 2027 описали собственный передовой ИИ. Уверенность ответа и его правильность – два независимых свойства, поэтому проверку ответов ИИ стоит поставить на поток. В базовом модуле курса это три проверки по нарастанию цены ошибки:

30 секунд, прямо в чате: к запросу добавляется строка «оцени уверенность каждого пункта – ТОЧНО / ВЕРОЯТНО / ОЦЕНОЧНО, укажи источник». «Оценочные» пункты идут на проверку первыми.

5 минут: Red Teaming – модель просят атаковать собственный ответ в роли скептичного консультанта. В среднем всплывает 2–3 пробела на план.

15+ минут: сверка с первоисточниками. Правило простое: если решение дороже $10K или его увидят больше 10 человек, внешняя проверка обязательна.

Систематика ошибок ИИ, готовые промпты для каждой проверки и матрица приоритетов – в бесплатном базовом модуле курса mysummit.school: программа

«Либо модель стала честнее, либо просто научилась лучше лгать. Отличить мы не смогли.»
Так авторы сценария AI 2027 описали собственный передовой ИИ | Сетка — социальная сеть от hh.ru