Недавно с коллегами пытались прикрутить LLM к разметке текста. Простая задача: прочитай, проверь на 10 красных флагов. Запускаем. Смотрим: модель систематически игнорирует один из флагов. Дебажим. В итоге на вопрос "почему ты пропустила это" получаем ответ в духе "я решила, что это не такой важный пункт, как остальные, и им можно пренебречь, так лучше для продукта". Совсем как живая 🤬