LLM врёт тебе про покрытие тестами. Не специально — но врёт. Мой кейс: делаю телеграм-бота. Модель сама пишет тесты на бэкенд, PostgreSQL, Redis, Celery, внешние API. Показывает покрытие 75%. Красота. А потом смотрю на хэндлеры самого бота — команды, FSM, реакции на кнопки. Без тестов. Просто нагло пропустила. Требую реальное покрытие. Вижу — 22% 😐 Паттерн стабильный: всё глобальное и абстрактное — покрывается. Всё точечное и приземлённое, с чем человек реально взаимодействует руками — пропускается. С мобилками то же самое: тесты «глобальной работы функций» пишет, а тесты на конкретные кнопки и переходы — мимо. Почему — точно не скажу. Может, в обучающей выборке таких тестов меньше. Может, модель видит интерфейс как «склейку», а не как логику, которую надо проверять. Лечение одно: явно прописывай в спеке, какие тесты нужны, ВКЛЮЧАЯ клиентскую сторону. По дефолту она туда не пойдёт. Тесты — это не про корректность. Это якорь истинности для LLM. #разработка #LLM #тестирование #AIDD
IoT и инфраструктура, которые остаются у вас, а не у вендора | Прошивки, безопасность, self-hosted
· 22.070 комментов