LLM-агент в аналитике становится источником мусора, если у него нет аудита и воспроизводимости.

Типичный сценарий: агент “в фоне” собирает инсайты, пишет заметки к дашборду, отвечает в чате, генерит SQL и объяснения метрик. Поначалу удобно, потом внезапно в отчёте появляются “факты”, которых никто не может проверить, а числа не сходятся между версиями. Цена ошибки здесь не в красоте формулировки, а в решениях: приоритизация, бюджеты, эксперименты, коммуникация с руководством.

Почему это ломается: модель каждый раз чуть другая (обновления, настройки, контекст), входные данные живые, а сам агент смешивает 3 роли в одной голове: доступ к данным, интерпретация и презентация. Если не разделить и не зафиксировать артефакты, вы не сможете повторить ответ, найти источник и доказать, что это не “галлюцинация”.

Минимальный стандарт, без которого лучше не выпускать в прод даже “внутреннего” агента:

  1. Логируйте всё, что делает ответ воспроизводимым: цель запроса, промпт, системные инструкции, параметры, модель и её версию, список инструментов, которые вызывались, и итоговый ответ. Плюс ссылки на входные датасеты и их снапшоты, если они меняются.
  2. Разведите “считал” и “объяснял”: числа агент должен брать только из проверяемых источников (SQL/таблицы/метрики), а не из текста. В ответе требуйте явные ссылки на запросы, таблицы, фильтры, окно времени.
  3. Оценка качества не “нравится или нет”, а по чекпоинтам: корректность вычислений, соответствие определению метрики, отсутствие лишних допущений, цитирование источников, стабильность на повторе. Для критичных задач держите набор контрольных вопросов и эталонных ответов.
  4. Ограничьте доступ по принципу минимальных прав: агенту не нужен весь DWH. Отдельные роли на чтение, отдельные на выгрузки, отдельные на PII. Запрет на “сырой” персональный уровень по умолчанию.
  5. Поставьте guardrails на формулировки: если источника нет, агент обязан писать “нет данных” и перечислять, чего не хватает. Запрет на уверенный тон без ссылок на расчёт.

В правильной практике агент не “создаёт аналитику”, а ускоряет рутину вокруг неё: черновики, навигация по данным, проверочные запросы, суммаризации с привязкой к источнику. А вот финальные выводы для бизнеса без трассировки и контроля версий — это не автоматизация, а фабрика правдоподобных ошибок. Граница применимости простая: чем ближе к цифрам в отчёте и решениям, тем меньше “магии” и больше протокола.