🏁 Аналитика без аналитика: как Anthropic дошёл до 95%

Многим начинающим аналитикам рано или поздно на уровне целей и ориентиров продают историю о self-service аналитике – чтобы продакт сам получал ответы на свои вопросы через аналитические инструменты

Раньше это в основном было в контексте дэшбордов – сделать их и научить продактов ими пользоваться. Год-два назад на конференциях начали рассказывать про мечту о text-to-SQL, которая в большинстве случаев не работает Недавно Anthropic выложил разбор, как они эту мечту наконец собрали: заявляют, что 95% бизнес-запросов к данным закрываются через Claude, без аналитика. Точность – тоже около 95%. Конечно, им же не надо договариваться с СБ

Начнём с фундамента. Почему селф-сервис аналитика валилась все эти годы? Ты спрашиваешь, сколько у нас активных – а active users в компании определены сотней способов. Для маркетинга одно, для продукта другое, для биллинга третье. Модель не угадывает, какой нужен именно тебе, и уверенно выдаёт красивое неправильное число

Что Anthropic сделал, чтобы это вылечить:

Skills, обычные папки с markdown-файлами, подняли точность с 21% до 95%+. Не дообучение, а текстом записанный контекст: вот таблицы, вот их гранулярность, вот подводные камни

• Закинуть боту тысячи прошлых SQL-запросов почти не двинуло точность – меньше 1%. Гора кода без контекста бесполезна

• Без поддержки точность за месяц сползла с 95% до 65%. Определения и схемы протухают быстрее, чем кажется

• Отдельный агент каждые пару часов сканит рабочие чаты, ловит сообщения в духе тут цифра неверная, сам пишет однострочный фикс в доку и открывает PR

И вот главная мысль в статье. В коде ИИ силён, потому что под рукой тесты и компилятор – есть на что опереться. А в аналитике часто один правильный ответ и ноль способов доказать, что он правильный – плюс куча контекста, который часто не описывается

Поэтому, словами самих Anthropic, точность аналитики – это проблема контекста и проверки, а не генерации кода

Недавно я писал, что ИИ не заберёт у нас работу – и это ровно тот случай. Агент закрывает 95% вопросов, но только поверх горы работы, которую кто-то сделал руками: описал метрики, навёл порядок в данных, прописал все грабли, выстроил валидацию

Профессия не умирает, она переезжает – с написания SQL на упаковку своего контекста в инструменты. Сам запрос за тебя напишет агент. А вот объяснить ему, что такое активный юзер именно у вас, пока придётся самим

А у вас в компании уже были попытки построить своих агентов для ответов на вопросы?

@tagir_analyzes


В этом посте были ссылки, но мы их удалили по правилам Сетки