Groundline: сам считает, сколько денег сэкономил

При разработке RAG систем главный вопрос часто упирается в стоимость и скорость эксплуатации.

Каждый запрос к языковой модели это живые деньги и секунды, а то и минуты ожидания. Если пользователи часто спрашивают одно и то же разными словами, а система каждый раз заново прогоняет полный векторный поиск и генерацию ответа с нуля, бюджет расходуется крайне неоптимально.

За последние несколько дней я собрал Groundline, RAG сервис, который не просто ищет по документам, но и показывает экономию наглядно, в честных цифрах.

Что под капотом и в интерфейсе: - Семантический кэш. На моих тестах закрывает от 60 до 65 процентов повторных вопросов, возвращая ответ мгновенно и без затрат токенов. - Прозрачная экономика. Живой график прямо в интерфейсе показывает затраты на модели против сэкономленных кэшем денег. - Гибридный поиск и переранжирование. Сочетание векторного и полнотекстового поиска с отдельной моделью Rerank для точных ссылок на фрагменты и страницы. - Надежная база. FastAPI, LangGraph, Postgres с pgvector и фильтрация на уровне Row-Level Security.

Полный разбор архитектуры, проблем с CPU при индексации и борьбы с утечкой соединений читайте в статье.

Ссылки на код и демо: Live Demo: https://groundline.antonmb.com GitHub: https://github.com/AntonMinin/groundline

Groundline: сам считает, сколько денег сэкономил | Сетка — социальная сеть от hh.ru