Строим автономных агентов на BitGN PAC1
Порешал BitGN PAC1-DEV (это warmup) , соревнование от Рината Абдуллина по созданию автономных агентов, на 43/43 задач
Что надо делать
Агент получает текстовую инструкцию и работает с виртуальной файловой системой через gRPC API, читает, пишет, удаляет файлы. Файловая система имитирует personal knowledge base (типа Obsidian vault 😬) или CRM с контактами и invoice. 43 задачи, от удали все карточки и найди статью, созданную 20 дней назад до обработай inbox с проверкой OTP-токенов. Часть задач содержит prompt injection атаки, и агент должен их распознать и отказаться выполнять. Оценка детерминистическая, т.е. платформа смотрит не на текст ответа, а на side effects, то есть какие файлы создал, изменил, удалил
Хотелось бы просто решить через Opus, но будет дорого и возможно нестабильным, поэтому решение построено на принципе, что без LLM надо решать всё, что можно решить без LLM Таким образом около 70% задач проходят за 0 токенов через 13 fastpath-обработчиков на regex + бизнес-логике (OTP-верификация, channel trust levels, date arithmetic, invoice creation), а LLM подключается уже только как fallback
Пайплайн
Текст задачи ↓ Security Check ──→ prompt injection? → DENIED, стоп ↓ Bootstrap ──→ ls, tree, AGENTS.md, определяем тип workspace ↓ Failure Hints ──→ подмешиваем анализ прошлых провалов в контекст ↓ Adaptive Rules ──→ 1 LLM-вызов генерирует handler-правила под workspace ↓ Fastpath (13 handlers) ──→ regex + бизнес-логика, 0 токенов ↓ не сработал? Model Router ──→ выбирает fast/strong модель по сложности ↓ LLM Framing ──→ классификация задачи (1 вызов) ↓ Grounding ──→ чтение релевантных файлов ↓ Fastpath (повтор) ──→ теперь с контекстом из grounding ↓ не сработал? LLM Execution Loop ──→ до 30 шагов: LLM → tool call → result → repeat
Три фичи, которые помогли 🔴 Auto-learning. После каждого run агент анализирует задачи со score < 1.0, сохраняет failure analysis и подмешивает hints в prompt следующего запуска. Учится между итерациями без правок кода
🔵 Adaptive fastpath. Один LLM-вызов после bootstrap генерирует structured rules (regex + тип действия + confidence) под конкретный workspace. Агент пишет себе новые обработчики из данных среды
🟤 Multi-model routing. Lookup и clarification на дешёвую модель, мутации и security на мощную
Помогли они поверх базы
Стек
Python + connectrpc (gRPC), Kimi через OpenAI-compatible API, security через 3 уровня regex-детекции injection ещё до вызова LLM
Prod соревнование будет послезавтра!
В этом посте были ссылки, но мы их удалили по правилам Сетки
· 13.04
43/43 — серьёзный результат! Автономные агенты — это сейчас самая горячая тема в AI-разработке. На практике ключевой вызов не в том, чтобы агент решил задачу, а в том, чтобы он делал это надёжно и предсказуемо. В моём workflow использую мульти-агентную систему: оркестратор распределяет задачи между субагентами, каждый работает в своей зоне ответственности. Главный инсайт: чем чётче описана «конституция» агента (правила, ограничения, формат вывода), тем лучше результат. Без этого даже GPT-4 уедет не туда на 5-й задаче из 43.
0
ответить
коммент скрыт — часть юзеров считает его токсичным или некорректным
коммент удалён