Лучшие промышленные практики построения AI-агентов, 6 из 10
Выжимка из книги Ли Боцзе «Глубокое понимание AI Agent: принципы проектирования и инженерная практика» (Pine AI, v2.0, 2026).
6. Взаимодействие: наблюдения и действия за пределами текста
Модальность (текст/голос/экран/физика) × момент (сам запрашивает vs мир будит; завершается по ходу vs прерываемо/вытесняемо).
Асинхронность: моделируй входы как структурированные события (источник/канал/содержание/контекст) — иначе путаница источников = дыра для injection. Нужен push-канал, не только polling. 3 стратегии по срочности: отмена (безопасная точка, прервать+очистить очередь) / очередь (пакетом) / параллель (независимое дешёвое). Срочность определяй лёгкой моделью-маршрутизатором по смыслу, не по типу. При прерывании вызова — явная заглушка, не оставлять без ответа. Асинхронные инструменты называй по семантике запуска (initiate_), не завершения.
Виртуальная идентичность+изолированная среда для агента (не прямой доступ к аккаунтам пользователя); данные между агентом и средами — по ссылке на путь, не копией.
Голос: каскад (модульно, задержка накапливается) vs Omni (меньше задержка, сохраняет эмоции) vs полный дуплекс (естественно, сложнее всего). Потоковая обработка на каждом этапе каскада. Конец реплики — семантика+паузы вместе, не только тишина. Разделяй быстрое (передний план) и медленное (фон) мышление — не давай им рассуждать независимо параллельно (противоречащие ответы); передавай подсказки через общее состояние. Для TTS — управляющие маркеры эмоции/темпа.
Computer Use: локализация — DOM/Accessibility Tree > визуальная разметка (data-test-id) > прямые координаты. Координаты привязаны к разрешению обучения — двустороннее масштабирование. Интерфейс наблюдения между скриншотами (ключевые кадры, звук) — экран не неподвижен. Верификация состояния после каждого действия. Платформы структурно заинтересованы блокировать автоматизацию (конфликт бизнес-моделей, не только техника).
Робототехника: разделяй масштабы (планирование минуты → навык/VLA секунды → управление 50-1000Гц со слоем безопасности); модель не выдаёт углы суставов напрямую. Каждый навык — проверяемый узел. Диагностируй узкое место (железо/алгоритм), меняя только оператора. VLA не оценивает последствия — нужна модель мира для риска действия. Action chunking — компромисс плавность/реактивность. Sim2real — расширяй изменчивость условий, не заменяй калибровку.
Продолжение следует...