Дополнительные материалы и исследования к видео

Я сегодня для вас выпущу видео, где постарался 2х летний опыт работы в AI индустрии на стыке с IT взять и структурировать, чтоб разом и последовательно понять, что происходит. Помимо личного опыта контент видео строил и на дополнительных гайдах из разных ниш, которые сегодня все разложу по полочкам.

Тут фиксирую список всех допов. Очень полезные материалы для понимания ниши и того, куда идет:

Один из главных современных бенчмарков для кодинг агентов – SWE-bench Leaderboards

Как проектировать контекстные окна – Anthropic: Effective Context Engineering for AI Agents Как правильно забирать данные из контекста – Anthropic: Contextual Retrieval

Практический материал о повышении качества RAG – Google: Long Context

Исследование о том, что миллионный контект под вопросом – Context Length Alone Hurts LLM Performance Despite Perfect Retrieval

Построение эффективного харнеса для агентов – Anthropic: Effective Harnesses for Long-Running Agents

Дизайн харнеса для автономной разработки – Anthropic: Harness Design for Long-Running Application Development

Практика: как строить AI агентов – Anthropic: Building Effective AI Agents

Что такое evals и зачем они для агентов – Anthropic: Demystifying Evals for AI Agents

Уровни зрелости внедрения AI в разработку от Стэндфорда – Stanford SWEPR: AI Engineering Practices Benchmark

Исследование 51 успешных кейсов AI-внедрения – Stanford Digital Economy Lab: The Enterprise AI Playbook

Архитектура AI-агентов – OpenAI: A Practical Guide to Building Agents

Документация о проверке поведения агентских систем – OpenAI: Evaluate Agent Workflows

Логгирование и журналирование поведения агента – OpenAI: Trace Grading

Как работает и как внедрять наблюдаемость – OpenAI: Integrations and Observability

Про Agent Loops – OpenAI: Build an Agent Improvement Loop with Traces, Evals, and Codex

Про безопасность и ограничения – OpenAI: Safety in Building Agents