Agentic Engineering
Agentic-система — не «LLM, которой разрешили думать подольше». Это программная система, где модель участвует в выборе следующего шага, а обычный код управляет контекстом, инструментами, полномочиями, состоянием, восстановлением и проверкой результата.
Модель предлагает решение; runtime решает, как его интерпретировать и можно ли выполнить; среда сообщает, что произошло; цикл продолжается до явного terminal state.
Карта курса
У этой карты есть «база» и расширяющиеся круги:
- Foundations: model I/O, роли сообщений, решения модели, цикл и state vocabulary.
- Runtime: контекст, tools, MCP, retrieval, memory и orchestration.
- Production: durability, security, observability, evals и deployment topology.
- Applied ML: датасеты, метрики, дистилляция, speech и serving.
- Operator practice: как самому эффективно работать с coding- и knowledge-агентами.
Что именно контролирует модель
| Система | Кто выбирает следующий шаг | Когда полезна |
|---|---|---|
| Обычная функция | Код | Правило известно и детерминируемо |
| Model call | Вызывающий код просит один результат | Классификация, extraction, генерация |
| Workflow | Код выбирает маршрут, модель заполняет отдельные шаги | Ветки известны заранее |
| Agent loop | Модель выбирает действие из разрешённого множества | Путь зависит от наблюдений |
| Multi-agent | Несколько контуров координации | Только когда декомпозиция даёт измеримый выигрыш |
Граница не маркетинговая. Если код после каждого ответа заранее знает следующий шаг, перед нами workflow с LLM-компонентами. Агентность появляется там, где решение модели влияет на дальнейший control flow.
Сквозной проект Helios
Курс строит provider-neutral runtime для фантастической super-app Helios: marketplace, межпланетная доставка, wallet/escrow, аренда и регулируемая поддержка. Фантастика нужна не ради lore, а чтобы безопасно собрать в одном домене сложные кейсы:
- долгие доставки и stale state;
- деньги, approval и идемпотентность;
- разные юрисдикции и cargo policy;
- tenant isolation и sensitive data;
- голосовой канал с latency budget;
- evaluation по outcome, а не по убедительности текста.
Реальные аналоги — neobank, marketplace, travel/logistics и telehealth support. Все fixtures синтетические; корпоративные данные и PHI не используются.
Запустить первый сценарий:
npm run demo:course
Он не требует API key: ScriptedModel детерминированно выбирает get_order, runtime выполняет tool и возвращает final answer.
Два учебных трека
Строить agentic-системы
Читайте по порядку:
- Ментальные модели
- Model I/O
- Agent loop and state
- Context engineering
- Tools and effects
- MCP and skills
- Retrieval and memory
- Workflow orchestration
- Durable execution
- Guardrails and autonomy
- Observability
- Evaluation and data
- Production architecture
Перейти глубже в Applied ML
После evaluation-главы переходите в Applied ML path. Для backend-разработчика наиболее короткий T-shaped путь:
- горизонталь: evals, data flywheel, retrieval, reliability, MLOps;
- вертикаль: небольшой classifier или speech ML;
- затем: inference/serving и только после измеримого baseline — fine-tuning.
Как читать техническую главу
Каждая глава различает три типа утверждений:
- Механика: проверяемый контракт кода, API или протокола.
- Исследование: результат в конкретной постановке и на конкретном benchmark.
- Эвристика: инженерное правило, которое нужно проверять в своём домене.
В каждой главе ищите одну и ту же цепочку:
naive implementation → observable failure → root cause
→ solution options → trade-offs → runnable evidence
Это важнее коллекции «магических промптов»: system prompt не исправляет отсутствие idempotency, storage, authorization или eval dataset.
Быстрая самодиагностика архитектуры
Попробуйте ответить:
- Что считается одним
thread,turn,run,stepиevent? - Где находится source of truth, если текст старого tool result расходится с БД?
- Какие tool results являются данными, а какие могут менять control flow?
- Где проверяются schema, tenant, policy и approval — до или после эффекта?
- Что произойдёт при crash после внешней записи, но до сохранения checkpoint?
- Как система отличает
timeoutот permanent failure? - Можно ли восстановить run без tracing backend?
- Какая eval проверяет реальный outcome, а не только final text?
Если ответы скрыты внутри framework, начните с явных контрактов. В capstone они малы специально: abstractions можно увидеть, запустить и заменить.
Первая практика
npm run typecheck:course
npm run test:course
npm run demo:course
Затем откройте тест агентского цикла и ответьте: какое состояние runtime хранит сам, что передаёт модели и почему event history не равна message history?
Источники и актуальность
Архитектурное различие workflow/agent сопоставимо с provider guidance Anthropic, а Responses API показывает современную форму model/tool interface. Это примеры, не обязательные зависимости курса. Проверено 2026-08-30:
- Anthropic: Building effective agents
- OpenAI Responses API reference
- ReAct paper — историческое исследование feedback loop, не production standard