Перейти к основному содержимому

Глоссарий Agentic Engineering

Термины ниже — рабочий язык курса, а не попытка установить единственный отраслевой стандарт. Framework или provider может использовать то же слово иначе; на границе интеграции всегда фиксируйте mapping.

Control flow и время жизни

Model call

Один запрос к модели и один логический output: text, structured decision, tool call или typed refusal. Streaming chunks принадлежат тому же call. Model call не равен пользовательскому turn и не является agent loop целиком.

Harness

Application-owned оболочка вокруг model: собирает запрос, предоставляет tools, интерпретирует output, управляет loop, permissions и evidence. В курсе более узкая исполняющая часть harness называется runtime.

Runtime

Обычный код, который исполняет agent/workflow contract: строит context, вызывает model adapter, валидирует decision, применяет policy, вызывает tools, сохраняет events и определяет terminal state. Runtime, а не модель, является владельцем полномочий и side effects.

Workflow

Control flow, в котором следующий route в основном выбирает код по заранее определённым состояниям/веткам. Модель может выполнять отдельные steps, но не владеет общей маршрутизацией.

Agent

Система, где решение модели влияет на выбор следующего шага из разрешённого множества, а runtime ограничивает и проверяет этот выбор. Автономность может быть узкой; бесконечный свободный loop не является требованием.

Agent loop

Bounded feedback cycle:

project context → model decision → validate/policy → action/observation
→ persist state → next step or terminal reason

Внутренний inference/reasoning модели не следует смешивать с внешним циклом системы.

Thread

Долгоживущий conversation/task container, который связывает несколько turns и runs. Thread — identity/scope, а не обещание, что вся transcript всегда помещается в model context.

Turn

Один пользовательский или внешний input и связанный с ним system response на уровне продукта. Один turn может породить несколько model calls, tools и pauses.

Run

Одна bounded попытка runtime продвинуть определённый goal до terminal reason. Run может пережить process restart, ждать approval и продолжиться на другом worker.

Step

Одна итерация decision boundary внутри run; в Helios это один model decision с последующим возможным tool outcome. Budget ограничивает число steps.

Terminal reason

Typed причина завершения/паузы run: например completed, approval_required, budget_exhausted, failed, cancelled. Строка END из текста не заменяет terminal contract.

State, context и evidence

State

Authoritative structured facts, необходимые для продолжения и принятия решений: status, goal, pending operation, domain revision, completed operation IDs. State не равен transcript.

Event

Неизменяемый факт перехода: run_started, tool_requested, tool_completed, approval_resolved. Упорядоченные events могут восстанавливать projection state.

Event log

Durable ordered collection events. В Helios это source of truth для recovery; production store дополнительно требует atomic append, version/concurrency control и retention.

Projection

Производное представление state, построенное reducer’ом из input/events. Projection удобно читать, но нельзя исправлять независимо от authoritative facts.

Checkpoint

Durable boundary, после которой run можно безопасно восстановить. Хороший checkpoint связывает state/event version с pending/completed operation identity.

Trace

Telemetry representation причинной/временной структуры model, policy и tool operations. Trace помогает расследовать latency/errors, но не должен быть единственным recovery state.

Context

Выбранный working set, который runtime передаёт модели в конкретном call: instructions, goal, conversation projection, task state, observations, retrieved data и tool schemas. Context пересобирается; это не вся память системы.

Observation

Typed результат взаимодействия со средой, доступный следующему decision: tool outcome, error, revision, provenance и trust label. Observation является данными, а не автоматически авторитетной инструкцией.

Memory

Сохранённая между calls/runs информация, выбранная по scope, provenance, retention и access policy. Различайте thread/user/episodic memory, task state и knowledge base.

Compaction

Пересборка длинного context/state representation с сохранением инвариантов: goal, decisions, constraints, pending work, evidence, risks и next action. Это не слепое удаление первых сообщений.

Provenance

Происхождение данных: tool/source/version/time/tenant и путь преобразований. Provenance нужен для trust, freshness, deletion и audit.

Capabilities и безопасность

Tool

Runtime capability с именем, purpose, input schema, typed outcomes/errors и effect class. Model предлагает tool call; registry/policy решают, допустим ли он, и обычный код выполняет действие.

Effect

Изменение внешнего или durable состояния. Курс различает read, reversible_write, external_write, destructive; конкретный policy может учитывать amount, destination, identity и jurisdiction.

Approval

Human/policy decision, привязанный к конкретным arguments, operation, identity и expiry. Approval — durable state transition, а не слово «да» в свободном тексте.

Idempotency

Свойство, при котором повтор одной logical operation identity не создаёт второй effect. Оно критично при timeout/crash, когда runtime не знает, завершилась ли первая попытка.

Skill

On-demand instructional artifact: процедура, checklist или domain guidance, которую host раскрывает модели по необходимости. Skill не является автоматически executable tool и не обязан быть MCP primitive.

Resource

Addressable данные/контекст, которые host или protocol server предоставляет для чтения. В MCP resources, prompts и tools — разные primitives; resource сам по себе не получает authority действовать.

MCP

Model Context Protocol — versioned host/client/server protocol для capability negotiation и обмена tools, resources, prompts и дополнительными primitives. MCP стандартизирует integration boundary, но не заменяет domain authorization, tenancy, idempotency или evals.

RAG

Retrieval-Augmented Generation: retrieval pipeline выбирает внешние chunks/documents, после чего model использует их как context. RAG включает corpus, access filters, chunking, ranking/reranking, provenance и evaluation, а не только vector database.

Evaluation и Applied ML

Eval

Воспроизводимый набор tasks/cases, trials, graders и environment setup, проверяющий заданные свойства системы. Regression suite защищает известные contracts; benchmark сравнивает варианты в фиксированной постановке.

Trial

Один запуск eval case. Несколько trials нужны, когда модель/среда недетерминированы.

Transcript / trajectory

Последовательность model decisions, tool calls и observations в trial. Хорошая trajectory ещё не доказывает environment outcome, но помогает локализовать причину.

Outcome

Наблюдаемое состояние продукта/среды после trial: запись создана один раз, заказ найден нужного tenant, external action не выполнен. Убедительный final text не равен успешному outcome.

Grader

Функция или процедура, которая сопоставляет trial evidence с критерием. Grader бывает deterministic, model-based, human или комбинированным и сам требует validation/calibration.

Dataset split

Разделение examples на train/calibration/test с учётом entity/time/source groups. Random row split может создавать leakage.

Calibration

Соответствие predicted confidence наблюдаемой частоте: среди predictions около 0.8 примерно 80% должны быть правильными в соответствующей population. Calibration не равна classification accuracy.

Abstain

Typed отказ модели принять автоматическое решение при недостаточной confidence или authority. Fallback может быть clarification, другая модель, rule или human queue.

FAR / FRR

False Accept Rate и False Reject Rate для threshold decision. Их знаменатели и product cost нужно задавать явно; особенно важны для KWS и safety gates.

Быстрые границы

Не смешиватьПочему
Thread и contextThread долговечен, context bounded per call
Event и traceEvent восстанавливает state, trace объясняет выполнение
Tool output и instructionНедоверенные данные не получают authority
Model decision и policy decisionПолезность действия не означает разрешение
Final answer и outcomeТекст может утверждать неслучившееся
Workflow и agentВладелец следующего шага разный
Skill и toolИнструкция не равна исполняемой capability
Calibration и accuracyConfidence quality и label correctness различны