Summary
Agent Runtime Infrastructure 是为 AI Agent 系统提供统一运行时边界、生命周期管理、可观测性和策略执行的基础设施层。它解决的核心问题是:agent 运行跨越多个边界(模型调用、工具执行、子 agent 分支),各层不应各自发明包装器和 trace 词汇表。
Key Points
核心问题
Agent 系统在一次请求中跨越多个边界:
- 入口点启动工作
- 模型被调用
- 工具执行
- 子 agent 分支
- 可观测性或策略系统需要理解发生了什么
每个层都发明自己的包装器、trace 词汇表和清理规则 = 混乱。Runtime Infrastructure 提供一个共同的运行时契约。
核心组件
- Scopes(作用域) — 定义”工作属于谁”,提供 ownership、parent-child lineage、cleanup boundaries、request isolation
- Middleware(中间件) — 定义”围绕工作运行什么”,在需要时 block、sanitize、transform、route、retry、replace
- Plugins(插件) — 可复用行为的配置驱动路径
- Events & Subscribers(事件与订阅者) — 从同一运行时流产生多种输出格式
- Managed Calls(托管调用) — 同一套 lifecycle 规则应用于 LLM 和工具调用
与其他层次的关系
Prompt Engineering → Context Engineering → Harness Engineering → Runtime Infrastructure
(指令措辞) (输入窗口管理) (执行环境控制) (跨层运行时契约)
Runtime Infrastructure 是 harness engineering 的运行时实现层,将 harness 的设计决策编码为可配置的运行时行为。
实现对比
| 方案 | 定位 | 核心特色 |
|---|---|---|
| nvidia-nemo-relay | 通用运行时基础设施 | Rust 核心 + 多语言绑定,ATOF/ATIF 观测格式 |
| agent-operation-tracing | Agent 可观测性 | LobeHub 的 Execution Snapshot,状态机模型 |
| OpenTelemetry GenAI | 通用可观测性标准 | 标准化 trace/span,但不提供执行控制 |
| 各 framework 自有 tracing | 框架内置 | LangChain callback、CrewAI 事件、AG2 middleware |
设计原则
- 不替代现有系统,而是提供共同边界
- 渐进式:先捕获原始事件,再添加标准化输出,最后添加 middleware
- Source of truth:Rust 核心保证跨语言行为一致
- 配置驱动:插件通过配置文件启用,而非代码修改
Open Questions
- Agent Runtime Infrastructure 与传统 APM(Application Performance Monitoring)的边界在哪?
- 如何在不增加延迟的前提下实现实时 guardrail?
- 跨 agent runtime 的互操作标准是否会出现?
Evidence Timeline
- 2026-07-31: 从 NVIDIA NeMo Relay 文档提取,作为独立概念页面
相关页面
- nvidia-nemo-relay — 该概念的具体实现之一
- harness-engineering — 更广泛的 harness 工程实践
- agent-operation-tracing — LobeHub 的可观测性方案
- harness — Harness 概念定义
- observability — 可观测性通用概念