Summary
NVIDIA NeMo Relay 是一个 Agent 运行时基础设施,为 coding agents、应用和框架提供统一的 scopes、中间件、插件和生命周期事件运行时,用于观察和控制 agent 运行过程。
Key Points
核心定位
NeMo Relay 不替代 agent framework、model provider、应用逻辑或 guardrail 系统。它为这些系统提供一个共同的运行时边界,让各层不必各自发明包装器、trace 词汇表和清理规则。
五大核心能力
- Scopes(作用域) — 为 runs、turns、tools、LLM calls、subagents 提供 ownership、parent-child lineage、cleanup boundaries、request isolation
- Managed LLM/Tool Calls(托管调用) — 同一套 lifecycle 和 middleware 规则应用于每个 callback
- Middleware(中间件) — 在需要 block、sanitize、transform、route、retry、replace 执行时介入
- Plugins(插件) — 可复用的 observability、guardrail、adaptive、exporter 行为,通过配置启用
- Events & Subscribers(事件与订阅者) — 原始 ATOF、标准化 ATIF、OpenTelemetry、OpenInference 输出来自同一运行时流
技术架构
- Rust 核心:运行时行为的 source of truth
- Python / Node.js 绑定:暴露相同的核心模型
- Go / C FFI:实验性支持
- 多语言绑定需保持行为一致性
观测格式
- ATOF(Agent Trajectory Observability Format) — 原始规范化事件流,JSONL 格式
- ATIF(Agent Trajectory Interchange Format) — 标准化输出格式
- 同时支持 OpenTelemetry 和 OpenInference 输出
集成方式
| 方式 | 适用场景 |
|---|---|
| CLI sidecar | 本地观察 Codex、Claude Code、Hermes |
| SDK 直接插桩 | 应用自有的 LLM/tool 调用 |
| 维护的集成 | LangChain、LangGraph、Deep Agents、OpenClaw |
| 框架集成指导 | 构建自定义框架集成 |
| 插件系统 | 可复用的 exporters、middleware、policy |
推荐入门路径
- 创建一个 scope boundary
- 捕获一个 LLM/tool/session/turn boundary
- 导出 ATOF JSONL 并检查原始事件流
- 添加 ATIF、OpenTelemetry 或 OpenInference 输出
- 仅在需要 block/sanitize/rewrite 时添加 middleware
Open Questions
- NeMo Relay 与 OpenTelemetry GenAI conventions 的具体差异是什么?
- Adaptive Cache Governor (ACG) 在实际场景中的效果如何?
- 与 LobeHub 的 Agent Operation Tracing 方案相比有何优劣?
Evidence Timeline
- 2026-07-31: 从 NVIDIA NeMo Relay 文档 ingest,v0.6.0
相关页面
- harness-engineering — NeMo Relay 是 harness 工程的运行时实现之一
- agent-operation-tracing — LobeHub 的 Agent 可观测性方案,与 Relay 的 ATOF 互补
- harness — Harness 概念定义
- openclaw — OpenClaw 是 Relay 支持的集成之一
- agent-runtime-infrastructure — Agent 运行时基础设施的通用概念