llm-to-agent/docs/features/observability-reliability.md
2026-07-16 10:50:57 +08:00

2.0 KiB
Raw Blame History

可观测性与可靠性

Run 时间线与基础日志

实现阶段P1

  • 记录 Run 状态、模型请求结果、错误和客户端输出时间线。
  • P2 加入 Tool、Shell、测试、Diff 和 Artifact 事件。
  • 日志保持可读、可关联且能够从 CLI 定位,不提前建设复杂遥测平台。

Runtime 与功能诊断

实现阶段P4

  • 生成包含 Runtime、配置、扩展、模型、数据目录和最近错误的诊断报告。
  • 查看 Hook 调用、Tool 耗时、连接状态和异常堆栈。
  • 支持脱敏后导出诊断信息用于排查或交给 Agent 自己分析。

Run 暂停与恢复

实现阶段P5

  • 在计划、子 Agent 或等待用户输入时持久化可恢复状态。
  • 区分可安全重放的步骤和已经产生外部副作用的步骤。
  • Runtime 重启后允许用户继续、跳过、回滚或终止未完成 Run。

Runtime 崩溃恢复

实现阶段P8

  • 检测异常退出、孤儿子进程、未完成写入和悬空 worktree。
  • 重启后恢复健康状态并列出需要处理的 Run。
  • 对自动恢复过程保留记录,避免隐藏数据或副作用不一致。

数据完整性与修复

实现阶段P8

  • 检查注册表、JSON/JSONL、Artifact、索引和实际目录之间的一致性。
  • 修复可恢复问题,隔离损坏记录,并在操作前生成备份。
  • 定期验证备份可读取,而不是只确认备份文件存在。

资源、性能与成本监控

实现阶段P8

  • 统计 Runtime CPU/内存、磁盘占用、队列长度、模型 Token、延迟和费用。
  • 定位过慢 Tool、异常循环、长期占用的进程和持续增长的数据。
  • 为清理、并发限制和模型路由提供真实依据。

资源回收

实现阶段P8

  • 管理 Workspace 临时文件、worktree、日志、缓存、索引和 Artifact 的保留策略。
  • 在自动清理前保护用户固定内容和仍被 Run 引用的资源。
  • 提供空间预览、手动清理和可恢复删除。