2.0 KiB
2.0 KiB
可观测性与可靠性
Run 时间线与基础日志
实现阶段:P1
- 记录 Run 状态、模型请求结果、错误和客户端输出时间线。
- P2 加入 Tool、Shell、测试、Diff 和 Artifact 事件。
- 日志保持可读、可关联且能够从 CLI 定位,不提前建设复杂遥测平台。
Runtime 与功能诊断
实现阶段:P4
- 生成包含 Runtime、配置、扩展、模型、数据目录和最近错误的诊断报告。
- 查看 Hook 调用、Tool 耗时、连接状态和异常堆栈。
- 支持脱敏后导出诊断信息用于排查或交给 Agent 自己分析。
Run 暂停与恢复
实现阶段:P5
- 在计划、子 Agent 或等待用户输入时持久化可恢复状态。
- 区分可安全重放的步骤和已经产生外部副作用的步骤。
- Runtime 重启后允许用户继续、跳过、回滚或终止未完成 Run。
Runtime 崩溃恢复
实现阶段:P8
- 检测异常退出、孤儿子进程、未完成写入和悬空 worktree。
- 重启后恢复健康状态并列出需要处理的 Run。
- 对自动恢复过程保留记录,避免隐藏数据或副作用不一致。
数据完整性与修复
实现阶段:P8
- 检查注册表、JSON/JSONL、Artifact、索引和实际目录之间的一致性。
- 修复可恢复问题,隔离损坏记录,并在操作前生成备份。
- 定期验证备份可读取,而不是只确认备份文件存在。
资源、性能与成本监控
实现阶段:P8
- 统计 Runtime CPU/内存、磁盘占用、队列长度、模型 Token、延迟和费用。
- 定位过慢 Tool、异常循环、长期占用的进程和持续增长的数据。
- 为清理、并发限制和模型路由提供真实依据。
资源回收
实现阶段:P8
- 管理 Workspace 临时文件、worktree、日志、缓存、索引和 Artifact 的保留策略。
- 在自动清理前保护用户固定内容和仍被 Run 引用的资源。
- 提供空间预览、手动清理和可恢复删除。