# 可观测性与可靠性 ## Run 时间线与基础日志 **实现阶段:P1** - 记录 Run 状态、模型请求结果、错误和客户端输出时间线。 - P2 加入 Tool、Shell、测试、Diff 和 Artifact 事件。 - 日志保持可读、可关联且能够从 CLI 定位,不提前建设复杂遥测平台。 ## Runtime 与功能诊断 **实现阶段:P4** - 生成包含 Runtime、配置、扩展、模型、数据目录和最近错误的诊断报告。 - 查看 Hook 调用、Tool 耗时、连接状态和异常堆栈。 - 支持脱敏后导出诊断信息用于排查或交给 Agent 自己分析。 ## Run 暂停与恢复 **实现阶段:P5** - 在计划、子 Agent 或等待用户输入时持久化可恢复状态。 - 区分可安全重放的步骤和已经产生外部副作用的步骤。 - Runtime 重启后允许用户继续、跳过、回滚或终止未完成 Run。 ## Runtime 崩溃恢复 **实现阶段:P8** - 检测异常退出、孤儿子进程、未完成写入和悬空 worktree。 - 重启后恢复健康状态并列出需要处理的 Run。 - 对自动恢复过程保留记录,避免隐藏数据或副作用不一致。 ## 数据完整性与修复 **实现阶段:P8** - 检查注册表、JSON/JSONL、Artifact、索引和实际目录之间的一致性。 - 修复可恢复问题,隔离损坏记录,并在操作前生成备份。 - 定期验证备份可读取,而不是只确认备份文件存在。 ## 资源、性能与成本监控 **实现阶段:P8** - 统计 Runtime CPU/内存、磁盘占用、队列长度、模型 Token、延迟和费用。 - 定位过慢 Tool、异常循环、长期占用的进程和持续增长的数据。 - 为清理、并发限制和模型路由提供真实依据。 ## 资源回收 **实现阶段:P8** - 管理 Workspace 临时文件、worktree、日志、缓存、索引和 Artifact 的保留策略。 - 在自动清理前保护用户固定内容和仍被 Run 引用的资源。 - 提供空间预览、手动清理和可恢复删除。