附录 B:Agent 工程检查清单

用于评审一个 Agent 是否具备进入企业环境的基本工程条件。

1. 场景判断

  • [ ] 任务是否真的需要 Agent,而不是单次 Prompt?
  • [ ] 是否存在不确定路径,需要动态决策?
  • [ ] 是否需要工具调用、观察结果、继续推进?
  • [ ] 是否定义了明确目标和停止条件?
  • [ ] 是否可以从只读模式开始验证价值?

2. Context Engineering

  • [ ] 是否列出了所有候选上下文来源?
  • [ ] 是否区分 User Task、Policy、Project Knowledge、Tool Result、Memory、Code Context?
  • [ ] 是否有 Context Budget?
  • [ ] 是否有权限过滤?
  • [ ] 是否避免一次性加载完整日志、完整仓库或完整历史?
  • [ ] 是否保留原始引用,便于追溯?
  • [ ] 是否定义压缩策略?
  • [ ] Multi-Agent 场景是否定义 Private Context 与 Shared Workspace?

3. Tool Engineering

  • [ ] Tool 名称是否表达明确意图?
  • [ ] Tool 描述是否说明何时使用、何时不使用?
  • [ ] 输入 Schema 是否明确、可校验?
  • [ ] 输出是否结构化、稳定、token-efficient?
  • [ ] 错误信息是否帮助 Agent 恢复?
  • [ ] 是否区分只读工具和写工具?
  • [ ] 高风险工具是否需要审批?
  • [ ] 是否记录 Tool Call Trace?

4. Skill Engineering

  • [ ] 是否把可复用任务方法沉淀为 Skill?
  • [ ] Skill 是否有清晰 description,便于发现?
  • [ ] 是否采用 Progressive Disclosure?
  • [ ] 是否包含 Procedure、Rules、Output Format?
  • [ ] 是否列出 requiredTools?
  • [ ] 是否有示例和反例?
  • [ ] 是否有版本、评审和废弃机制?

5. Harness Engineering

  • [ ] 是否定义 Initialize / Plan / Act / Observe / Verify / Recover / Finish 流程?
  • [ ] 是否有最大步数、超时和成本预算?
  • [ ] 是否有验证器,而不是只靠模型自我判断?
  • [ ] 是否保存 Checkpoint?
  • [ ] 是否支持失败恢复?
  • [ ] 是否支持人工接管?
  • [ ] 是否禁止无证据结论?

6. Memory Engineering

  • [ ] 是否区分短期状态、长期 Memory 和原始聊天历史?
  • [ ] Memory 是否有 scope、source、confidence、createdAt、expiresAt?
  • [ ] 写入前是否验证事实?
  • [ ] 是否支持更新、删除、合并和审计?
  • [ ] 检索时是否进行权限、作用域、时效和冲突过滤?
  • [ ] 是否避免把临时猜测写入长期 Memory?

7. Runtime 与平台治理

  • [ ] 是否有统一 Task / Session / Event 模型?
  • [ ] 是否能重放或追踪一次 Agent 执行?
  • [ ] 是否有安全策略和工具权限模型?
  • [ ] 是否有 Observability:日志、Trace、指标、成本?
  • [ ] 是否有评估集衡量报告质量?
  • [ ] 是否区分 Brain、Hands 和 Session?
  • [ ] 是否支持资源配额和隔离?

8. CI 失败分析 Agent MVP 检查

  • [ ] 输入是否包含 buildId、repositoryId、pullRequestId?
  • [ ] 是否只开放只读工具?
  • [ ] 是否先读取 CI 失败摘要?
  • [ ] 是否对比 Git Diff?
  • [ ] 是否只读取相关代码片段?
  • [ ] 输出是否包含 rootCause、evidence、suspectedFiles、suggestedFix、confidence?
  • [ ] 每个根因判断是否有证据?
  • [ ] 是否明确说明未修改文件?

results matching ""

    No results matching ""