SRE Agent 设计笔记 07:Eval 是度量系统设计

状态:大纲

核心论点

Agent eval 不是测试,是度量系统设计。传统软件的 eval 是 assert equal,agent 的 eval 更像 SRE 的 SLI/SLO 框架。但有一个关键区别:SLI/SLO 的故障模式是已知的(延迟、错误率),agent 的故障模式需要先发现再定义。这让 agent eval 更接近 chaos engineering + SLO 的组合。背后的经济学基础是 cost inversion:生成便宜验证贵。

大纲

1. Cost Inversion(成本倒置)

  • 传统软件:写代码贵、跑测试便宜
  • AI 时代:LLM 生成几乎零边际成本,判断「是否正确地解决了正确的问题」需要领域语义 + 工程度量能力
  • 历史类比:编译器时代后汇编优化失去价值,算法设计获得价值;AI 代码生成时代后打字速度失去价值,specification 和 verification 获得价值
  • AI 替代的是 translation layer(想法 → 代码),不是 engineering 本身
  • 工作重心从 execution 迁移到 specification + verification

2. 为什么开放过程 Eval 是稀缺能力

  • 封闭过程 eval(确定性 I/O)可以硬编码到 CI/CD
  • 开放过程 eval 的三个特性:非穷举输出空间、不可预测故障模式、需要持续重定义评估标准
  • 系统化开放过程 eval 需要同时具备:领域语义理解 + 度量工程能力
  • 「拍脑袋说这个不好」不是工程。杠杆在于把判断转化为可执行标准、可度量指标、可追踪趋势

3. Eval 天然抵抗自动化

  • 不能用 AI 定义什么是好的 AI,这是循环论证
  • 定义「好」总是需要系统外部的视角
  • Eval 层在 AI 替代浪潮中是结构性稀缺的,不是暂时稀缺的

4. 四层 Eval 模型

内容 SRE 类比
Task Completion 二值成功指标 Availability SLI
Output Quality rubric + 人工抽检 + LLM-as-Judge Quality SLI
Process Quality tool call 效率、循环检测、token 消耗 Latency + Cost SLI
Behavioral Consistency 扰动测试(改写、加噪、重排 context) Resilience Testing

5. Agent Eval ≈ Chaos Engineering + SLO

  • SLO 前提:故障模式已知
  • Agent 的故障模式需要先发现:25 种故障模式分布在 6 大类(Context / Retrieval / Tool / Planning / Generation / System)
  • 先通过故障注入(perturbation sets)探索边界,再定义收敛标准
  • 优先级从零开始:eval dataset → trace logging → LLM-as-Judge rubric → perturbation set

6. 和 SRE 价值重估的关系

  • 当 AI 接管代码生成,最高价值的剩余技能是 SRE 类的:度量、质量门控、架构决策、故障分类
  • 这不是巧合:SRE 的核心能力就是定义「什么是正确的」(判断),不是「怎么执行」(实现)
  • 「懂得做质量度量系统设计的人,价值变高了,不是变低了」

涵盖的 Topic

  • Topic 4: Cost Inversion
  • Topic 13: Eval 是度量系统设计

源文件引用

  • contexts/thought_review/eval_as_measurement_system_20260331.md — 主源文件,cost inversion、开放过程 eval 的稀缺性、eval 抵抗自动化、和 SRE 价值重估的关系
  • contexts/thought_review/agent_ops_competency_model_v1.md — 六层能力模型中 Evaluation 作为基石、四层 eval 模型、SRE 类比表
  • contexts/thought_review/agent_sre_production_systems_synthesis_20260330.md — Evaluation Cost Inversion、Agent SLO 定义
  • rules/skills/bestpractice_agent_reliability_engineering.md — Eval 四层模型的 skill 定义