SRE Agent 设计笔记 07:Eval 是度量系统设计
状态:大纲
核心论点
Agent eval 不是测试,是度量系统设计。传统软件的 eval 是 assert equal,agent 的 eval 更像 SRE 的 SLI/SLO 框架。但有一个关键区别:SLI/SLO 的故障模式是已知的(延迟、错误率),agent 的故障模式需要先发现再定义。这让 agent eval 更接近 chaos engineering + SLO 的组合。背后的经济学基础是 cost inversion:生成便宜验证贵。
大纲
1. Cost Inversion(成本倒置)
- 传统软件:写代码贵、跑测试便宜
- AI 时代:LLM 生成几乎零边际成本,判断「是否正确地解决了正确的问题」需要领域语义 + 工程度量能力
- 历史类比:编译器时代后汇编优化失去价值,算法设计获得价值;AI 代码生成时代后打字速度失去价值,specification 和 verification 获得价值
- AI 替代的是 translation layer(想法 → 代码),不是 engineering 本身
- 工作重心从 execution 迁移到 specification + verification
2. 为什么开放过程 Eval 是稀缺能力
- 封闭过程 eval(确定性 I/O)可以硬编码到 CI/CD
- 开放过程 eval 的三个特性:非穷举输出空间、不可预测故障模式、需要持续重定义评估标准
- 系统化开放过程 eval 需要同时具备:领域语义理解 + 度量工程能力
- 「拍脑袋说这个不好」不是工程。杠杆在于把判断转化为可执行标准、可度量指标、可追踪趋势
3. Eval 天然抵抗自动化
- 不能用 AI 定义什么是好的 AI,这是循环论证
- 定义「好」总是需要系统外部的视角
- Eval 层在 AI 替代浪潮中是结构性稀缺的,不是暂时稀缺的
4. 四层 Eval 模型
| 层 | 内容 | SRE 类比 |
|---|---|---|
| Task Completion | 二值成功指标 | Availability SLI |
| Output Quality | rubric + 人工抽检 + LLM-as-Judge | Quality SLI |
| Process Quality | tool call 效率、循环检测、token 消耗 | Latency + Cost SLI |
| Behavioral Consistency | 扰动测试(改写、加噪、重排 context) | Resilience Testing |
5. Agent Eval ≈ Chaos Engineering + SLO
- SLO 前提:故障模式已知
- Agent 的故障模式需要先发现:25 种故障模式分布在 6 大类(Context / Retrieval / Tool / Planning / Generation / System)
- 先通过故障注入(perturbation sets)探索边界,再定义收敛标准
- 优先级从零开始:eval dataset → trace logging → LLM-as-Judge rubric → perturbation set
6. 和 SRE 价值重估的关系
- 当 AI 接管代码生成,最高价值的剩余技能是 SRE 类的:度量、质量门控、架构决策、故障分类
- 这不是巧合:SRE 的核心能力就是定义「什么是正确的」(判断),不是「怎么执行」(实现)
- 「懂得做质量度量系统设计的人,价值变高了,不是变低了」
涵盖的 Topic
- Topic 4: Cost Inversion
- Topic 13: Eval 是度量系统设计
源文件引用
contexts/thought_review/eval_as_measurement_system_20260331.md— 主源文件,cost inversion、开放过程 eval 的稀缺性、eval 抵抗自动化、和 SRE 价值重估的关系contexts/thought_review/agent_ops_competency_model_v1.md— 六层能力模型中 Evaluation 作为基石、四层 eval 模型、SRE 类比表contexts/thought_review/agent_sre_production_systems_synthesis_20260330.md— Evaluation Cost Inversion、Agent SLO 定义rules/skills/bestpractice_agent_reliability_engineering.md— Eval 四层模型的 skill 定义