SRE Agent 设计笔记 01:SRE 与 Agent Engineering 的同构性
状态:大纲
核心论点
SRE 和 agent engineering 面对的是同构问题:从不可靠组件构建可靠系统。K8s 的 reconciliation loop 让不可靠的容器收敛到声明式状态,agent 系统用类似机制让不可靠的 LLM 决策收敛到预期目标。区别只在不确定性的来源:系统行为 vs 决策过程。
大纲
1. 开篇:同一个问题的两个实例
- K8s controller 是确定性的,不需要 guardrail;LLM agent 是概率性的,Policy 层不是可选的
- 传统 SRE 问的是「is it alive?」,agent observability 问的是「is it doing the right thing?」
- 不确定性的位置不同,但控制论框架通用
2. 同构映射表
| SRE 概念 | Agent 对应 |
|---|---|
| RBAC | Scope Declaration |
| Blast Radius | Authorized Scope |
| Audit Log | Execution Log + INTENT |
| SLI/SLO | Task Success Rate / Convergence Time |
| Reconciliation Loop | Agent Loop |
| Desired State (YAML) | Spec |
| Admission Controller | Hook |
3. Controllability > Capability
- 生产系统为 auditability、reversibility、interruptibility 付费,不是为推理能力付费
- 「亮区假象」(false bright zone) vs 「暗区」(dark zone):agent 自信地给出错误答案比承认不知道危害更大
- 数据支撑:88% agent PoC 失败在系统/集成层面,不在模型能力层面
4. 三支柱速记
「限制它、看见它、让它回正」
- Constraints(限制行为空间和影响范围)
- Observability(让决策和工具效果可检视)
- Convergence(检测偏离,拉回正轨)
5. 这意味着什么
- SRE 的工具箱(checkpoint、circuit breaker、OTel、budget enforcement)直接适用于 agent runtime
- 不需要从「AI agent framework」角度理解这个领域,从「控制系统设计」角度更有效
- 工程基本面:终态定义、收敛机制、准入控制、隔离边界
涵盖的 Topic
- Topic 1: SRE ↔ Agent 同构性
- Topic 3: Controllability > Capability
源文件引用
contexts/thought_review/agent_sre_production_systems_synthesis_20260330.md— 同构论的完整论证,三个同心圆模型,八条负载结论contexts/thought_review/k8s_sre_agent_controllability_model_20260330.md— K8s-Agent 映射表,五维控制框架,五层工程架构contexts/thought_review/agentic_ai_controllability_design_20260329.md— GCORF 框架,Agent 定义(开放行为空间 + 有界执行约束)contexts/thought_review/agentic_control_theory_primitives_20260413.md— 四原语完整推导(本篇引用同构部分)rules/skills/bestpractice_agent_reliability_engineering.md— 三支柱 skill 定义