SRE Agent 设计笔记 01:SRE 与 Agent Engineering 的同构性

状态:大纲

核心论点

SRE 和 agent engineering 面对的是同构问题:从不可靠组件构建可靠系统。K8s 的 reconciliation loop 让不可靠的容器收敛到声明式状态,agent 系统用类似机制让不可靠的 LLM 决策收敛到预期目标。区别只在不确定性的来源:系统行为 vs 决策过程。

大纲

1. 开篇:同一个问题的两个实例

  • K8s controller 是确定性的,不需要 guardrail;LLM agent 是概率性的,Policy 层不是可选的
  • 传统 SRE 问的是「is it alive?」,agent observability 问的是「is it doing the right thing?」
  • 不确定性的位置不同,但控制论框架通用

2. 同构映射表

SRE 概念 Agent 对应
RBAC Scope Declaration
Blast Radius Authorized Scope
Audit Log Execution Log + INTENT
SLI/SLO Task Success Rate / Convergence Time
Reconciliation Loop Agent Loop
Desired State (YAML) Spec
Admission Controller Hook

3. Controllability > Capability

  • 生产系统为 auditability、reversibility、interruptibility 付费,不是为推理能力付费
  • 「亮区假象」(false bright zone) vs 「暗区」(dark zone):agent 自信地给出错误答案比承认不知道危害更大
  • 数据支撑:88% agent PoC 失败在系统/集成层面,不在模型能力层面

4. 三支柱速记

「限制它、看见它、让它回正」

  • Constraints(限制行为空间和影响范围)
  • Observability(让决策和工具效果可检视)
  • Convergence(检测偏离,拉回正轨)

5. 这意味着什么

  • SRE 的工具箱(checkpoint、circuit breaker、OTel、budget enforcement)直接适用于 agent runtime
  • 不需要从「AI agent framework」角度理解这个领域,从「控制系统设计」角度更有效
  • 工程基本面:终态定义、收敛机制、准入控制、隔离边界

涵盖的 Topic

  • Topic 1: SRE ↔ Agent 同构性
  • Topic 3: Controllability > Capability

源文件引用

  • contexts/thought_review/agent_sre_production_systems_synthesis_20260330.md — 同构论的完整论证,三个同心圆模型,八条负载结论
  • contexts/thought_review/k8s_sre_agent_controllability_model_20260330.md — K8s-Agent 映射表,五维控制框架,五层工程架构
  • contexts/thought_review/agentic_ai_controllability_design_20260329.md — GCORF 框架,Agent 定义(开放行为空间 + 有界执行约束)
  • contexts/thought_review/agentic_control_theory_primitives_20260413.md — 四原语完整推导(本篇引用同构部分)
  • rules/skills/bestpractice_agent_reliability_engineering.md — 三支柱 skill 定义