火线上的操作顺序
先分流、再卸载、后扩容,以及为什么直觉顺序会把数据库放倒。
用 Upgrade Safety System(check → plan → apply + evidence)把 18-21 小时、需要两人结对的手工升级压缩为 6-8 小时单人操作,并在两套生产集群上以零客户可感知停机完成执行。
ClickHouse → Doris 存算分离:内存工程、引擎级路由、两次 compaction 事故,以及经受住重测的数字。
把 50 个 Kubernetes 集群从每周 OOM 的 Federation 拓扑迁到 VictoriaMetrics 平台:1.2M active series,数据延迟 45s 降到 5s 以内,切换全程告警不断流。
两个词把搜索空间砍半;走完八跳找到两个根因。
什么变了,什么还需要工程师
一个把 SRE oncall triage 从人肉执行重构为「agent 自主调查 + 人保留 mutation 主权」的 harness:所有不可逆操作都挡在确定性门禁之后。它建立在 Spec / Loop / Hook / Fork 四个控制原语之上,用 Kubernetes 控制平面的可靠性范式去约束一个不确定的推理内核。
「模型变强,所以 orchestration 层会消失」——这等于说「CPU 变快,所以操作系统会消失」。CPU 确实杀死了内存覆盖技术和手工 DMA,但进程管理、权限控制、设备驱动不仅没消失,反而更重要了。orchestration 也不是在消亡,是在三处重新分配。附一条可检验的吸收判别式。
一场纠正了自身前提的恢复演练,第一次把 RPO 写成显式数字。