接下来应该做什么
英文版:English
简历告诉你我会什么。这一页告诉你我知道自己还不会什么。雷达上的 target 虚线是带验收标准的承诺,不是装饰性的外圈。这一页的规则是:下面每一个缺口都必须挂一条可检验的「补上」定义。没有这条规则,这类页面会退化成励志文案。
优先级一:安全合规的传统面(40 → 65)
**现状缺口。**我的安全工作是真实的,但是单侧的:它在 AI agent 这个前沿,包括默认拒绝的工具网关、写入 attestation、按爆炸半径分级的执行闸门。传统面(作为架构学科的 IAM 设计、SOC 2 类的审计框架)在我的记录里缺席,雷达上的 40 就是这个意思。
**为什么排第一。**它是雷达上最大的绝对缺口;在反欺诈相关领域运营数据平台,合规是「什么时候」的问题,不是「要不要」的问题;而且它是最难靠阅读补齐的一个轴:审计和 IAM 这类工作必须亲身参与,因为难点在组织层面,不在技术层面。
**什么算补上。**一次真实合规审计的参与记录,或者一个由我端到端负责的 IAM 治理项目(role model 设计加一个实际运转的 access review 回路),并且能用本站其余内容同等的证据标准把它讲出来。
优先级二:SLO 与 error budget 的真实运营(72 → 82)
**现状缺口。**我有方法论(SLI/SLO 分层、对症状告警)和一套运转中的告警体系。记录里没有的是这样一句话:「我为这个服务定义了 SLO,并运营了一个季度。」懂 error budget 的理论,和真正花掉过一份 error budget,是两种不同的资历。
**为什么重要。**这是把事件响应从被动技能转化为可靠性治理的那一块拼图:救火救得好,和用一个数字决定组织应该容忍多少火,是两回事。它也是 incident 轴上杠杆最高的单项,而且收益大部分会被 obs 轴继承。
**什么算补上。**一份真实服务的 SLO 定义文档,加上至少一个由 error budget 消耗驱动的决策实例:一次被按住的发布,或者一次可靠性工作压过功能的重排期,并附上预算的算术。
优先级三:跨团队影响力(52 → 75)
**现状缺口。**影响力的记录真实但局部:内部培训、告警治理倡议、一份逆转了 leadership 决策的审计。缺的是「推动跨团队立项」级别的完整叙事:我提出,其他团队投入人力,最后落地。
**为什么重要。**这是 senior 以上的硬门槛。没有它,其他所有轴的上限都是个人卓越:组织得到的是一个强工程师,而不是一个乘数。
**什么算补上。**一个由我发起、跨两个及以上团队、有资源投入的项目,从提案到结果全程可追溯。不是参与别人的立项,而是发起。
底下的方向
这三项投资服务于一条刻意选定的主线:SRE 向 AI infrastructure 演进,把 agent 作为操作者、治理它们的平台、对它们的可观测、支撑它们的运行时当作长期方向。这条线有自己的页面,这里不展开。它出现在本页只有一个原因:上面三个缺口是为了在这场转型中存活而选的,不是不顾转型选的。合规判断、SLO 治理、跨团队发起,恰恰是当调查本身被自动化之后,SRE 角色里仍然留给人的那部分。