机制要么挂在事件上,要么等于不存在
把工作项目的状态维护、边界控制和输出格式做成一套 2000 行的 hook + skill:必须发生的事挂事件触发,需要判断的事延迟到压缩阶段。以及 CLAUDE.md 为什么会越写越像一份带勘误的日志。
把工作项目的状态维护、边界控制和输出格式做成一套 2000 行的 hook + skill:必须发生的事挂事件触发,需要判断的事延迟到压缩阶段。以及 CLAUDE.md 为什么会越写越像一份带勘误的日志。
一次 4 TB 宽表点查调查:暖缓存、零远程读,仍要 1.12 秒,CPU 内存带宽全部正常。分析型数据库的一等指标是每条查询的扇出,不是主机资源水位。
IaC、K8s、AI Agent 是同一个控制论范式的三次落地:声明期望状态、观测实际状态、diff、收敛。前两代的收敛是数学保证,第三代退化成概率——工程要做的不是消灭这个退化,是用五个杠杆把它兜住。
从 context-infrastructure 这个 repo 本身的三层记忆架构和路由表说起,到一套生产 oncall skill 的四条硬约束,再到从 gstack 批判性抄来的取舍,最后是一次对自己系统的六层诚实体检。这篇讲怎么用,不讲为什么。
审计了一个每天产出约 960 条 OpsGenie 告警、约 85% 是默认 P3、背后有 367 条 paging 规则的 pager:定位四个结构性根因,重建准入、去重和 ownership,让腐化从默认结局变成需要对抗系统的例外。
九个分数如何从证据密度推导、每个分数意味着什么,以及一份独立交叉验证雷达形状的行为记录。
一个自研、持续运行的 systemd 层 daemon,把 Intel 的 Best Known Configuration 从一份 prose 加 shell 的文档,变成 git 里声明式、被持续审计的 desired state,覆盖分布在多个 cluster 的约 30 台裸金属服务器。
一个平时 0 副本的重查询计算池背后的五个设计决策:用物理隔离而不是负载分级、用离散容量而不是逐查询伸缩、按瓶颈类型而不是按数据量定容、把 controller 收敛成对一个字段的 patch,以及一条假设「每个健康信号最终都会骗人」而设计的 readiness 路径。spot 只是分池决策的结果,不是重点。
在 Apache Doris FE 内新增一条 SQL 语句,每条查询执行前 6-8ms 判定 heavy/light。工作在 fork 上完成,mechanism 准备 upstream,policy 刻意留在内部。
一个在打开任何 tablet 之前把 566 个 tablet 剪到约 1 个的跨 tablet 点查索引,以及一个消掉串行化而不是消掉 IO 的宽读预取 —— 选这两个是因为它们的成本里大部分是可避免的扇出,做成 fail-open 是因为它们永远不许改变结果。包含我们真正付出的那个代价,以及它造成的一次静默事故。