harness 的可观测运行依赖高可观测性的指标
人类在 agent 输出里抓到一个错误数字,这不是质量控制——这是可观测性缺失的存在性证明。这次抓包只是轶事;原则在这里:
agent 输出中的一个量化结论,只有携带了自己的出处——数值 + 来源 + 测量范围——才够得上 harness 级别。不是写 8,而是写 8(自然搜索——app 属性 493986654,路径维度,90 天)。这样打上类型之后,误用就变成了一个门禁能机械拒绝的类型错误——一个引用了 app 类型数字的 web SEO 结论会当场露馅——而不再是一个潜藏的错误结论,一路存活到某个眼尖的读者皱起眉头才被发现。
推论:
- 肉眼检查是兜底,从来不是设计。如果 harness 的验证故事是"审阅者扫一眼数字有没有刺眼的地方",那 harness 根本没有验证故事。
- 促成这篇笔记的两个失败案例,其实是同一个缺陷:结论里那个承重的数字,来源没有被钉住(一个是凭空编的,一个是属性认错了)。这两个案例本都该死在类型层。
- 这正是把 certificate-is-the-subagent-boundary 用在算术上:一个裸数字是自我叙述;一个标了来源的数字才是可核验的凭证。
相关:certificate-is-the-subagent-boundary · FlexMesh 方法论上的那道疤(永远不要用 app 归因去判断 web SEO)就是这篇笔记的活体样本