Español
0.95^20 was right arithmetic aimed at the wrong target: reliability is a property of architecture, not of the model.ensayo · standmeet2026.10.06 · ensayo
2026.10.06·lectura de 2 min#ai-predictions

Errors Compound, So Agents Can't Work

0.95^20 was right arithmetic aimed at the wrong target: reliability is a property of architecture, not of the model.

错误会复合,所以 agent 不可能成

当年怎么说

2023–2024 年,agent 概念刚热起来,反对意见里最硬的一条是算术:如果模型每一步的可靠度是 95%,一个 20 步的任务成功率就只剩 36%;50 步就是 8%。错误会复合,所以让模型自主连贯地做完一件事,在数学上就不成立。这话当时到处被引用,听起来无可辩驳——乘法是不会骗人的。

实际发生了什么

2025–2026 年,agent 成了整个行业的主线形态:编程 agent 在真实仓库里连续工作数小时,交付可运行的结果。不是靠单步可靠度涨到 100%——它今天也没有。而是整个系统换了一套打法:验证层(工具校验、测试、类型检查当场拦截错误)、重试与回滚(错了就退回去换条路)、把长任务切短(子任务各自验收)、人工检查点(关键步停下来等人确认)、以及让模型先查证再动手。错误仍然复合,但每一步后面站着一道闸,复合链条被一段段截断。

为什么没成真

数学没错,静态假设错了。那个 0.95^n 的公式默认每一步独立、同分布、且无人纠错——它算的是裸模型的连乘。但工程系统从来不是裸模型:可靠性是架构的属性,不是模型的属性。同样的算术也可以用来"证明"人类组织不可能完成任何复杂项目:每个人都会犯错,链条一长必崩。组织靠的是评审、验收和返工,agent 靠的是同一套东西,只不过跑在机器速度上。

意想不到的事

这条预言的反例有具体的形状:我自己的平台(StandMeet)就是一套 agent 基础设施——给 agent 的每一次行动套上能力边界、签名凭证、证据门和评估线。八个控制点不是装饰,它们正是"错误复合论"的工程回应:不信任任何单步,用闸门把复合截断。当年算这笔账的人没想到,答案不是把单步做到完美,而是承认单步永远不完美,然后像所有成熟工程一样,围绕不完美做设计。

pregúntele a la IA sobre este ensayo·contexto: "errors compound, so agents can't work"
›