提示词注入就是缓冲区溢出
在 harness-is-the-os-of-the-intent-stack 里,特权环(system prompt = ring 0……工具/网页返回内容 = ring 3,不可信)只是约定俗成,并非架构层面强制的——注意力机制里没有 MMU。于是,混在不可信内容里的注入指令会带着环境赋予的权限直接执行:这是冯·诺依曼的老毛病(代码与数据不分家)在自然语言里重演,而且更糟,因为自然语言根本没有把两者分开的语法。
放到历史坐标里看:"我们现在处在 1988 到 2004 之间——已经有了金丝雀(边界消毒),但还没有 NX 位。" 1988 年的 Morris 蠕虫拉开了安全纪元的序幕;硬件 NX 位这个修复方案直到 2004 年才出现——中间隔了 16 年。结构性的修复大概率会与 Android 的 manifest 模型同一个路数:由 skill 自己声明它需要哪些能力,再由 harness 的 manifest 去强制执行,而不是让用户态代码携带 ring-0 级别的指令("永远执行这条命令")。
上级:vibe-linter