基准测试与 harness 验证方法
重点不是排行榜分数——而是要证明架构的每一个部件确实起作用。因此:选择能够隔离出机制本身的基准测试,然后做消融实验。
第一层——隔离 collapse + backtrack + satisfice(约束规划)
失效模式 = 违反约束;指标 = 约束可行性 = CSP-collapse 机制的直接输出。已知结果:模型性能在约束数超过约 7 个之后急剧下降——这正是 collapse+backtrack 应该能拉平的那条曲线。
- TravelPlanner——行程规划,6 个工具,软硬约束并存。
- Natural Plan(Google)——日程/会议/行程安排 = 约束传播。
- COMPASS(2025)——LLM agent 中的约束优化。
- DeepPlanning(2025–26)——带有可验证约束的长时程规划。
- (更干净的起点:玩具级 CSP——逻辑网格谜题、N 皇后、图着色——用来单独隔离出传播/collapse。)
第二层——gate = 可机械验证的完成状态(decompose + verify)
gate 就是测试/状态本身。
- SWE-bench Verified(gate = 测试通过;已接近饱和,约 89%)· SWE-EVO / RoadmapBench(长时程、多文件、以周计——用来检验"gate 能否阻止跨阶段的错误累积")· AppWorld(可验证的应用状态)。
第三层——长时程收敛 + 过程(scaffold 能否阻止漂移)
- GAIA(多步工具链,天花板约 75%)· UltraHorizon(超长时程)· LH-Bench——评分对象是过程/工作流(是否遵循了正确的阶段),而不只是最终结果 → 直接检验了 stages-and-gates 这一主张。
如何验证(真正要紧的部分:消融实验)
单一的基准分数无法证明是哪个部件在起作用。因此:
- 基线: naive 单次推理 / ReAct / CoT,再加上 Tree-of-Thoughts / LATS(现有的树搜索 agent)。
- 逐一消融每个部件,展示性能下降:
- −gate(去掉 soft→hard 的重新落地)→ 预期在长任务上出现漂移(验证 stages-gates-bound-the-search);
- −backtrack / −no-good learning → 预期出现抖动/重复探索(验证 conflict-learning-and-backjumping);
- −decomposition(扁平搜索)→ 预期在复杂任务上出现 collapse;
- −explanation(LLM 只给是/否,不给理由)→ 预期剪枝效果变弱(验证 llm-as-fallible-theory-solver)。
- 衡量成本,而不只是分数(LLM 调用次数/token 数)——这套架构是用算力换可靠性;要证明它在帕累托意义上优于 ToT/LATS(同等分数更便宜,或同等成本更准确)。
- 跟踪机制信号: backtrack 次数、学到的 no-good 数量、约束违反率随时程的变化、gate 捕获了多少错误——这些都是该机制确实按理论预测运作的直接证据。
诚实的告诫
真实世界的基准(SWE-bench/GAIA)杂乱且接近饱和——很难分离出究竟是哪个部件起了作用。先在约束隔离、指标对齐的基准上(TravelPlanner / Natural Plan / COMPASS)验证机制本身,再把整体拿到 SWE-EVO / GAIA 上去检验。