benchmarks-and-validation

基准测试与 harness 验证方法

上级:recursive-harness

重点不是排行榜分数——而是要证明架构的每一个部件确实起作用。因此:选择能够隔离出机制本身的基准测试,然后做消融实验

第一层——隔离 collapse + backtrack + satisfice(约束规划)

失效模式 = 违反约束;指标 = 约束可行性 = CSP-collapse 机制的直接输出。已知结果:模型性能在约束数超过约 7 个之后急剧下降——这正是 collapse+backtrack 应该能拉平的那条曲线

  • TravelPlanner——行程规划,6 个工具,软硬约束并存。
  • Natural Plan(Google)——日程/会议/行程安排 = 约束传播。
  • COMPASS(2025)——LLM agent 中的约束优化。
  • DeepPlanning(2025–26)——带有可验证约束的长时程规划。
  • (更干净的起点:玩具级 CSP——逻辑网格谜题、N 皇后、图着色——用来单独隔离出传播/collapse。)

第二层——gate = 可机械验证的完成状态(decompose + verify)

gate 就是测试/状态本身。

  • SWE-bench Verified(gate = 测试通过;已接近饱和,约 89%)· SWE-EVO / RoadmapBench(长时程、多文件、以周计——用来检验"gate 能否阻止跨阶段的错误累积")· AppWorld(可验证的应用状态)。

第三层——长时程收敛 + 过程(scaffold 能否阻止漂移)

  • GAIA(多步工具链,天花板约 75%)· UltraHorizon(超长时程)· LH-Bench——评分对象是过程/工作流(是否遵循了正确的阶段),而不只是最终结果 → 直接检验了 stages-and-gates 这一主张。

如何验证(真正要紧的部分:消融实验)

单一的基准分数无法证明是哪个部件在起作用。因此:

  1. 基线: naive 单次推理 / ReAct / CoT,再加上 Tree-of-Thoughts / LATS(现有的树搜索 agent)。
  2. 逐一消融每个部件,展示性能下降:
    • −gate(去掉 soft→hard 的重新落地)→ 预期在长任务上出现漂移(验证 stages-gates-bound-the-search);
    • −backtrack / −no-good learning → 预期出现抖动/重复探索(验证 conflict-learning-and-backjumping);
    • −decomposition(扁平搜索)→ 预期在复杂任务上出现 collapse;
    • −explanation(LLM 只给是/否,不给理由)→ 预期剪枝效果变弱(验证 llm-as-fallible-theory-solver)。
  3. 衡量成本,而不只是分数(LLM 调用次数/token 数)——这套架构是用算力换可靠性;要证明它在帕累托意义上优于 ToT/LATS(同等分数更便宜,或同等成本更准确)。
  4. 跟踪机制信号: backtrack 次数、学到的 no-good 数量、约束违反率随时程的变化、gate 捕获了多少错误——这些都是该机制确实按理论预测运作的直接证据。

诚实的告诫

真实世界的基准(SWE-bench/GAIA)杂乱且接近饱和——很难分离出究竟是哪个部件起了作用。先在约束隔离、指标对齐的基准上(TravelPlanner / Natural Plan / COMPASS)验证机制本身,再把整体拿到 SWE-EVO / GAIA 上去检验。

about this entry

One of sijie's wiki entries. The AI on this site is grounded in the same corpus and answers in sijie's voice, with citations back to entries like this one — answering costs sijie money, so it waits behind a code: enter an access code →