大多数提升大语言模型的工作只把准确性当作唯一目标。我们认为,围绕模型的 Python harness——负责构造提示、路由调用和解析输出的代码——本身是一个需要同时考虑多目标的设计面:仅追求高准确却不拒绝不安全请求,或消耗数量级更多令牌的 harness 都不算好。为此我们提出 Meta‑Harness,将 harness 设计表述为在每个领域上同时优化准确性、行为安全和令牌成本的搜索问题,并使用具备完整文件系统访问权限的智能提案者 Claude Code 来执行搜索。核心发现是,单阶段联合奖励提案者(MoMHa)在所有对比中表现最佳,优于两阶段“先准确后令牌”方案、仅标量反馈以及仅准确性基线。我们在 17 个领域进行评估:7 个合成能力套件、7 个真实世界公开基准(HumanEval、MBPP、Spider、FEVER、MMLU‑Pro、LawBench、NuminaMath)以及 3 个基于 U‑SafeBench 的用户特定安全域,使用覆盖四个模型家族的 12 模型舰队。合成轨道上 MoMHa 的联合平均得分为 0.482,显著高于 0.198‑0.422 的十个基线,并在 10 个领域中赢得 7 列;真实世界轨道上得分 0.461,超过最强基线 DSPy 的 0.377,赢得 5/7 列,表明 harness 策略能够在未重新训练的情况下迁移到 12 个目标模型中的 8 个。MoMHa 还实现了最高的行为安全综合得分(U‑SafeBench,0.781),并比两阶段方案每例节省 95 个令牌。我们将公开所有 harness 代码、评估基础设施以及跨模型日志。
点评