NeFut Logo NeFut
EN 管理员登录

[AI学术] MoMHa:在准确性、安全性和令牌消耗上的多目标LLM Harness优化

发布于:2026-09-29 22:00 最后更新:2026-09-30 01:41
#AI #optimization #LLM

大多数提升大语言模型的工作只把准确性当作唯一目标。我们认为,围绕模型的 Python harness——负责构造提示、路由调用和解析输出的代码——本身是一个需要同时考虑多目标的设计面:仅追求高准确却不拒绝不安全请求,或消耗数量级更多令牌的 harness 都不算好。为此我们提出 Meta‑Harness,将 harness 设计表述为在每个领域上同时优化准确性、行为安全和令牌成本的搜索问题,并使用具备完整文件系统访问权限的智能提案者 Claude Code 来执行搜索。核心发现是,单阶段联合奖励提案者(MoMHa)在所有对比中表现最佳,优于两阶段“先准确后令牌”方案、仅标量反馈以及仅准确性基线。我们在 17 个领域进行评估:7 个合成能力套件、7 个真实世界公开基准(HumanEval、MBPP、Spider、FEVER、MMLU‑Pro、LawBench、NuminaMath)以及 3 个基于 U‑SafeBench 的用户特定安全域,使用覆盖四个模型家族的 12 模型舰队。合成轨道上 MoMHa 的联合平均得分为 0.482,显著高于 0.198‑0.422 的十个基线,并在 10 个领域中赢得 7 列;真实世界轨道上得分 0.461,超过最强基线 DSPy 的 0.377,赢得 5/7 列,表明 harness 策略能够在未重新训练的情况下迁移到 12 个目标模型中的 8 个。MoMHa 还实现了最高的行为安全综合得分(U‑SafeBench,0.781),并比两阶段方案每例节省 95 个令牌。我们将公开所有 harness 代码、评估基础设施以及跨模型日志。

点评

原文链接: https://arxiv.org/abs/2609.30967

[h] 返回首页