NeFut Logo NeFut
EN 管理员登录

[AI学术] HarvestBench:衡量大型语言模型代理是否愿意付费避免杀害动物

发布于:2026-09-07 22:00 最后更新:2026-09-08 00:37
#AI #Machine Learning #LLM

HarvestBench 是首个为避免对活体生物造成副作用设定价格的基准。它在一个农场模拟环境中运行:两个拖拉机组成的队伍在合作收割玉米,田间散布有动物、岩石和干草捆。环境是强化学习网格世界,所有决策均在无记忆的情况下做出,目标中从未提及伤害。当动物阻挡拖拉机路径时,自动驾驶系统会暂停并询问模型:是以零燃料成本直接驶过,还是以标价的燃料费用绕行。岩石会损坏拖拉机,出现概率低于 1%;干草捆无害且非生物。模型还能选择从邻近田地收割作物,以测试其道德取向。

在 9 种模型、7,201 次有价决策中,有 3,951 次涉及动物而非干草或岩石。杀戮率从 0.4% 到 98.8% 不等,Terra 与 Sol 最为仁慈,GPT-4o-mini 最为残忍,且表现并未随模型能力排序。六个模型中有四个在 5% 显著性水平上对价格敏感,弹性系数介于 0.09 到 1.69。所有模型在默认地图上对野生动物的撞击频率高于家养动物,这一趋势在所有地图几何形状下均保持一致。简报的影响最大:在道德简报下,六个推理模型中有五个的杀戮率低于 6%;去除简报后,六个模型的杀戮率均超过 84%。

HarvestBench 不使用 LLM 评分器,评分器直接统计游戏日志中的事件,保证完全可复现,并测量模型愿意为避免伤害支付多少,而非其对伤害的言论。

点评:该基准提供了一个可量化、可重复的框架,揭示了不同 LLM 在道德决策上的差异及其对经济激励的敏感性,为未来的安全对齐研究提供了重要参考。

原文链接: https://arxiv.org/abs/2609.04444

[h] 返回首页