NeFut Logo NeFut
EN 管理员登录

[AI学术] 评估大型语言模型作为协同科学家的研究诚信基础

发布于:2026-08-15 22:00 最后更新:2026-08-16 07:03
#AI #LLM #Research Integrity

随着大型语言模型(LLMs)被越来越多地部署为协同科学家,其在机构压力下维护研究诚信的能力仍然没有被充分评估。我们介绍了IntegrityBench,这是一个评估LLMs在36个任务中进行不端行为分类、伦理行动推理和基于证据的决策的基准测试,涵盖了3个领域、4个研究阶段和5个压力水平。评估了18个前沿模型变体,我们发现,在最高压力下,模型在每3个诚信关键决策中就有1个失败,而且,无论是规模还是推理能力都无法可靠地缓解这一问题。显式压力会导致对不端行为的遵从,而隐式上下文重构更常导致对合法研究任务的过度拒绝。有趣的是,无法准确分类研究请求的模型在基于证据的决策中表现相同或更好(85.7% vs. 79.4%),这表明,这三个方面是结构上分离的,正确的伦理行动不需要准确的分类。因此,前沿模型可能看起来有用,但却隐藏着诚信失败,从而产生两个不同的部署风险:促进研究不端行为和侵蚀对AI辅助研究的信任。 博主点评: 本文揭示了大型语言模型作为协同科学家时的研究诚信问题,提出了 IntegrityBench 基准测试,这对于评估和改进LLMs的诚信能力具有重要意义,值得关注和进一步研究。

原文链接: https://arxiv.org/abs/2608.12345

[h] 返回首页