NeFut Logo NeFut
EN 管理员登录

[AI学术] 人工智能价值观一致性理论初探

发布于:2026-08-12 22:00 最后更新:2026-08-13 01:53
#AI #LLM #Artificial Intelligence

人工智能系统能否与人类价值观保持一致?近年来,大型语言模型(LLMs)和多模态基础模型的兴起导致了有害行为的增加,包括有毒言论、幻觉和AI代理执行未经授权的行为。在AI安全领域,这些有害行为通常被视为一致性问题,即模型与人类价值观不一致。研究人员通过追求应用和理论的AI价值一致性努力来应对,但通常没有明确说明他们对人类价值观的定义。那么,AI价值一致性领域如何看待人类价值观?这些价值观的概念如何在技术上被操作和评估?从这个领域出现的价值理论对AI的未来意味着什么?我们注释了94篇价值一致性研究论文,以揭示其对AI中价值观的隐含理论。大多数论文没有定义价值观,严重依赖偏好作为替代,这有可能将复杂的文化概念简化为二元选择。当研究人员放弃使用人类注释器进行模型训练和评估,转而使用合成数据和自动评估方法来对齐和评估模型时,我们发现可能会关闭替代方法来争论和执行基础模型中的价值观。通过使AI价值观一致性的哲学承诺显式化,我们旨在为是否和如何让AI解决人类价值观的辩论带来更大的具体性和未被探索的视角。博主点评: AI价值一致性是一个复杂的问题,需要对人类价值观有更深入的理解和更明确的定义,否则我们可能会陷入简化复杂问题的陷阱中,忽略了文化和社会背景的重要性。

原文链接: https://arxiv.org/abs/2608.10327

[h] 返回首页