NeFut Logo NeFut
EN 管理员登录

[AI学术] StanceBench:音频LLM基础的人际立场评估基准

发布于:2026-07-29 22:00 最后更新:2026-07-30 03:24
#AI #Machine Learning #LLM

摘要

随着语音对话模型越来越依赖音调和互动细节来传达社会意图,但针对这些线索的基准仍然有限。我们推出了 StanceBench,这是一个用于测量对话语音中人际立场的基准,并评估音频能力 LLM 作为自动评判者的性能。

使用 Seamless Interaction 语料库,StanceBench 实现了以下功能:

  1. 通过角色提示极进行9个立场维度的规范化;
  2. 标准化单一发言者和互动基础的评估;
  3. 报告 LLM 作为评判者的稳健性、偏见和立场推断。

在评估的立场中,表现出同理心和礼貌是最容易的。温暖和自信则表现出中等的可分离性,带有积极性偏斜/不对称。诚实是最难的,显示出高提示顺序偏见,这与需求跨轮证据的特点一致。关注度虽然可分离,但与人类的对应关系较弱。互动立场更加依赖上下文,尤其是在冲突调节方面,存在阈值差距和高方差。

博主点评: StanceBench 的推出为音频 LLM 提供了一个重要的评估工具,能够帮助研究人员更好地理解和优化人际沟通中的立场表达。通过标准化评估维度,可以有效地进行不同模型的比较与改进,从而推动语音对话系统的进步。

原文链接: https://arxiv.org/abs/2607.22658

[h] 返回首页