全双工语音助理需要在持续对话中实时决定何时倾听、提供回声、打断、处理重叠、抢占发言权以及让出话筒。现有基准大多通过显式的轮转管理指令来测试这些行为,而实际部署的助理往往通过角色或人格配置,需要从中推断合适的对话策略。为此我们推出 DuplexSpeechBench-IFEval(DSB-IFEval),用于评估实时口语交互中的隐式指令遵循能力。DSB-IFEval 包含 1,038 条测试用例,覆盖八种不同的助理角色,并考察五种条件协议:默认行为、显式行为指令、人格暗示行为、人格‑规则组合以及指令冲突。我们使用确定性的指令遵循得分(IAS)衡量实时抢占管理,用大型语言模型评估的人格一致性得分(PAS)衡量内容是否符合角色设定。对六种实时语音系统进行实验,发现表现受模型架构影响显著。全双工模型如 F‑Actor 和 PersonaPlex 对显式指令和人格暗示的敏感度较高,在仅使用人格条件时,IAS 分别下降 9.7% 和 4.5%。相比之下,GPT‑Realtime、MiniCPM‑o 和 Fun‑Audio‑Chat 在人格一致性内容上表现强劲,但其抢占行为在显式与人格条件下变化不大,且在多项主动行为上受限。即使系统能够遵循冲突指令对应的人格要求,在安全冲突情境下仍难以覆盖这些指令。结果表明,推断角色暗示的行为、在恰当时机执行以及解决相互冲突的指令仍是全双工语音助理的独立挑战。
点评