在实现类人私聊时,系统不仅需要流畅的响应生成,还必须保持角色特征、关系、记忆、界限知识、媒介特定时机以及连贯的多轮对话弧。我们提出了 AnthroDial,这是一种将人性化对话视为系统架构、可执行评估和诊断对齐的联合问题的闭环框架。它结合了以下三个方面:
- 角色条件的调度对话运行时,包括角色和场景卡、长期记忆、虚拟时间以及单次草稿消息决策;
- 可执行基准,配备 L0 有效性门、五个每轮维度和五个对话级维度;
- 后训练流水线,筛选出 16,436 个调度决策示例用于 SFT,并应用 GRPO,结合认知诊断和 ZPD 感知奖励。该奖励通过 Kalman 滤波保持每个行为维度的能力估计,对能力缺口较大的维度进行加权,并使用回滚分数作为任务级 ZPD 匹配,以集中优化可学习的弱技能。
在一个包含 55 个角色、50 个场景、50 个角色-场景绑定和每个模型 100 个角色条件案例的基准测试中,我们评估了 16 个系统,涵盖前沿基线、开放模型、思考/非思考变体,以及 SFT/RL 消融实验。最强的非训练基线达到 32.00% 的严格准确率,而 Qwen3.6-27B-SFT+RL 达到 39.00% 的严格准确率和 98.5 的整体分数。在 9B 的非思考设置中,SFT 和 RL 将严格准确率从 0.00% 提高至 13.00% 和 18.37%。这些结果表明,当生成、评估和奖励塑造共享相同的行为维度时,人性化对话受益匪浅。
博主点评: 该研究展示了如何通过闭环框架来提升类人对话的生成与评估效果,强调了行为维度的共享对系统性能的重要性。未来的研究可以进一步探索如何优化这些维度,以实现更加自然和人性化的对话体验。