在金融行业,债务催收是一项关键的谈判任务,具有重要的实际意义和学术价值,为以人为本的对话系统提供了丰富的行为测试场景。尽管大型语言模型(LLMs)在对话和谈判中展示了潜力,但在复杂场景中有效评估其性能依然是一大挑战:现有基准普遍假设用户为静态、理性的代理,固定偏好,未能捕捉到真实债务催收中固有的丰富行为异质性。
为了解决这一问题,我们提出了DebtBench,这是第一个公共的、增强了角色特征的债务催收基准,突出了谈判中的行为异质性。此外,我们开发了DebtGPT,这是一种债务催收代理,旨在同时优化财务回收和交互体验。
实验结果显示,使用16种最先进的LLMs,大多数现有模型在这种复杂但现实的场景中表现不佳,而DebtGPT超越了所有开源基准,达到了与GPT-4o相当的性能。代码和数据可在 GitHub 上获取。
博主点评: 本文通过引入行为异质性,为债务催收对话系统设定了新的基准,推动了对话系统在复杂场景中的应用。DebtGPT的优越表现不仅证明了这一方法的有效性,也为今后的研究提供了重要的参考框架。这样的创新思路值得在更多领域进行探索与应用。