银行需要能够回答产品问题、协助账户操作并在严格的运营和监管约束下安全运行的对话系统。通用语言模型在需要基于真实信息、正确使用工具或谨慎处理银行敏感情境时表现不可靠。我们构建了 FiMI Banking,一个受控的印度零售银行环境。数据来源包括经过审查的银行文档、结构化真值表、合成客户背景以及银行工具。我们评估了两种后训练方法:偏好优化用于提升单轮响应的安全行为,强化学习结合可验证奖励用于多轮工具使用任务。偏好优化将超出范围的拒绝率从 52% 提升至 80%。强化学习将边缘案例表现从 0.509 提升至 0.718,顺序敏感任务表现从 0.590 提升至 0.679,同时生成的 token 数减少 29%。这些结果表明,偏好优化和可验证奖励的强化学习分别满足了可靠银行代理的互补需求。
点评