银行助理需要使用账户专属信息来回答请求,并在多数情况下通过工具执行操作。仅评估最终回复会遗漏关键错误,例如助理重复询问信息、依赖过时上下文、选错账户,或在给出正确数值后写入错误值。为此我们构建了 IndicBankBench,包含 799 条案例,覆盖印度零售银行的五个业务场景、一个能力/拒绝场景以及二十条主要评估维度。每条案例在安全性、工具使用、回复充分性和建议质量四个阶段进行评估。工具使用和大多数安全检查是确定性的;仅在“模糊确认‑写入”情形下使用窄域解析器,其余语义充分性交由独立的 LLM 判官评估。所有案例均执行三次,采用 strict pass³ 标准——只有三次全部通过才算通过。实验在十一种模型上进行,strict reliability 在 43.7%~58.2% 之间,而 at‑least‑once 成功率在 60%~74% 之间。两者差距表明仅凭一次成功会高估系统在银行业务中的可靠性。案例级诊断还能区分出“提问冗余”与“执行但未对齐客户上下文或未完整解决请求”的系统。我们已公开案例、模拟环境和评估框架。
点评