NeFut Logo NeFut
EN 管理员登录

[AI学术] Alipay-PIBench:针对编码代理的现实支付集成基准测试

发布于:2026-07-17 22:00 最后更新:2026-07-18 08:18
#algorithm #AI #Open Source

摘要

支付集成是一项要求极高的库级软件任务:代理必须选择合适的产品,实现协调的客户端-服务器流程,验证支付结果,并保持交易与业务状态之间的一致性。我们推出了 Alipay-PIBench,这是一个用于评估编码代理在现实 Alipay 支付集成中的基准测试。它包含九个特定产品的项目和18个任务实例,每个实例分为基础功能完成和高级风险意识强化场景。

场景特定的评分标准支持确定性静态、单元、集成和端到端检查,并通过 LLM 辅助评估语义要求。我们评估了六种编码代理模型,并报告了评分通过率(RPR)。在具备技能的条件下,平均 RPR 范围为 68.58% 到 91.37%。相较于无技能条件,获得 alipay-payment-integration 技能的平均 RPR 提高了 10.31 个百分点,且不同模型、产品和场景的增益各异。

方法级结果区分了源级完成、可执行支付行为和支付领域要求。Alipay-PIBench 提供了一个受控环境,用于诊断模型能力和评估支付集成中的结构化指导。

博主点评: Alipay-PIBench 为编码代理的支付集成评估提供了一个系统化的框架,不仅涵盖了多种场景和任务,还通过 LLM 辅助评估提升了结果的可靠性。这一基准测试的推出,将为未来在支付系统中的智能代理应用提供重要的参考依据。

原文链接: https://arxiv.org/abs/2607.14573

[h] 返回首页