NeFut Logo NeFut
EN 管理员登录

[AI学术] ReFract:基于文本世界模型的语言模型代理视角感知基准

发布于:2026-10-06 22:00 最后更新:2026-10-08 01:25
#AI #Machine Learning #LLM

大型语言模型(LLM)代理正被部署到工业维护、设备故障排查等高风险场景,使用者拥有多种角色。代理必须根据角色的知识和能力边界采取行动并提供信息,避免超出角色权限。与代码不同,代理的错误会直接作用于真实设备,可能导致不可逆的损坏、产量损失或人员伤害。现有基准大多忽视了让代理推断角色意图并仅通过角色合法工具操作的需求,这一能力我们称为“视角感知”。为此我们推出 ReFract 基准,收录 150 条经专家验证的案例。每条案例来源于匿名化的领域支持对话,构建文本世界模型以模拟代理的运行环境,并生成视角感知的行动轨迹。实验表明,最先进的 LLM 在该基准上最多只能解决 69% 的任务,且超过 50% 的轨迹出现视角违规行为。ReFract 揭示了视角感知作为代理评估的独立且尚未解决的维度,呼吁研发能够校准“如何行动”以及“为谁行动”的模型。

点评:视角感知是提升安全可靠 LLM 代理的关键方向,未来基准和模型需共同进化。

原文链接: https://arxiv.org/abs/2610.03356

[h] 返回首页