NeFut Logo NeFut
EN 管理员登录

[AI学术] LAVOIR:单次前向决策编码器的价值信息路由

发布于:2026-09-28 22:00 最后更新:2026-09-30 01:41
#algorithm #AI #LLM

“System One” 决策模型(如 TypeSafe 的 Jev 与开源 Laya)能够在一次前向传播中给出带校准概率的答案,但无法主动询问信息缺口:当首条消息未说明两个部门的区别时,它们只能猜测。LAVOIR(Laya with Value‑Of‑Information Routing)在输入中把候选缺失信息(槽位)放在答案选项旁,使一次前向传播即可输出决策分布以及每个槽位的期望增益——即若向用户询问该槽位,正确决策概率的提升。VOI 目标无需人工标注:金标准决策来源于模式规则,LLM 负责生成消息与答案,另一模型族负责校验文本,多个用户画像的配对让实际增益回归估计期望增益。Gini‑impurity 上限约束预测值不超过校准模型还能获得的提升。受控实验表明,在已见模式上决策误差与贝叶斯上限无显著差异;最终模型的提问策略在已见模式上与贪婪 VOI 哨兵相匹配(AUC 0.799 对 0.797),且在每轮对话最多 0.5 条提问时比永不提问提升 14.1 分。真实 ABCD 对话中,一次有效提问提升准确率 8.3 分,而未提问时保持不变;在 SGD 数据上,上限将提问率从 93% 降至 8.6%。在 Laya 的十二项基准中,LAVOIR 在七项上超越 Laya 报告的分数,且在 GH200 上的回答中位时延为 31 ms。

点评

原文链接: https://arxiv.org/abs/2609.30706

[h] 返回首页