NeFut Logo NeFut
EN 管理员登录

[AI学术] EVOL:基于模拟器的进化专家合成用于免部署学习路径推荐

发布于:2026-10-06 22:00 最后更新:2026-10-08 01:25
#algorithm #AI #Machine Learning

强化学习用于学习路径推荐面临两大耦合难题。其一,策略必须一次性决定 L 个概念的序列,期间没有反馈,搜索空间随 L 超指数增长,奖励仅在最后一步给出。其二,理想的专家路径可以缓解稀疏奖励,但教育日志只记录学生实际行为,而非应当的最佳路径。为同时突破这两点,我们借鉴机器人领域的基于模拟器的示范学习思路。利用知识追踪模拟器,先通过进化搜索为每个学习者合成专家示范,再训练一个无需部署的策略,将示范蒸馏为前馈模型。EVOL 框架实现了这一流程,核心为不对称的 actor‑critic:actor 在训练和推理时只能看到盲规划的状态,critic 在训练时可使用模拟器提供的特权状态。我们在 ASSIST15、Junyi、EdNet 三个数据集(概念数 39‑189)以及路径长度 5、10、20 上与 8 种基线比较,涵盖启发式、序列模型、强化学习、图增强 RL 与 LLM 增强方法,EVOL 均取得领先。进一步对比行为克隆(BC)、优势加权回放(AWR)和 DAPG 三种模仿学习目标,实验表明最终表现主要受进化生成的专家质量支配,而非具体的模仿损失函数。

点评

原文链接: https://arxiv.org/abs/2610.03273

[h] 返回首页