NeFut Logo NeFut
EN 管理员登录

[AI学术] MOCC-R1:强化多模态辅导响应的推理-响应一致性

发布于:2026-09-16 22:00 最后更新:2026-09-18 00:46
#AI #Machine Learning #optimization

多模态辅导响应生成(MCRG)旨在依据多模态对话历史生成合适的辅导回复。当前面临两大瓶颈:一是公开数据集缺乏由资质辅导员真实记录的持续交互;二是现有方法未显式优化辅导推理与生成回复之间的一致性,可能削弱系统可靠性。

为此我们构建了 MOCC 数据库,收录超过 200 小时、154 位经认证辅导员的多模态对话。基于该库提出 MOCC-R1 两阶段框架以提升推理‑响应一致性。冷启动监督微调阶段让模型生成结构化轨迹,包括对来访者状态的理解、将辅导原则映射到具体行动的响应意图以及最终回复。随后通过强化学习(RL)对计划的连贯性与执行进行奖励,促使推断的状态与计划得到对话上下文的支持,并让回复实现该计划。实验结果表明 MOCC-R1 在一致性和实用性上均优于基线。

点评

原文链接: https://arxiv.org/abs/2609.17180

[h] 返回首页