NeFut Logo NeFut
EN 管理员登录

[AI学术] KuaiRP 系列角色扮演模型技术报告

发布于:2026-09-12 22:00 最后更新:2026-09-15 01:15
#AI #LLM #Open Source

本文提出了 KuaiRP 系列角色扮演模型的完整技术方案,围绕四个核心目标展开:简化 Prompt 工程、输出质量高度稳定、内置领域知识以及小参数量高效部署。深度领域知识的注入往往会导致模型的通用代理能力出现灾难性遗忘,为此我们设计了多阶段训练流水线。

第一阶段构建统一的角色模板,并基于用户行为模拟与逆向画像过滤搭建 SFT 数据流水线,实现角色信息的高质量对齐。

第二阶段在强化学习阶段引入规则化复合奖励函数,针对常见的长度膨胀和重复生成等退化现象进行约束,确保生成文本的连贯性与多样性。

第三阶段提出自蒸馏范式——两阶段在策略蒸馏(Two-stage On-Policy Distillation, OPD)结合累计散度衰减(Cumulative-Divergence Decay, CDD)。以领域适配模型为教师、原始基座模型为学生,通过 OPD‑CDD 同时恢复在 SFT 与 RL 中受损的通用能力,实现深度领域知识注入与通用能力保持的平衡。

实验结果显示,KuaiRP 模型在目标领域的角色扮演保真度已达到当前最先进的商业模型水平,同时成功恢复了通用代理能力,并保持了极低的部署成本。

点评

原文链接: https://arxiv.org/abs/2609.11127

[h] 返回首页