NeFut Logo NeFut
EN 管理员登录

[AI学术] 提升苏格拉底式辅导的稳定性:应对支架崩溃的新方法

发布于:2026-07-23 22:00 最后更新:2026-07-26 07:44
#AI #Machine Learning #optimization

摘要

基于大语言模型(LLM)的苏格拉底式辅导越来越多地通过多轮提问引导学生,但它们可能会遭遇支架崩溃:在持续的学生压力下,辅导员逐渐放弃引导式探究,直接揭示解决方案。以往的防御措施主要通过提示、偏好优化或过滤来限制可观察的响应,而对于导致轨迹级崩溃的内部表示漂移却几乎没有处理。

我们提出了一种支架保持表示对齐的两阶段框架,首先通过监督微调对苏格拉底式辅导进行预热,然后结合轨迹加权的直接偏好优化与锚定于冻结参考状态的边际保持表示损失。我们的方法旨在保持对话轮次中支架保持状态与崩溃诱导状态之间的分离。

我们在五个STEM学科和五种红队攻击策略上评估了我们的方法。在Qwen3-8B模型上,我们的方法将崩溃率降低到32%,将平均崩溃发生时间延迟到九轮之后,并保持低拒绝率,表明表示级对齐可以在我们的红队协议下提高长期苏格拉底辅导的稳健性。

博主点评: 该研究通过引入支架保持表示对齐的方法,成功解决了苏格拉底式辅导中的支架崩溃问题,具有重要的实践意义。它不仅优化了辅导的有效性,还为长期对话系统的稳定性提供了新的视角,值得进一步探索和应用。

原文链接: https://arxiv.org/abs/2607.19371

[h] 返回首页