NeFut Logo NeFut
EN 管理员登录

[AI学术] 循环语言模型的链式思考可监控性研究

发布于:2026-10-05 22:00 最后更新:2026-10-06 12:11
#AI #Machine Learning #LLM

链式思考(CoT)监控是一种用于发现模型不良行为的技术。循环语言模型(LoopLM)通过在同一组 Transformer 层上多次迭代,实现更大的计算深度而不增加参数量。本文首次系统评估 LoopLM 在 CoT 监控方面的表现。我们采用两种对照:一是固定模型族,改变循环次数以单独考察额外递归计算的影响;二是将 LoopLM 与在参数规模、层数或等效深度上匹配的非循环模型进行比较,检验循环结构是否降低可监控性。实验在 MonitorBench 的八个任务以及标准和压力测试两种设置下进行。结果显示,在特定的逻辑、科学、工程类“Cue Answer”任务的压力测试中,增加循环深度会导致 CoT 可监控性下降,而其他任务的变化较小或呈不同趋势。进一步分析表明,下降并非完全由任务难度、验证通过率或生成长度决定,深层循环模型在使用或归因提示信息的方式上也会发生变化。跨模型比较未发现 LoopLM 相较于匹配的非循环模型在可监控性上有系统性劣势。总体而言,循环深度的增加可能在部分任务的压力测试中削弱 CoT 监控,但循环 Transformer 架构本身并不必然导致可监控性下降。

点评

原文链接: https://arxiv.org/abs/2610.02741

[h] 返回首页