在推荐系统领域,系统往往被视作黑箱,使用户和监管者无法将输出引导至特定意图或审计其行为。这种可控性缺失,定义为系统响应明确指导的能力,仍然是现有评估范式中未被解决的维度。为填补这一空白,我们提出了 CtrlBench-Rec,这是一个协作多代理框架,用于系统评估可控性。我们形式化了三个基本任务:目标内容发现、兴趣画像塑造和流行性偏见缓解,这三个任务共同测量从显式命令到隐式表示引导,再到克服算法偏见的可引导性。
在真实世界数据集和多种推荐模型上进行的广泛实验表明,我们的框架有效量化了可控性并揭示了系统的关键瓶颈,尤其是持续抵制引导长尾内容的现象。CtrlBench-Rec 提供了首个标准化工具包,用于可控推荐研究、算法审计和用户赋能。我们的代码已发布在 GitHub。
博主点评: 本文通过引入可控性评估框架,填补了推荐系统研究中的重要空白,强调了用户对推荐内容的引导能力。CtrlBench-Rec 的提出,不仅为研究者提供了实用工具,也为算法透明度和用户自主权的提升奠定了基础。