我们描述了DS@GT对eRisk 2026任务1挑战的提交,旨在进行对话式抑郁筛查。该系统通过与模拟不同抑郁特征的LLM角色进行对话,生成贝克抑郁量表II(BDI-II)得分和四个关键症状,而无需直接询问敏感的心理健康问题。
我们的工作流程经历了三个阶段:最初的单一模型原型,基线多代理架构将对话访谈与BDI-II评分分开,并在协调层下进行管理,最后是混合配置,用开源的Gemma 27B替代了付费的GPT-5-nano访谈者。
为了弥补模型在推理和指令遵循上的不足,混合方案添加了三个算法组件:预计算的对话树标准化访谈开场和后续,受到Weaver框架启发的可靠性加权共识聚合,以及用于未探测症状的聚类插补步骤。
我们提交了针对所有20个角色的三次全自动运行,其中Run 1来自付费基线,Run 2和Run 3来自混合方案。混合Run 3达到了0.9063的ADODL,排名所有完整提交运行的第三,DS@GT在21支队伍中名列第二,同时以约四分之一的人物API成本超越了我们的付费基线Run 1(0.8841)。
这些结果支持了我们的核心假设:在足够的算法监督下,较弱的开源模型能够在对话访谈者角色中与较强的专有模型竞争。我们的源代码可在 GitHub 上获取。
博主点评: 这项研究展示了开源模型在特定领域应用中的潜力,尤其是在心理健康筛查方面。通过有效的算法监督,开源技术可以在资源有限的情况下实现高效的对话式交互,值得进一步探索其在其他领域的应用可能性。