NeFut Logo NeFut
EN 管理员登录

[AI学术] 在 Bluesky 上构建可信的心理健康基准:一种验证感知的弱监督框架

发布于:2026-09-23 22:00 最后更新:2026-09-24 00:40
#AI #Machine Learning #LLM

去中心化社交平台为计算心理健康研究带来了数据获取、内容审核、标签生成和模型部署等多层次的挑战与机遇。本文提出了一套验证感知的弱监督系统,用于在基于 AT 协议的 Bluesky 上构建自杀意念(SI)和更广义心理健康(MH)披露基准。系统包括公开火焰流收集、任务词典过滤、Llama-3-8B 辅助的二元标注、人为审查的验证子集以及基于 Transformer 的模型评估。通过该流水线,我们得到两套任务语料,分别包含 8,346 条 SI 标注帖子和 9,988 条 MH 标注帖子。实验表明模型性能受任务定义和验证协议的双重影响:BERT+LSTM 在 SI 的分层交叉验证中获得最高 F1,RoBERTa 在 SI 的独立持出集上表现最佳,DistilRoBERTa 在 MH 的交叉验证中取得最高 F1。人工验证揭示不同任务的弱标签失效模式:SI 标签主要出现假阴性,MH 标签则以假阳性为主。结果说明,去中心化社交媒体能够支撑可复现的心理健康基准工作,但前提是系统设计、标签来源、验证策略和部署约束必须同步评估。

点评:该框架展示了在分布式平台上结合大模型辅助标注和人工验证的完整路径,为后续心理健康研究提供了可复制、可审计的基准构建方法。

原文链接: https://arxiv.org/abs/2609.22696

[h] 返回首页