NeFut Logo NeFut
EN 管理员登录

[AI学术] 人机协同假设检验:成本感知的选择性 AI 打分与顺序人工升级

发布于:2026-09-25 22:00 最后更新:2026-09-28 00:49
#AI #Machine Learning #optimization

大型语言模型正被用作低成本评判者,执行输出评估、数据标注以及系统质量检测。但在正式统计推断中直接把 AI 判定当作真值标签是不合适的,因为 AI 可能存在偏差和噪声,假设检验必须严格控制 I 类和 II 类错误。

本文研究在成本约束下,如何结合 AI 判定和选择性人工核验完成有效的假设检验。设有隐藏二元标签的样本集合,决策者在固定的样本池中可以:① 直接查询 AI;② 直接交给人工;③ 在观察到 AI 报告后将该样本升级为人工复核;④ 当累计证据足够时停止。

我们给出一个信息论下界,描述在给定错误率约束下的最小成本,并通过报告依赖信息前沿刻画 AI 信息和人工核验的价值。信息下界可表为 $$C_{\min}= \frac{\log(1/\alpha)}{I_{\text{AI}}} + \frac{\log(1/\beta)}{I_{\text{human}}}$$。

基于此,我们提出 SCALE——一种顺序、成本感知的策略,融合选择性 AI 打分和自适应人工升级。SCALE 在有限样本下保持检验有效性,并在目标错误概率趋于零时一阶匹配下界。进一步地,针对未知的 AI 输出模型,我们利用配对的 AI‑人工试点数据进行估计。

数值实验表明,当 AI 或人工单独占优时,SCALE 的表现接近相应的纯 AI 或纯人工检验;而在 AI 成本低且人工核验仍有价值的情形下,SCALE 能实现最大的成本节约。

点评

原文链接: https://arxiv.org/abs/2609.28859

[h] 返回首页