NeFut Logo NeFut
EN 管理员登录

[AI学术] PhoenixNest-Video:基于证据的多模态智能体框架用于自动化视频面试评估

发布于:2026-09-03 22:00 最后更新:2026-09-04 02:14
#algorithm #AI #Machine Learning

PhoenixNest-Video 是一种面向视频面试的证据驱动多模态智能体框架。系统首先将候选人的视频、音频和文字转录构建为语义视频图,作为结构化工作记忆。随后在给定评估标准(Rubric)的条件下执行检索,并通过跨模态验证确保视觉、语音和文本信息的一致性,从而提取支撑每一评估维度的行为证据。

评分模型(Scorer)采用基于 Rubric 的强化学习进行训练,奖励函数包含两部分:一是对齐 Rubric 的结构化要求,二是实现不同分数层级的区分度。该双奖励机制使模型内部化多层次评分标准的判别结构。

在 VInterview-2025 数据集上,PhoenixNest-Video 达到 91.50% 的等级准确率,显著超越体积更大的商业闭源模型。紧凑的 Rubric‑grounded 智能体在与专家面板的一致性上优于直接提示更大模型的方式,并且能够为每个分数提供对应的证据,便于人工复核。

关键技术

实验结果

点评

原文链接: https://arxiv.org/abs/2609.02231

[h] 返回首页