PhoenixNest-Video 是一种面向视频面试的证据驱动多模态智能体框架。系统首先将候选人的视频、音频和文字转录构建为语义视频图,作为结构化工作记忆。随后在给定评估标准(Rubric)的条件下执行检索,并通过跨模态验证确保视觉、语音和文本信息的一致性,从而提取支撑每一评估维度的行为证据。
评分模型(Scorer)采用基于 Rubric 的强化学习进行训练,奖励函数包含两部分:一是对齐 Rubric 的结构化要求,二是实现不同分数层级的区分度。该双奖励机制使模型内部化多层次评分标准的判别结构。
在 VInterview-2025 数据集上,PhoenixNest-Video 达到 91.50% 的等级准确率,显著超越体积更大的商业闭源模型。紧凑的 Rubric‑grounded 智能体在与专家面板的一致性上优于直接提示更大模型的方式,并且能够为每个分数提供对应的证据,便于人工复核。
关键技术
- 语义视频图:将多模态输入映射为节点与边的结构化表示。
- Rubric‑conditioned 检索:依据评分细则检索相关证据。
- 跨模态验证:视觉‑音频‑文本三路一致性检查。
- Rubrics‑RL 双奖励 Scorer:同时优化 Rubric 对齐度和分数区分度。
实验结果
- VInterview-2025 等级准确率 91.50%
- 超越数十倍参数规模的专有模型
- 证据可视化支持人工审查
点评