SIRF 旨在解决工业内容风险控制的核心部署需求:在保持极高精度的同时,实现秒级甚至亚秒级的判决延迟。传统指标侧重平均准确率,而实际场景更关注在高精度阈值下能够自动处理的风险比例。
模型通过 EntiGraph、MAGA 重写 与 账号级链式思考(CoT) 将平台复杂策略转化为训练信号,随后在原有模型上进行 持续预训练(CPT),使策略直接内化到权重中。部署时仅输出判决结果,省去额外的策略推理步骤,从而实现超低延迟。
在同源对照实验中,Qwen3‑8B‑SFT 与 SIRF‑8B‑SFT 采用相同的策略注入方式和仅判决输出形式,唯一差别在于是否经过政策驱动的 CPT。实验表明,SIRF‑8B‑SFT 在 Black Recall@P95 达到 71.3%,比基线提升 15.1 个百分点,仅使用约 70M CPT 令牌且未削弱通用能力,在可获取对数概率的模型中甚至匹配或超越更大规模的系统。
实际部署时,SIRF 作为树形模型裁决层使用,能够恢复约 20% 的误罚样本。进一步在冻结场景下迁移,仅以低成本实现约 70% 的相对误罚率下降。
点评:SIRF 通过将策略嵌入模型权重,实现了高精度、低时延的风险自动化处理,为工业级内容安全提供了可扩展且成本友好的方案。