我们提出了一个角色感知的决策‑监督(Decider‑Supervisor,DS)框架,并在区块链上实现审计功能,以探讨第二个 AI 组件何时能提升主模型的网络欺诈检测,而不是增加运营负担。框架包含四种方向配置:
- 中央化机器学习模型
- 使用 Federated Averaging(FedAvg)训练的联邦元模型
- 基础(Base)大语言模型(LLM)
- 量化低秩适配(QLoRA)LLM 变体
我们比较了仅使用主模型的决策与加入监督模型后的决策,评估指标包括非硬判欺诈性能、干预负担、条件校准、流量混合敏感性、审查容量敏感性、可靠性测试以及区块链生命周期控制。硬门限规则能够确定性拦截 89.994% 的欺诈请求,剩余的非硬判请求成为 AI 决策的主要场景。条件校准在部署回放中未表现出可迁移的监督优势。DS‑3(QLoRA)是干扰最小的监督配置,但在 F1 分数和总错误数上仍逊于其前置的 FedAvg 阶段。对 36 种重新加权的流量混合进行实验后发现,仅在两种极端高欺诈情形下,DS‑4(Base)能够降低总错误。
区块链测试验证了摘要校验、篡改检测、授权、单次审查决议以及最终化后的完整性,但也暴露出在最终化前只能写入一次的限制。整体结论是,AI 监督的价值取决于角色分配、校准方式、升级策略、流量组成以及生命周期控制,而非仅仅是否存在第二个模型。
点评