NeFut Logo NeFut
EN 管理员登录

[AI学术] 规则还是特征?人工智能安全设计的扩展定律

发布于:2026-08-15 22:00 最后更新:2026-08-16 07:03
#AI #Machine Learning #Artificial Intelligence

人工智能安全系统结合了特征塑造(例如,强化学习从人反馈中获取 [RLHF],宪法人工智能)和规则执行(例如,输出过滤器,安全分类器),然而,很少有正式的分析来研究它们的最佳平衡如何随着部署规模的增加而变化。我们引入了一个参数化安全设计的比较静态模型,该模型将资源分配为 α 在 [0,1] 之间的两个方法,包括规模依赖的过滤器退化,公共模式故障和特征脆弱性 -- 形成行为在新条件下恶化或崩溃的风险。在乘法帕累托损害模型下,我们推导出封闭形式的预期损害,并通过蒙特卡罗模拟补充尾部风险(CVaR)分析。在三个场景(乐观、中等、悲观)中,最佳 α 是内部或仅规则边界,并且随着部署规模 T 的增长而向特征塑造方向转变,从微不足道(Δ α = +0.01)到明显(Δ α = +0.21),这取决于场景。主导参数是基线特征脆弱性率 p^(0)_frag,它在其范围内将 α 转变为 0.50 -- 远远超过尾部严重性、过滤器质量或公共模式故障概率的影响。CVaR 和预期损害的最优值在大 T 时收敛。这些结果表明,安全架构决策取决于特征塑造在分布转移下的可靠性,而不是部署规模本身。 博主点评: 本文研究了人工智能安全设计中规则和特征塑造的平衡,结果表明特征塑造在大规模部署中的可靠性至关重要。

原文链接: https://arxiv.org/abs/2608.13345

[h] 返回首页