人工智能系统正快速渗透到医疗、金融、公共服务等安全关键领域。然而,当前的工程实践仍以模型为中心,主要评估准确性、鲁棒性、公平性和可解释性等属性。
这些属性在模型部署后并不足以保证系统安全,因为 AI 系统运行在不断变化的社会技术环境中,面临分布漂移、制度约束、人类反馈回路、隐私需求以及多个 AI 代理之间的交互等挑战。
为此提出 AI 部署问责工程(ADAE),将问责视为部署层面的属性而非单一模型属性。ADAE 旨在持续、可测量、可操作地监控已部署系统是否仍在可接受的风险范围内,识别失效出现的情境,追溯技术与人为组件的责任,将技术失效映射到下游后果,并支持及时干预。
ADAE 的研究议程围绕四个相互关联的支柱展开:
- 结构化发现上下文相关的失效模式;
- 隐私保护的问责度量方法;
- 面向代理 AI 的系统级风险分析;
- 将技术失效转化为运营和制度风险。
长期目标是建立基础原则、数学工具和系统架构,使安全关键应用中的 AI 部署能够实现可问责的运行。
点评:ADAE 将焦点从单模型转向整个系统运行环境,为实现持续安全提供了系统化路径,但实现这些目标需要跨学科合作和可扩展的监控技术。