NeFut Logo NeFut
EN 管理员登录

[AI学术] 市场信号注入:对LLM定价代理的对抗性情境操控

发布于:2026-09-17 22:00 最后更新:2026-09-18 00:46
#AI #Machine Learning #LLM

大型语言模型(LLM)定价代理在面对相同数值的市场数据时,会受到信息呈现方式的影响。我们提出了市场信号注入(MSI)攻击,它通过改变数值格式、竞争者排序或加入定性市场评论来诱导模型,而不直接给出指令。

在模拟的伯特兰双寡头和三寡头市场中,我们测试了九种开源权重模型,并在双寡头环境下评估了三种专有模型。结果显示,基于情感的攻击导致的行为偏移最大,这种偏移会向其他企业传播,进而改变利润和消费者剩余。不同模型族的易感性差异显著,模型规模增大并不一定提升鲁棒性。

使用中性文本对照组和基于规则的代理可以支持一种框架效应解释:在固定需求参数下,信息的呈现方式会重新框定模型的决策空间。我们通过留出式探针对所有十一组模型‑条件组合进行重新评估,线性分类器的 AUC 达到 1.00,MLP 的 AUC 在 0.93‑0.99 之间。虽然这些分离度高,但并不能直接判定定价决策是否有害。

对输入进行规范化能够完全消除已测试的情感攻击,而结合提示约束与输出投影的决策边界锚定方法在面对自适应攻击时提供了部分缓解。

这些发现表明,数据呈现方式是 LLM 定价代理的潜在攻击面,亟需设计能够考虑代理间交互的防御机制。

点评:本文系统揭示了信息框架对 LLM 定价行为的深远影响,并提供了可操作的防御思路,为安全可信的 AI 经济系统奠定基础。

原文链接: https://arxiv.org/abs/2609.18357

[h] 返回首页