NeFut Logo NeFut
EN 管理员登录

[AI学术] LLM 交易代理在生产环境中的实际表现:两支舰队六个月的全体规模记录

发布于:2026-09-10 22:00 最后更新:2026-09-12 06:35
#algorithm #Machine Learning #LLM

我们提供了一个持续的、全体规模的测量记录,覆盖两套基于同一设计血统的自主语言模型交易代理在生产环境中的运行情况。第一套是 DX Terminal Pro,拥有 3,505 个用户资助的金库,在 Base memecoin 市场真实交易 ETH,时间为 2026 年 2‑3 月,共 21 天。第二套是 DXAP live alpha fleet,包含 500‑599 个用户创建的代理,历史全部记录,期间同时活跃 91‑117 个,交易 Hyperliquid 永续合约,时间为 2026 年 6‑8 月。记录跨约六个月,累计 750 万次单模型调用,约 30 万次链上行为,以及 231,638 次多工具回合,产生 14,596 笔成交。

四个主要发现如下。第一,运行层面的因素对行为的决定作用超过策略文本本身:风险滑块每升一级导致杠杆增加 $+0.425$,代理的固定效应解释约 60% 的方差,排行榜渲染边界产生因果选择效应(回归不连续性在前 3 名切点处提升 1.75 倍)。第二,仓位大小对波动率不敏感:在所有波动率六分位中位杠杆均为 $5.0\times$,且单一姿态滑块单元(占订单簿 11%)承担了 62% 的清算。第三,代理几乎未能捕获其潜在收益:43.2% 的仓位在 24 小时内出现至少 +300 基点的正向波动,但其中 49.3% 最终以负回报平仓;机械化的区间策略每仓位可回收 +39.0 基点。第四,两支舰队均未表现出方向性优势。DXAP 舰队不盈利,胜率 41% 落后于匹配的 Hyperliquid 零售基准 50%。对 416 组生产场景的前沿模型配对回放显示,在该时间范围内决策质量统计上不可区分,但不同模型族的选择稳定性差异显著。所有结论经日聚类推断、置换检验以及统一费用重新表述后仍然成立,论文以 17 条方法论规范收尾,并附上我们自己的撤回声明。

点评:本研究提供了罕见的大规模实证数据,揭示了 LLM 交易代理在真实市场中的行为特征和局限,为后续模型改进和风险管理提供了重要参考。

原文链接: https://arxiv.org/abs/2609.05663

[h] 返回首页