📑 本文目录
LLM交易Agent别再比收益了:CLQT五轴能力诊断框架深度解读(国内首发)
开篇:一句危险的话
“我给GPT-4接了个交易Agent,回测年化40%,Sharpe 2.1,吊打所有主动基金经理。”
2026年,这样的标题和帖文已经泛滥到令人麻木的程度。GitHub上TradingAgents、AlphaCrafter等框架疯狂刷星,知乎”AI交易Agent”话题阅读量破千万。每一个开源项目都附带一张令人血脉偾张的资金曲线——平滑上升、回撤极小、年化动辄30%-80%。
但2026年6月29日发布的一篇arxiv论文,给这股狂热泼了一盆刺骨的冷水。论文编号2606.29771,代号CLQT(Closed-Loop, Cost-aware, Liquidity-aware, Quant Trading agent benchmark)。它的核心论点用一句话就能概括:
当你用”固定窗口的总收益”来排名LLM交易Agent时,你排的根本不是Agent的能力,而是市场路径的运气。
这不是危言耸听。CLQT的作者团队系统性地拆解了现有LLM交易Agent评测的致命缺陷,并提出了一个从工程到方法论全面重构的评测框架。更关键的是——这篇论文让一个行业里人人知道却人人回避的潜规则,变成了一个无法再忽视的工程命题:look-ahead泄漏(未来函数)会让你的alpha在控制变量后瞬间蒸发。
我们在《AI选股Agent全军覆没?LLM交易数据泄露检验》一文中已经详细剖析过:7个SOTA大模型在防泄露基准下只有2个正收益。CLQT则从另一个角度——评测框架本身——给出了工程级的解法。这是2026年AI量化领域最值得关注的一篇方法论论文,而国内尚无任何深度解读。本文争取做第一篇。
一、收益排名为什么会”害死”你的Agent
1.1 一个被刻意回避的事实
先来看一组在任何LLM交易Agent论文里都常见的实验设置:
- 给Agent喂入某段时间窗口的历史数据(比如2018-2023年CSI300成分股的OHLCV)
- 让Agent每天做出交易决策(买入/卖出/持有)
- 用Agent的期末累计收益与基准(如买入持有CSI300)做对比
- 收益越高,Agent排名越靠前
这套流程看起来天经地义,但它隐藏了一个致命的假设:Agent产生的收益,等于Agent的能力。
CLQT论文的第一个贡献,就是用严密的逻辑论证为什么这个假设是错的。
1.2 收益的三层来源拆解
论文指出,一个LLM交易Agent在回测中产生的收益,实际上可以拆解为三个层次:
| 层次 | 来源 | 与Agent能力的关系 |
|---|---|---|
| 第一层:市场路径 | Beta收益,即整个市场涨跌带来的β | 几乎无关。2018-2023年CSI300本身涨了30%,Agent哪怕只做买入持有也能拿30% |
| 第二层:泄漏收益 | Agent在决策时”看到了不该看的数据”(未来函数、标签泄漏、语境污染) | 负相关。泄漏越多,回测越好看,实盘越亏钱 |
| 第三层:真实Alpha | Agent基于当期可见信息做出超越随机的决策 | 这才是我们要衡量的东西 |
问题在于,现有评测方法把这三层收益搅成一锅,只看最后一行数字。CLQT的作者做了一个漂亮的实验验证:当他们对数据做严格的TimeGate处理(杜绝一切未来函数)、对市场路径做去Beta化处理后,多个号称”年化40%+“的Agent,alpha直接归零甚至为负。
这个结论我们在《KTD-Fin基准:数据脱敏戳穿LLM交易Agent的记忆幻觉》中见过类似一幕——把股票名称匿名化后,Step-3.5-Flash的选股alpha几乎清零。CLQT从评测工程层面给出了同样的诊断:你看到的alpha,可能根本不是推理产生的。
1.3 “排名”这个动作本身就有毒
CLQT最尖锐的一个观点是:排名(ranking)这个行为本身,就会制造虚假的优胜者。
原理很简单——如果你同时评测20个Agent,每个Agent的真实能力都是”随机水平”(即没有真正的alpha),但由于噪声和运气,总会有1-2个排在前面。如果你只报道第一名”我们的Agent年化35%!“,这就是赤裸裸的p-hacking和选择性报道。
论文引用的统计理论指出:在样本量有限(交易天数少)的情况下,排名越靠前的Agent,其真实能力被高估的程度越大。这在金融统计里叫”winner’s curse”(赢家诅咒)——你选出的赢家,恰恰是被运气高估最多的那个。
所以CLQT得出的方法论结论是:LLM交易Agent的评测,应该从”排名”转向”诊断”(diagnosis)。 不是问”谁第一”,而是问”这个Agent在哪些能力维度上有真实水平,在哪些维度上是噪声”。
这是一个范式的转换。要实现这个转换,需要一整套全新的工程基础设施。
二、CLQT框架:五阶段闭环 + 哈希链封装
CLQT的名字拆解了它的核心设计理念:
- Closed-Loop(闭环):Agent不是一次性给出交易决策,而是在一个持续的闭环中运转——每轮收集信息、综合判断、配置仓位、执行交易、反思复盘,然后进入下一轮
- Cost-aware(成本感知):交易成本、融资成本、冲击成本必须真实建模,不能像很多论文那样设为零
- Liquidity-aware(流动性感知):成交量约束必须遵守,不能假设你可以以收盘价无限量买入
2.1 五阶段闭环
CLQT定义了一个标准化的Agent决策闭环,每一轮(DecisionRound)包含五个阶段:
| 阶段 | 名称 | Agent做什么 | 关键约束 |
|---|---|---|---|
| 1 | Gather(采集) | 获取当期可见的所有信息:价格、成交量、新闻、财报、宏观指标 | TimeGate严格限定:只能看到T日及之前的数据 |
| 2 | Synthesize(综合) | 对采集到的信息进行推理、提取信号、形成判断 | 必须输出可追溯的推理链(reasoning trace) |
| 3 | Allocate(配置) | 根据综合判断,决定各资产的仓位权重 | 必须满足流动性约束和风险预算 |
| 4 | Execute(执行) | 模拟下单,产生成交记录 | 必须扣除交易成本、滑点、冲击成本 |
| 5 | Reflect(反思) | 回顾本轮决策的得失,更新记忆 | 记忆必须分层管理,不能无限制累积 |
这五个阶段的闭环设计,本质上是在模拟一个真实投资团队的日常工作流。它强迫评测者不能用”一锤子买卖”(给一坨数据,出一个决策)来敷衍,而必须考察Agent在持续多轮、信息不断更新、约束真实存在的条件下的完整能力。
2.2 哈希链:每一轮决策的不可篡改性
CLQT最精巧的工程设计,是引入了**哈希链(hash chain)**来封装每一轮DecisionRound。
原理借鉴了区块链:每一轮决策的完整上下文(输入数据、推理过程、输出决策、执行结果)被打包成一个数据块,计算哈希值;下一轮的哈希计算会包含上一轮的哈希值,形成一条不可篡改的链。
这样做有三个关键目的:
- 可重算性(Reproducibility):任何人拿到这条哈希链,可以独立验证某一轮Agent到底看到了什么数据、做了什么决策。如果回测结果不可复现,哈希就对不上
- 防泄漏审计:审计者可以检查每一轮Gather阶段实际输入的数据时间戳,确认没有未来数据混入
- 防止事后修改:一旦DecisionRound被哈希封存,论文作者无法在知道最终结果后回头”优化”某些中间决策
这第三点尤其重要。在传统的回测报告里,你看到的只是最终的资金曲线——中间Agent在每一轮到底想了什么、做了什么,是一个黑箱。作者完全可以在知道结局后,把”表现好的那几轮”的决策过程润色得更漂亮。哈希链从工程层面堵死了这条后路。
一句话总结:CLQT用哈希链把”回测可复现”从一个口号变成了一个可验证的工程事实。这是对”只给最终曲线不给过程”式论文的降维打击。
三、核心创新①:硬TimeGate——未来函数的工程级终结
TimeGate是CLQT防止look-ahead泄漏的核心机制。在《LLM交易Agent数据泄露检验》一文中,我们曾列出四种常见的泄漏类型:
| 泄漏类型 | 典型表现 | CLQT的应对 |
|---|---|---|
| 标签泄漏 | 用T+1日的涨跌幅作为T日的输入特征 | TimeGate强制:所有输入特征的时间戳 ≤ T |
| 语境污染 | Agent的prompt里混入了”未来已知的事实” | 所有喂给Agent的文本(新闻、财报)时间戳 ≤ T |
| 滚动窗口泄漏 | 用全样本计算归一化参数,再用于历史回测 | 归一化只能用T日及之前的数据滚动计算 |
| 记忆幻觉 | LLM在预训练时”记住”了这段历史行情 | 这是预训练阶段的问题,CLQT通过能力诊断间接暴露 |
CLQT的TimeGate不是在代码里加几行 if date > T 的软约束,而是一个硬约束(hard constraint)——在数据管道层面,为每一轮Gather阶段构建一个严格的时间切片(time slice),任何时间戳晚于T的数据根本不会进入Agent的输入。
这个设计的严苛之处在于它覆盖了所有数据通道:
- 结构化数据(价格、成交量、财务指标):逐字段检查时间戳
- 非结构化数据(新闻文本、研报):文档的发布时间必须 ≤ T,且文档内容不能包含对T之后事件的”预知性描述”
- Agent自身的记忆:Agent在Reflect阶段写入记忆的内容,不能包含”事后才知道的信息”(这需要额外的信息时间戳校验)
最狠的是第三点。很多看似严密的防泄漏设计,都倒在了Agent的记忆环节——Agent在第10轮决策时”回忆起”了第3轮的情况,但它的”回忆”里混入了第3轮到第10轮之间才发生的事。CLQT对记忆也做了时间戳追踪,确保Agent的记忆内容与其所属的时间点严格一致。
四、核心创新②:五轴能力评分卡(APM-CS)
这是CLQT最重磅、也最实用的贡献。论文提出:评价一个LLM交易Agent,不应该只看收益,而应该从五个正交的能力轴(axes)来诊断。
这套评分体系代号APM-CS,取自五个轴的首字母:
4.1 五轴定义
| 轴 | 名称 | 衡量什么 | 典型表现 |
|---|---|---|---|
| C | Coherence(一致性) | Agent的推理过程是否逻辑自洽?同一类信息在不同轮次是否产生逻辑一致的判断? | 高分:面对相似技术形态给出相似判断;低分:同一天对同一股票先看多再看空且无理由 |
| A | Acuity(敏锐度) | Agent对信号的捕捉是否及时、精准?是否能在信息刚出现时就做出反应,而不是滞后? | 高分:财报发布当日即调整仓位;低分:价格已涨20%才”发现”动量 |
| C | Composure(定力) | 面对回撤和波动,Agent是否保持既定策略?还是一遇亏损就恐慌性止损或加码? | 高分:按纪律执行预设的止损/止盈;低分:回撤时随机改变仓位规模 |
| D | Discipline(纪律性) | Agent是否严格遵守自己声明的策略约束?比如声明”单笔不超过组合的10%“,实际是否执行? | 高分:言行一致;低分:声明的风险预算与实际持仓严重不符 |
| R | Reliability(可复现性) | 给定相同的输入,Agent是否产生相同的输出?还是充满随机性? | 高分:温度=0时完全确定;低分:同一输入多次运行结果天差地别 |
4.2 为什么五轴比收益更有信息量
这五个轴的设计,本质上回答了一个更深的问题:收益是Agent能力的”结果”,而五轴是Agent能力的”过程指标”。
举一个CLQT论文里的典型诊断案例:
Agent A:年化收益35%,Sharpe 2.0,但Discipline极低(声明的仓位约束几乎从未执行),Reliability极低(同样输入结果波动巨大)。
Agent B:年化收益18%,Sharpe 1.2,五轴全部高分,且Reliability接近完美(完全可复现)。
传统排名法会把Agent A捧上神坛。但任何有实盘经验的人都知道,Agent A的35%几乎一定是过拟合或泄漏的产物——一个连自己声明的约束都不遵守、同一输入结果都飘忽不定的系统,不可能在未见过的市场环境中维持表现。
Agent B虽然回测收益”只有”18%,但它是可信的。它的五轴高分意味着:它的决策逻辑可解释、可追踪、可复现,你大概率能把它部署到实盘而不会出现灾难性的意外。
这就是CLQT”诊断而非排名”的精髓:五轴告诉你这个Agent的可信边界在哪里,而收益数字不能。
4.3 自评工具:给你的Agent打分
CLQT的五轴评分并非只能用于学术论文。我们完全可以把它简化成一个自查清单,用来审视自己搭建的LLM交易Agent。以下是一个可以直接使用的评分模板(1-5分制):
Coherence(一致性)自查:
- 抽取Agent在不同日期对同一板块(如半导体)的判断,逻辑是否一致?
- Agent是否会在同一天对同一标的给出矛盾的信号?
- 推理链中是否存在前后矛盾的因果论断?
Acuity(敏锐度)自查:
- 重大事件(财报、政策)发生后,Agent在第几个交易日做出反应?
- Agent的信号是否总是滞后于价格已经走出的行情?
Composure(定力)自查:
- 在回撤期,Agent是否出现了非纪律性的仓位骤变?
- 面对连续亏损,Agent是否会”翻倍下注”或”清仓逃跑”?
Discipline(纪律性)自查:
- Agent声明的最大回撤约束、单笔仓位上限,在回测中是否被严格遵守?
- 计算实际持仓与声明的风险预算的偏差率
Reliability(可复现性)自查:
- 在temperature=0的条件下,同一输入运行3次,决策是否完全一致?
- 换一台机器、换一个随机种子,结果是否稳定?
如果你的Agent在这五个轴上有任何一项低于3分,那么无论回测收益多么漂亮,都不要急着上实盘。先去修那个维度的问题。
五、实证:五模型对比,GPT-4 Turbo为何”Sharpe最高却震荡市失效”
CLQT是一套评测框架,而另一篇同期的论文则用它(及类似方法)做了实际的模型对比。
arxiv 2607.15414(2026年7月16日)系统评测了五个主流大模型在交易任务上的表现:GPT-4 Turbo、Claude 3 Opus、Gemini 1.5 Pro、Llama 3 70B、FinGPT。评测涵盖四项核心任务:K线形态识别、方向信号生成、回测、财报理解。
5.1 排行榜:GPT-4 Turbo综合最强
| 模型 | 年化收益 | Sharpe | 相对标普500 | 突出优势 | 致命短板 |
|---|---|---|---|---|---|
| GPT-4 Turbo | 最高 | 最高 | 跑赢 | 综合能力最强、推理链最清晰 | 震荡市表现剧烈下滑 |
| FinGPT | 中等 | 较高 | 跑赢 | 领域微调红利、风险调整后性价比高 | 通用推理能力弱 |
| Claude 3 Opus | 中等 | 中等 | 持平 | 财报理解深度好 | K线形态识别误判多 |
| Gemini 1.5 Pro | 偏低 | 中等 | 略输 | 长上下文处理强 | 数值幻觉严重 |
| Llama 3 70B | 偏低 | 偏低 | 略输 | 开源、可本地部署 | 综合能力最弱 |
两个关键发现:
第一,GPT-4 Turbo和FinGPT都跑赢了标普500被动基准。 这说明LLM在AI交易中确实有超越随机的真实潜力——并非全是泄漏和幻觉。
第二,所有模型都有共同的致命缺陷,CLQT五轴能精准地诊断出这些缺陷:
- 数值幻觉:Gemini 1.5 Pro最严重,经常把”涨幅12.3%“读成”涨幅1.23%“或”涨幅123%“。这直接破坏了Acuity(敏锐度)——连数字都读不对,谈不上信号敏锐
- 上下文窗口限制:当需要处理超过128K token的历史数据时,所有模型都出现了”遗忘早期信息”的现象,导致**Coherence(一致性)**下降——同一标的在不同轮次的判断出现矛盾
- 震荡市表现不稳定:GPT-4 Turbo在趋势市Sharpe可达2.0+,但进入震荡市后骤降至0.5以下。这说明它的alpha高度依赖市场状态(market regime),而非普适能力。这正是**Composure(定力)**轴要诊断的——一个真正有定力的Agent,不应该在市场风格切换时表现断崖式下滑
5.2 一个反直觉的结论:FinGPT的”性价比陷阱”
这篇论文最反直觉的发现是关于FinGPT的。
FinGPT(基于Llama微调的金融领域模型)在原始收益上不如GPT-4 Turbo,但在风险调整后(risk-adjusted)的表现上非常接近。更关键的是,在CLQT五轴评估中,FinGPT的Discipline(纪律性)得分反而高于GPT-4 Turbo——因为它经过金融语料微调,更”听话”地执行了声明中的仓位约束。
这个发现对实操意义重大:如果你的目标是”稳定地跑赢基准”而非”博取最高收益”,一个经过领域微调的中小模型,可能在性价比和可控性上优于通用大模型。 这与我们在《77篇LLM Agentic Trading论文审计》中看到的趋势一致——领域微调是LLM量化落地最务实的路径。
论文的最终建议是:LLM在AI交易中有真实潜力,但稳健部署需要三件事——任务分解(把选股、择时、风控拆开)、严格回测(用CLQT式TimeGate)、领域微调(而非直接用通用大模型)。
六、CLQT vs StockBench:两个评测框架如何互补
读完CLQT,一个自然的问题是:它和我们之前深度解读的StockBench评测方法论是什么关系?
两者解决的是LLM交易Agent评测的同一个核心痛点——“回测好看不等于能力强”——但切入点不同,且高度互补。
6.1 两个框架的定位差异
| 维度 | StockBench | CLQT |
|---|---|---|
| 评测对象 | LLM的金融知识问答能力(静态) | LLM的交易决策能力(动态闭环) |
| 核心问题 | ”这个模型懂不懂金融?" | "这个Agent会不会交易?“ |
| 时间结构 | 单轮问答,无时间演化 | 多轮闭环,有时间序列和路径依赖 |
| 防泄漏机制 | contamination-free数据集(确保测试题未被预训练见过) | 硬TimeGate + 哈希链(防止未来函数和事后篡改) |
| 评分维度 | 问答准确率、推理质量 | 五轴APM-CS(一致性/敏锐度/定力/纪律/可复现) |
| 成本建模 | 无(不涉及交易) | 完整(交易成本、融资成本、冲击成本) |
| 适用阶段 | 模型选型阶段(选哪个基座模型) | Agent上线前的能力审计(这个Agent能部署吗) |
6.2 互补的使用方式
一个成熟的LLM量化团队,应该把两个框架串联使用:
第一步(模型选型):用StockBench回答”哪个基座模型的金融理解力最强”。 这决定了你的Agent用什么大脑。比如 StockBench 可能告诉你 Claude 3 Opus 在财报推理上强于 GPT-4,但 GPT-4 在 K 线形态识别上更强——你据此选择基座。
第二步(Agent审计):用CLQT回答”用这个模型搭建的Agent,在闭环交易中能力如何”。 这决定了你的Agent能不能上线。CLQT的五轴评分会告诉你,这个Agent虽然回测收益不错,但Discipline只有2分(不遵守风控)——那么你必须先修复风控逻辑,而不是带着缺陷上实盘。
打个比方:StockBench是笔试(考金融知识),CLQT是实操考核(考驾驶技术)。一个候选者笔试满分,不代表他能上路——因为开车需要的不仅仅是交规知识,还有临场判断、心理素质、规则执行。
这就是为什么”问答强 ≠ 交易强”。 我们在StockBench解读中就指出过这个陷阱,CLQT则从框架层面给出了完整的工程化解法。
七、对AgentQuant读者的实操启示
7.1 三个立刻可用的行动项
无论你是AI量化的研究者还是实盘交易者,CLQT框架都指向三个可以立刻执行的行动:
行动一:把你的Agent回测改成”诊断报告”而非”收益报告”。 下次做回测时,除了输出资金曲线,再输出五轴评分。哪怕只是粗略的自查清单(如第四节所示),也能帮你发现回测收益背后的能力黑洞。一个Discipline低分、Reliability低分的Agent,收益再高也不能用。
行动二:给你的回测系统加一个”硬TimeGate”。 在数据管道的最底层,为每一个输入特征、每一条新闻文本、每一个财务指标打上严格的时间戳,并在喂给Agent前做一次时间闸门校验。这不是可选项——在《数据泄露检验》中我们看到,不做这一步的Agent有极大概率在泄漏未来信息。
行动三:领域微调优于通用大模型。 如果你打算让LLM Agent真正参与交易决策(而非仅做研究辅助),基于金融语料微调的中小模型(如FinGPT路线)在纪律性和可控性上优于直接用GPT-4级通用模型。通用大模型适合做”分析师”(出主意),微调模型适合做”交易员”(执行)。
7.2 一个值得警惕的反面信号
CLQT论文还隐含了一个对所有AI量化从业者都有警示意义的数据点:在他们测试的多个公开宣称”年化40%+“的Agent中,经过TimeGate+去Beta+五轴审计后,没有一个是真正经得起复现的。
这和我们在《LLM Agent量化交易2026论文解读》以及《ICLR 2026论文:LLM Agent量化实践》中的观察一脉相承——2026年的LLM交易Agent,绝大多数的”超额收益”经不起严格检验。这不是说LLM在量化中没有价值,而是说价值的方向需要重新校准:从”追求回测收益最大化”转向”追求决策过程可解释、可复现、可审计”。
CLQT给这个方向提供了第一套完整的工程方法论。这也是为什么我们认为这篇论文值得每个AI量化人认真读一遍。
结语:从”炫技”到”诊断”的范式转折
2026年,AI量化正在经历一个微妙的转折。
一方面,工具在爆炸——Qlib、TradingAgents、FinGPT、各类Agent框架层出不穷,让”搭一个AI交易Agent”的门槛降到了一个周末项目就能跑通的程度。另一方面,方法论在收敛——当所有人都能轻松跑出一条漂亮的回测曲线时,“漂亮”本身就贬值了。真正稀缺的,是区分真实能力与虚假繁荣的评测标尺。
CLQT的五轴评分卡,就是这把标尺。它不告诉你”谁第一”,但它告诉你”谁可信”——而在交易这个领域,可信永远比第一重要。
记住那句话:收益是结果,过程是能力。只看结果的排名,是在给运气发奖牌。
作者:梁延超 | AgentQuant 数据来源:arxiv 2606.29771(CLQT)、arxiv 2607.15414(AI Trading评测)、AgentQuant自有信号系统 本文为draft待审阅版本,数据与结论以正式发布版为准。
免责声明:本文为技术研究与方法论探讨,不构成任何投资建议。AI交易Agent的实盘部署涉及重大风险,请充分回测、严格风控后再做决策。