📑 本文目录
CLQTLLM交易AgentAI选股评测Coherence评分量化Agent基准look-ahead泄漏能力诊断

LLM交易Agent别再比收益了:CLQT五轴能力诊断框架深度解读(国内首发)


开篇:一句危险的话

“我给GPT-4接了个交易Agent,回测年化40%,Sharpe 2.1,吊打所有主动基金经理。”

2026年,这样的标题和帖文已经泛滥到令人麻木的程度。GitHub上TradingAgents、AlphaCrafter等框架疯狂刷星,知乎”AI交易Agent”话题阅读量破千万。每一个开源项目都附带一张令人血脉偾张的资金曲线——平滑上升、回撤极小、年化动辄30%-80%。

但2026年6月29日发布的一篇arxiv论文,给这股狂热泼了一盆刺骨的冷水。论文编号2606.29771,代号CLQT(Closed-Loop, Cost-aware, Liquidity-aware, Quant Trading agent benchmark)。它的核心论点用一句话就能概括:

当你用”固定窗口的总收益”来排名LLM交易Agent时,你排的根本不是Agent的能力,而是市场路径的运气。

这不是危言耸听。CLQT的作者团队系统性地拆解了现有LLM交易Agent评测的致命缺陷,并提出了一个从工程到方法论全面重构的评测框架。更关键的是——这篇论文让一个行业里人人知道却人人回避的潜规则,变成了一个无法再忽视的工程命题:look-ahead泄漏(未来函数)会让你的alpha在控制变量后瞬间蒸发。

我们在《AI选股Agent全军覆没?LLM交易数据泄露检验》一文中已经详细剖析过:7个SOTA大模型在防泄露基准下只有2个正收益。CLQT则从另一个角度——评测框架本身——给出了工程级的解法。这是2026年AI量化领域最值得关注的一篇方法论论文,而国内尚无任何深度解读。本文争取做第一篇。


一、收益排名为什么会”害死”你的Agent

1.1 一个被刻意回避的事实

先来看一组在任何LLM交易Agent论文里都常见的实验设置:

  • 给Agent喂入某段时间窗口的历史数据(比如2018-2023年CSI300成分股的OHLCV)
  • 让Agent每天做出交易决策(买入/卖出/持有)
  • 用Agent的期末累计收益与基准(如买入持有CSI300)做对比
  • 收益越高,Agent排名越靠前

这套流程看起来天经地义,但它隐藏了一个致命的假设:Agent产生的收益,等于Agent的能力。

CLQT论文的第一个贡献,就是用严密的逻辑论证为什么这个假设是错的。

1.2 收益的三层来源拆解

论文指出,一个LLM交易Agent在回测中产生的收益,实际上可以拆解为三个层次:

层次来源与Agent能力的关系
第一层:市场路径Beta收益,即整个市场涨跌带来的β几乎无关。2018-2023年CSI300本身涨了30%,Agent哪怕只做买入持有也能拿30%
第二层:泄漏收益Agent在决策时”看到了不该看的数据”(未来函数、标签泄漏、语境污染)负相关。泄漏越多,回测越好看,实盘越亏钱
第三层:真实AlphaAgent基于当期可见信息做出超越随机的决策这才是我们要衡量的东西

问题在于,现有评测方法把这三层收益搅成一锅,只看最后一行数字。CLQT的作者做了一个漂亮的实验验证:当他们对数据做严格的TimeGate处理(杜绝一切未来函数)、对市场路径做去Beta化处理后,多个号称”年化40%+“的Agent,alpha直接归零甚至为负。

这个结论我们在《KTD-Fin基准:数据脱敏戳穿LLM交易Agent的记忆幻觉》中见过类似一幕——把股票名称匿名化后,Step-3.5-Flash的选股alpha几乎清零。CLQT从评测工程层面给出了同样的诊断:你看到的alpha,可能根本不是推理产生的。

1.3 “排名”这个动作本身就有毒

CLQT最尖锐的一个观点是:排名(ranking)这个行为本身,就会制造虚假的优胜者。

原理很简单——如果你同时评测20个Agent,每个Agent的真实能力都是”随机水平”(即没有真正的alpha),但由于噪声和运气,总会有1-2个排在前面。如果你只报道第一名”我们的Agent年化35%!“,这就是赤裸裸的p-hacking和选择性报道

论文引用的统计理论指出:在样本量有限(交易天数少)的情况下,排名越靠前的Agent,其真实能力被高估的程度越大。这在金融统计里叫”winner’s curse”(赢家诅咒)——你选出的赢家,恰恰是被运气高估最多的那个。

所以CLQT得出的方法论结论是:LLM交易Agent的评测,应该从”排名”转向”诊断”(diagnosis)。 不是问”谁第一”,而是问”这个Agent在哪些能力维度上有真实水平,在哪些维度上是噪声”。

这是一个范式的转换。要实现这个转换,需要一整套全新的工程基础设施。


二、CLQT框架:五阶段闭环 + 哈希链封装

CLQT的名字拆解了它的核心设计理念:

  • Closed-Loop(闭环):Agent不是一次性给出交易决策,而是在一个持续的闭环中运转——每轮收集信息、综合判断、配置仓位、执行交易、反思复盘,然后进入下一轮
  • Cost-aware(成本感知):交易成本、融资成本、冲击成本必须真实建模,不能像很多论文那样设为零
  • Liquidity-aware(流动性感知):成交量约束必须遵守,不能假设你可以以收盘价无限量买入

2.1 五阶段闭环

CLQT定义了一个标准化的Agent决策闭环,每一轮(DecisionRound)包含五个阶段:

阶段名称Agent做什么关键约束
1Gather(采集)获取当期可见的所有信息:价格、成交量、新闻、财报、宏观指标TimeGate严格限定:只能看到T日及之前的数据
2Synthesize(综合)对采集到的信息进行推理、提取信号、形成判断必须输出可追溯的推理链(reasoning trace)
3Allocate(配置)根据综合判断,决定各资产的仓位权重必须满足流动性约束和风险预算
4Execute(执行)模拟下单,产生成交记录必须扣除交易成本、滑点、冲击成本
5Reflect(反思)回顾本轮决策的得失,更新记忆记忆必须分层管理,不能无限制累积

这五个阶段的闭环设计,本质上是在模拟一个真实投资团队的日常工作流。它强迫评测者不能用”一锤子买卖”(给一坨数据,出一个决策)来敷衍,而必须考察Agent在持续多轮、信息不断更新、约束真实存在的条件下的完整能力。

2.2 哈希链:每一轮决策的不可篡改性

CLQT最精巧的工程设计,是引入了**哈希链(hash chain)**来封装每一轮DecisionRound。

原理借鉴了区块链:每一轮决策的完整上下文(输入数据、推理过程、输出决策、执行结果)被打包成一个数据块,计算哈希值;下一轮的哈希计算会包含上一轮的哈希值,形成一条不可篡改的链。

这样做有三个关键目的:

  1. 可重算性(Reproducibility):任何人拿到这条哈希链,可以独立验证某一轮Agent到底看到了什么数据、做了什么决策。如果回测结果不可复现,哈希就对不上
  2. 防泄漏审计:审计者可以检查每一轮Gather阶段实际输入的数据时间戳,确认没有未来数据混入
  3. 防止事后修改:一旦DecisionRound被哈希封存,论文作者无法在知道最终结果后回头”优化”某些中间决策

这第三点尤其重要。在传统的回测报告里,你看到的只是最终的资金曲线——中间Agent在每一轮到底想了什么、做了什么,是一个黑箱。作者完全可以在知道结局后,把”表现好的那几轮”的决策过程润色得更漂亮。哈希链从工程层面堵死了这条后路。

一句话总结:CLQT用哈希链把”回测可复现”从一个口号变成了一个可验证的工程事实。这是对”只给最终曲线不给过程”式论文的降维打击。


三、核心创新①:硬TimeGate——未来函数的工程级终结

TimeGate是CLQT防止look-ahead泄漏的核心机制。在《LLM交易Agent数据泄露检验》一文中,我们曾列出四种常见的泄漏类型:

泄漏类型典型表现CLQT的应对
标签泄漏用T+1日的涨跌幅作为T日的输入特征TimeGate强制:所有输入特征的时间戳 ≤ T
语境污染Agent的prompt里混入了”未来已知的事实”所有喂给Agent的文本(新闻、财报)时间戳 ≤ T
滚动窗口泄漏用全样本计算归一化参数,再用于历史回测归一化只能用T日及之前的数据滚动计算
记忆幻觉LLM在预训练时”记住”了这段历史行情这是预训练阶段的问题,CLQT通过能力诊断间接暴露

CLQT的TimeGate不是在代码里加几行 if date > T 的软约束,而是一个硬约束(hard constraint)——在数据管道层面,为每一轮Gather阶段构建一个严格的时间切片(time slice),任何时间戳晚于T的数据根本不会进入Agent的输入。

这个设计的严苛之处在于它覆盖了所有数据通道:

  • 结构化数据(价格、成交量、财务指标):逐字段检查时间戳
  • 非结构化数据(新闻文本、研报):文档的发布时间必须 ≤ T,且文档内容不能包含对T之后事件的”预知性描述”
  • Agent自身的记忆:Agent在Reflect阶段写入记忆的内容,不能包含”事后才知道的信息”(这需要额外的信息时间戳校验)

最狠的是第三点。很多看似严密的防泄漏设计,都倒在了Agent的记忆环节——Agent在第10轮决策时”回忆起”了第3轮的情况,但它的”回忆”里混入了第3轮到第10轮之间才发生的事。CLQT对记忆也做了时间戳追踪,确保Agent的记忆内容与其所属的时间点严格一致。


四、核心创新②:五轴能力评分卡(APM-CS)

这是CLQT最重磅、也最实用的贡献。论文提出:评价一个LLM交易Agent,不应该只看收益,而应该从五个正交的能力轴(axes)来诊断。

这套评分体系代号APM-CS,取自五个轴的首字母:

4.1 五轴定义

名称衡量什么典型表现
CCoherence(一致性)Agent的推理过程是否逻辑自洽?同一类信息在不同轮次是否产生逻辑一致的判断?高分:面对相似技术形态给出相似判断;低分:同一天对同一股票先看多再看空且无理由
AAcuity(敏锐度)Agent对信号的捕捉是否及时、精准?是否能在信息刚出现时就做出反应,而不是滞后?高分:财报发布当日即调整仓位;低分:价格已涨20%才”发现”动量
CComposure(定力)面对回撤和波动,Agent是否保持既定策略?还是一遇亏损就恐慌性止损或加码?高分:按纪律执行预设的止损/止盈;低分:回撤时随机改变仓位规模
DDiscipline(纪律性)Agent是否严格遵守自己声明的策略约束?比如声明”单笔不超过组合的10%“,实际是否执行?高分:言行一致;低分:声明的风险预算与实际持仓严重不符
RReliability(可复现性)给定相同的输入,Agent是否产生相同的输出?还是充满随机性?高分:温度=0时完全确定;低分:同一输入多次运行结果天差地别

4.2 为什么五轴比收益更有信息量

这五个轴的设计,本质上回答了一个更深的问题:收益是Agent能力的”结果”,而五轴是Agent能力的”过程指标”。

举一个CLQT论文里的典型诊断案例:

Agent A:年化收益35%,Sharpe 2.0,但Discipline极低(声明的仓位约束几乎从未执行),Reliability极低(同样输入结果波动巨大)。

Agent B:年化收益18%,Sharpe 1.2,五轴全部高分,且Reliability接近完美(完全可复现)。

传统排名法会把Agent A捧上神坛。但任何有实盘经验的人都知道,Agent A的35%几乎一定是过拟合或泄漏的产物——一个连自己声明的约束都不遵守、同一输入结果都飘忽不定的系统,不可能在未见过的市场环境中维持表现。

Agent B虽然回测收益”只有”18%,但它是可信的。它的五轴高分意味着:它的决策逻辑可解释、可追踪、可复现,你大概率能把它部署到实盘而不会出现灾难性的意外。

这就是CLQT”诊断而非排名”的精髓:五轴告诉你这个Agent的可信边界在哪里,而收益数字不能。

4.3 自评工具:给你的Agent打分

CLQT的五轴评分并非只能用于学术论文。我们完全可以把它简化成一个自查清单,用来审视自己搭建的LLM交易Agent。以下是一个可以直接使用的评分模板(1-5分制):

Coherence(一致性)自查:

  • 抽取Agent在不同日期对同一板块(如半导体)的判断,逻辑是否一致?
  • Agent是否会在同一天对同一标的给出矛盾的信号?
  • 推理链中是否存在前后矛盾的因果论断?

Acuity(敏锐度)自查:

  • 重大事件(财报、政策)发生后,Agent在第几个交易日做出反应?
  • Agent的信号是否总是滞后于价格已经走出的行情?

Composure(定力)自查:

  • 在回撤期,Agent是否出现了非纪律性的仓位骤变?
  • 面对连续亏损,Agent是否会”翻倍下注”或”清仓逃跑”?

Discipline(纪律性)自查:

  • Agent声明的最大回撤约束、单笔仓位上限,在回测中是否被严格遵守?
  • 计算实际持仓与声明的风险预算的偏差率

Reliability(可复现性)自查:

  • 在temperature=0的条件下,同一输入运行3次,决策是否完全一致?
  • 换一台机器、换一个随机种子,结果是否稳定?

如果你的Agent在这五个轴上有任何一项低于3分,那么无论回测收益多么漂亮,都不要急着上实盘。先去修那个维度的问题。


五、实证:五模型对比,GPT-4 Turbo为何”Sharpe最高却震荡市失效”

CLQT是一套评测框架,而另一篇同期的论文则用它(及类似方法)做了实际的模型对比。

arxiv 2607.15414(2026年7月16日)系统评测了五个主流大模型在交易任务上的表现:GPT-4 Turbo、Claude 3 Opus、Gemini 1.5 Pro、Llama 3 70B、FinGPT。评测涵盖四项核心任务:K线形态识别、方向信号生成、回测、财报理解。

5.1 排行榜:GPT-4 Turbo综合最强

模型年化收益Sharpe相对标普500突出优势致命短板
GPT-4 Turbo最高最高跑赢综合能力最强、推理链最清晰震荡市表现剧烈下滑
FinGPT中等较高跑赢领域微调红利、风险调整后性价比高通用推理能力弱
Claude 3 Opus中等中等持平财报理解深度好K线形态识别误判多
Gemini 1.5 Pro偏低中等略输长上下文处理强数值幻觉严重
Llama 3 70B偏低偏低略输开源、可本地部署综合能力最弱

两个关键发现:

第一,GPT-4 Turbo和FinGPT都跑赢了标普500被动基准。 这说明LLM在AI交易中确实有超越随机的真实潜力——并非全是泄漏和幻觉。

第二,所有模型都有共同的致命缺陷,CLQT五轴能精准地诊断出这些缺陷:

  • 数值幻觉:Gemini 1.5 Pro最严重,经常把”涨幅12.3%“读成”涨幅1.23%“或”涨幅123%“。这直接破坏了Acuity(敏锐度)——连数字都读不对,谈不上信号敏锐
  • 上下文窗口限制:当需要处理超过128K token的历史数据时,所有模型都出现了”遗忘早期信息”的现象,导致**Coherence(一致性)**下降——同一标的在不同轮次的判断出现矛盾
  • 震荡市表现不稳定:GPT-4 Turbo在趋势市Sharpe可达2.0+,但进入震荡市后骤降至0.5以下。这说明它的alpha高度依赖市场状态(market regime),而非普适能力。这正是**Composure(定力)**轴要诊断的——一个真正有定力的Agent,不应该在市场风格切换时表现断崖式下滑

5.2 一个反直觉的结论:FinGPT的”性价比陷阱”

这篇论文最反直觉的发现是关于FinGPT的。

FinGPT(基于Llama微调的金融领域模型)在原始收益上不如GPT-4 Turbo,但在风险调整后(risk-adjusted)的表现上非常接近。更关键的是,在CLQT五轴评估中,FinGPT的Discipline(纪律性)得分反而高于GPT-4 Turbo——因为它经过金融语料微调,更”听话”地执行了声明中的仓位约束。

这个发现对实操意义重大:如果你的目标是”稳定地跑赢基准”而非”博取最高收益”,一个经过领域微调的中小模型,可能在性价比和可控性上优于通用大模型。 这与我们在《77篇LLM Agentic Trading论文审计》中看到的趋势一致——领域微调是LLM量化落地最务实的路径。

论文的最终建议是:LLM在AI交易中有真实潜力,但稳健部署需要三件事——任务分解(把选股、择时、风控拆开)、严格回测(用CLQT式TimeGate)、领域微调(而非直接用通用大模型)。


六、CLQT vs StockBench:两个评测框架如何互补

读完CLQT,一个自然的问题是:它和我们之前深度解读的StockBench评测方法论是什么关系?

两者解决的是LLM交易Agent评测的同一个核心痛点——“回测好看不等于能力强”——但切入点不同,且高度互补。

6.1 两个框架的定位差异

维度StockBenchCLQT
评测对象LLM的金融知识问答能力(静态)LLM的交易决策能力(动态闭环)
核心问题”这个模型懂不懂金融?""这个Agent会不会交易?“
时间结构单轮问答,无时间演化多轮闭环,有时间序列和路径依赖
防泄漏机制contamination-free数据集(确保测试题未被预训练见过)硬TimeGate + 哈希链(防止未来函数和事后篡改)
评分维度问答准确率、推理质量五轴APM-CS(一致性/敏锐度/定力/纪律/可复现)
成本建模无(不涉及交易)完整(交易成本、融资成本、冲击成本)
适用阶段模型选型阶段(选哪个基座模型)Agent上线前的能力审计(这个Agent能部署吗)

6.2 互补的使用方式

一个成熟的LLM量化团队,应该把两个框架串联使用:

第一步(模型选型):用StockBench回答”哪个基座模型的金融理解力最强”。 这决定了你的Agent用什么大脑。比如 StockBench 可能告诉你 Claude 3 Opus 在财报推理上强于 GPT-4,但 GPT-4 在 K 线形态识别上更强——你据此选择基座。

第二步(Agent审计):用CLQT回答”用这个模型搭建的Agent,在闭环交易中能力如何”。 这决定了你的Agent能不能上线。CLQT的五轴评分会告诉你,这个Agent虽然回测收益不错,但Discipline只有2分(不遵守风控)——那么你必须先修复风控逻辑,而不是带着缺陷上实盘。

打个比方:StockBench是笔试(考金融知识),CLQT是实操考核(考驾驶技术)。一个候选者笔试满分,不代表他能上路——因为开车需要的不仅仅是交规知识,还有临场判断、心理素质、规则执行。

这就是为什么”问答强 ≠ 交易强”。 我们在StockBench解读中就指出过这个陷阱,CLQT则从框架层面给出了完整的工程化解法。


七、对AgentQuant读者的实操启示

7.1 三个立刻可用的行动项

无论你是AI量化的研究者还是实盘交易者,CLQT框架都指向三个可以立刻执行的行动:

行动一:把你的Agent回测改成”诊断报告”而非”收益报告”。 下次做回测时,除了输出资金曲线,再输出五轴评分。哪怕只是粗略的自查清单(如第四节所示),也能帮你发现回测收益背后的能力黑洞。一个Discipline低分、Reliability低分的Agent,收益再高也不能用。

行动二:给你的回测系统加一个”硬TimeGate”。 在数据管道的最底层,为每一个输入特征、每一条新闻文本、每一个财务指标打上严格的时间戳,并在喂给Agent前做一次时间闸门校验。这不是可选项——在《数据泄露检验》中我们看到,不做这一步的Agent有极大概率在泄漏未来信息。

行动三:领域微调优于通用大模型。 如果你打算让LLM Agent真正参与交易决策(而非仅做研究辅助),基于金融语料微调的中小模型(如FinGPT路线)在纪律性和可控性上优于直接用GPT-4级通用模型。通用大模型适合做”分析师”(出主意),微调模型适合做”交易员”(执行)。

7.2 一个值得警惕的反面信号

CLQT论文还隐含了一个对所有AI量化从业者都有警示意义的数据点:在他们测试的多个公开宣称”年化40%+“的Agent中,经过TimeGate+去Beta+五轴审计后,没有一个是真正经得起复现的。

这和我们在《LLM Agent量化交易2026论文解读》以及《ICLR 2026论文:LLM Agent量化实践》中的观察一脉相承——2026年的LLM交易Agent,绝大多数的”超额收益”经不起严格检验。这不是说LLM在量化中没有价值,而是说价值的方向需要重新校准:从”追求回测收益最大化”转向”追求决策过程可解释、可复现、可审计”。

CLQT给这个方向提供了第一套完整的工程方法论。这也是为什么我们认为这篇论文值得每个AI量化人认真读一遍。


结语:从”炫技”到”诊断”的范式转折

2026年,AI量化正在经历一个微妙的转折。

一方面,工具在爆炸——Qlib、TradingAgents、FinGPT、各类Agent框架层出不穷,让”搭一个AI交易Agent”的门槛降到了一个周末项目就能跑通的程度。另一方面,方法论在收敛——当所有人都能轻松跑出一条漂亮的回测曲线时,“漂亮”本身就贬值了。真正稀缺的,是区分真实能力与虚假繁荣的评测标尺

CLQT的五轴评分卡,就是这把标尺。它不告诉你”谁第一”,但它告诉你”谁可信”——而在交易这个领域,可信永远比第一重要。

记住那句话:收益是结果,过程是能力。只看结果的排名,是在给运气发奖牌。


作者:梁延超 | AgentQuant 数据来源:arxiv 2606.29771(CLQT)、arxiv 2607.15414(AI Trading评测)、AgentQuant自有信号系统 本文为draft待审阅版本,数据与结论以正式发布版为准。

免责声明:本文为技术研究与方法论探讨,不构成任何投资建议。AI交易Agent的实盘部署涉及重大风险,请充分回测、严格风控后再做决策。

💬 评论