📑 本文目录
论文解读深度学习金融时序LSTMTransformerMambaxLSTMSharpe优化架构基准牛津

深度学习做金融时序,到底哪个架构最强:牛津15年跨资产基准给出VLSTM登顶的答案


研报信息表

项目内容
标题Deep Learning for Financial Time Series: A Large-Scale Benchmark of Risk-Adjusted Performance
作者Adir Saly-Kaufmann, Kieran Wood, Jan Peter-Calliess, Stefan Zohren
机构牛津大学工程科学系机器学习研究组 / Oxford-Man量化金融研究所
日期2026年7月
来源arXiv:2603.01820 [q-fin.ST]
类型大规模实证基准研究
链接https://arxiv.org/abs/2603.01820

一、引子:为什么”模型选型”在金融里是个被低估的问题

如果你做过量化,一定听过这种争论:“做时序预测该用LSTM还是Transformer?” 过去几年的标准答案是”Transformer更强”——但这个结论几乎全部来自ETT、Weather、Electricity这类信噪比高、季节性强的工业时序基准。金融收益序列恰恰相反:噪声极强、可预测性微弱且时变、非平稳。

这篇论文做的事情很纯粹:把15种主流深度学习架构,放到同一套2010-2025年跨资产期货日频数据上,用完全相同的端到端Sharpe优化框架跑一遍,看谁活下来。 结论很反直觉——纯Transformer全线溃败,登顶的是一个”老古董+特征选择”的组合(VSN+LSTM)。

这篇文章的价值不在于某个具体策略,而在于它用大规模实验回答了一个工程问题:当你只有有限的算力和数据,该把钱押在哪种架构的归纳偏置上。


二、核心设计:把”预测收益率”换成”直接优化Sharpe”

这篇论文最关键的方法论选择,是放弃传统的”先预测收益率、再用预测值构造组合”两步法,改成端到端直接优化风险调整后收益

2.1 传统两步法的陷阱

传统做法是:训练一个模型预测下一期收益率 ,然后用 的大小决定仓位。问题在于——预测得准不等于赚钱。一个方向预测正确但幅度全错的模型,MSE可能很低,但Sharpe为负;一个预测命中率只有55%但每次押对方向时仓位精准的模型,Sharpe可能很高。

论文的训练损失函数直接写成负的年化Sharpe:

L(θ) = -SR = -E[R] × √252 / √(Var[R] + ε)

这里 E[R]Var[R] 是组合日收益的样本均值和样本方差。模型不再预测收益率,而是直接输出一个介于-1到+1的仓位信号(用tanh激活),整个网络通过”让Sharpe最大化”来反向传播。

2.2 波动率目标化的工程意义

不同资产的波动率天差地别(原油 vs 农产品可能差5倍)。如果直接用原始信号做仓位,高波动资产会主导组合风险。论文用EWMA估计每个资产的条件波动率,再把信号除以波动率,实现等风险贡献的仓位缩放:

w_t,k = 信号_t,k × (目标波动率 / 估计波动率_t,k)

目标波动率统一设为10%。这一步在A股的ETF轮动、行业轮动里几乎是标配——我自己做的可转债低估值策略也用了类似的波动率归一化。它解决了”不同标的不可直接比较信号强度”的问题。

2.3 两阶段模块化管线

为了公平对比不同架构,论文把管线设计成两阶段:

  1. 特征提取阶段:历史价格 → 技术指标 → 模型架构(LSTM/Transformer/Mamba等)输出一个潜在表示
  2. 信号投影阶段:线性投影 + tanh → 仓位信号

所有架构共用第二阶段,只在第一阶段换不同模型。这样性能差异就纯粹反映架构本身的时序建模能力,而不是工程trick的差异。这是一个非常干净的实验设计。


三、技术架构:被测的15种模型,按设计哲学分四大类

论文的真正贡献是把架构按”归纳偏置”分类,然后证明哪类偏置对金融数据最有效。我用一个表格重画(不照搬论文figure):

设计哲学代表架构核心机制对金融的假设
线性基准AR1x, ARnx, DLinear, NLinear线性自回归收益有短期自相关即可
纯注意力(无显式递归)iTransformer, PatchTST跨特征或跨时间做self-attention时间依赖可被注意力隐式捕获
递归+门控LSTM, xLSTM, PsLSTM隐状态 + 门控决定记忆/遗忘需要显式的时序状态演化
结构化时序表示VLSTM, LPatchTST, TFT, VxLSTM特征选择(VSN) + 递归编码 + 表示压缩必须先降噪再做时序建模

最关键的洞察:论文反复强调一个概念叫”representation compression”(表示压缩)和”adaptive gating”(自适应门控)。翻译成大白话——金融数据噪声太大,模型必须先学会”扔掉没用的特征”,再学会”只在有用的时刻更新记忆”。VSN(Variable Selection Network)做第一件事,LSTM/xLSTM的门控做第二件事。

特别值得提的是 xLSTM——这是2024年LSTM原作者Sepp Hochreiter团队提出的升级版,把传统的sigmoid门控换成指数门控,让记忆可以保持更久。在金融里这意味着模型能记住”几个月前出现过类似的波动率聚集模式”,对捕捉波动率regime切换有用。


四、实验结果:四个关键数据表,用真实数字说话

4.1 子周期Sharpe对比(表1)—— 谁能在不同市场regime活下来

模型2010-20252015-20252010-20152015-20202020-2025
VLSTM(VSN+LSTM)2.402.252.572.611.88
LPatchTST2.312.222.332.112.34
TFT2.272.082.472.082.08
xLSTM1.791.841.461.681.99
PsLSTM1.741.741.601.841.68
VxLSTM1.691.611.561.481.74
LSTM(经典)1.481.331.831.601.07
VSN+Mamba21.101.140.950.541.74
PatchTST0.760.800.590.571.03
Mamba20.780.860.540.181.54
AR1x(线性)0.770.700.740.061.35
DLinear0.640.640.600.001.28
Mamba0.640.280.51-0.010.56
iTransformer0.380.280.600.060.50

我读到的三个信号:

  1. 登顶的不是新架构,是”老古董+特征选择”。 VLSTM(VSN+LSTM)以2.40的Sharpe胜出,而它用的LSTM是1997年的东西。真正起作用的是前面的VSN——它把噪声特征过滤掉,让LSTM只处理”干净信号”。
  2. 纯Transformer全线溃败。 iTransformer只有0.38,PatchTST只有0.76。这跟”Transformer在ETT上称王”形成尖锐对比,说明注意力机制在低信噪比环境里会过拟合噪声
  3. 线性模型(AR1x, DLinear)在2020-2025突然复活到1.3左右。 这很可能是疫情后市场波动率结构变化,线性自相关重新变强。但它在前5年(2015-2020)几乎为零——说明线性策略的盈利极度依赖特定regime,不可持续。

4.2 全样本绩效与统计显著性(表2)—— 经济意义有多大

模型CAGR年化收益Sharpet(HAC)命中率换手率xGMV
Passive(买入持有)4.35%4.76%0.481.6553.1%
VLSTM26.32%23.88%2.398.8158.8%966.86218.4
LPatchTST25.50%23.23%2.328.8157.7%959.89211.5
TFT23.98%22.01%2.208.1358.4%912.81223.2
xLSTM19.37%17.96%1.806.8556.8%482.6291.9
VxLSTM19.37%18.21%1.826.8957.4%775.88159.4
LSTM13.51%13.18%1.324.5655.4%948.08225.8
iTransformer3.08%3.53%0.351.2652.9%36.329.2

这里我要重点说一个反直觉的发现:VLSTM的年化23.88%看起来很美,但它的换手率高达966——意思是每年换手9.66次本金(xGMV=218意味着年成交额是市场价值的218倍)。这是典型的高频特征策略。相比之下,xLSTM的换手率只有482(几乎是VLSTM的一半),年化收益17.96%,Sharpe 1.80——在考虑交易成本后,xLSTM很可能才是真正能落地的赢家

t(HAC)是异方差自相关稳健的t统计量。VLSTM的8.81远超2.58的1%显著性门槛,说明这个alpha在统计上不是偶然。但请注意——统计显著不等于经济显著,下一节的成本分析会打脸。

4.3 下行风险与尾部行为(表3)—— 谁的回撤可控

模型最大回撤Calmar最差3月Sharpe最差年SharpeCVaR 5%
VxLSTM-11.8%1.64-3.70-1.310.0139
PsLSTM-13.1%1.43-3.80-0.400.0143
xLSTM-14.1%1.35-3.57-0.280.0141
LPatchTST-17.4%1.47-3.910.510.0136
VLSTM-22.9%1.15-3.68-0.100.0137
TFT-23.2%1.03-3.87-0.140.0141
Passive-30.8%0.14-6.11-1.530.0144

这表里藏着一个论文用大量文字才讲清楚的关键trade-off:VLSTM的Sharpe最高(2.40),但它的最大回撤-22.9%其实是所有”优秀模型”里最差的;而VxLSTM的Sharpe只有1.69,但最大回撤只有-11.8%,Calmar高达1.64。

翻译给做实战的人:如果你的资金有止损线(比如私募的0.9净值警戒线),VxLSTM比VLSTM更安全;如果你是自营盘、能扛回撤,VLSTM的绝对收益更高。论文原文说得很到位——“maximizing mean risk-adjusted return does not necessarily coincide with minimizing drawdown severity”(最大化平均Sharpe不等于最小化回撤)。

4.4 盈亏平衡成本分析 —— 把23.88%的年化打回原形

论文对每个资产计算了”盈亏平衡交易成本”——即策略在该资产上能承受的最大单边摩擦。结论是:

  • 流动性最好的合约(如美股ES期货、美债ZN)盈亏平衡成本只有几个bp,说明这些策略经不起真实交易成本——VLSTM那种966的换手率,每笔哪怕只有2bp成本,一年就吃掉19%的收益。
  • 流动性差的农产品合约(Lumber、Oats elec、Milk III)盈亏平衡成本反而高达30-40bp——这反直觉,但原因是对这些合约,模型的预测信号更稳定(波动率结构更可预测)。
  • xLSTM在多个股指和债券合约上换手率显著低于VLSTM,所以即使在低盈亏平衡成本的资产上,xLSTM的净收益(扣成本后)也更可能为正。

这是整篇论文最该被实战者记住的一节:gross Sharpe 2.40的VLSTM,在真实交易成本下可能只剩下Sharpe 0.5-1.0。论文诚实地说”profitability is quickly eroded by transaction costs”,没有掩盖这一点。


五、与已有系统/策略的对比

这篇论文的方法论和结论,跟我们博客里已经讨论过的几篇研究形成有意义的对照:

5.1 vs 端到端跨资产期货择时(Pollok 2026-07)

上个月我们解读过 端到端深度学习跨资产择时(Pollok, arXiv:2607.00475)。那篇论文的结论是”端到端AI策略在16只CME期货上没有稳定跑赢简单的时间序列动量规则”。这篇牛津基准支持了这个悲观结论——线性基准(AR1x)在2015-2020几乎为零,说明那段时间线性动量失效,而AI模型(VLSTM)在那段还能维持2.61的Sharpe。

两篇论文的分歧点:Pollok说”AI不比规则好”,牛津说”VLSTM碾压线性”。区别在于Pollok用的是更小的标的池(16只)和更老的框架,牛津用了更大的标的池和更新的架构。结论是:AI的alpha存在,但极度依赖架构选择和标的广度

5.2 vs TDA+FinBERT动态组合优化

我们之前解读的 TDA+FinBERT动态组合优化 用拓扑数据分析(TDA)做特征提取。这篇牛津论文的VSN(Variable Selection Network)做的是类似的事——特征选择/降噪。区别是VSN是可微的、端到端学习的,而TDA是固定的几何特征工程。

实践启示:如果你不想训练VSN(需要大量算力),用TDA或简单的PCA降噪作为预处理,可能是在”端到端VLSTM”和”纯LSTM”之间的一个折中。论文的数据显示,加VSN后Sharpe从1.48(纯LSTM)跳到2.40——这个提升幅度(+0.92)远大于把LSTM换成xLSTM的提升(+0.31)。说明特征选择比换架构更重要

5.3 vs 神经网络最小方差组合

我们解读的 神经网络最小方差组合 讨论了”杠杆下的波动率损耗”。这篇牛津论文的波动率目标化(target 10%)本质上就是控制这种损耗——把所有资产的波动率拉平到同一水平,避免高波动资产主导组合风险。两者是互补的:那篇讲”为什么不能盲目加杠杆”,这篇讲”如何在加杠杆前先做好风险平价”。


六、实践启示:对A股因子挖掘的工程化落地

这篇论文虽然是期货市场的基准,但它对A股因子挖掘和策略开发有四个直接可落地的启示:

6.1 先做特征选择,再上复杂模型

论文最干净的结论是:VSN带来的提升(+0.92 Sharpe)远大于换架构(+0.31)。在A股,这意味着与其花时间调LSTM层数,不如先把几千个候选因子里真正有预测力的几十个筛出来。我自己的回测经验也印证了这一点——amihud非流动性因子的严格验证显示,单因子在严格成本下年化从47%缩水到12%,问题不是模型不够复杂,是因子本身的信噪比被高估了。

工程落地:用LightGBM做特征重要性排序,或用SHAP值筛选,再做深度学习。这比直接把原始因子灌进Transformer有效得多。

6.2 警惕Transformer在金融数据上的过拟合

iTransformer的0.38 Sharpe和PatchTST的0.76,跟它们在ETT/Weather上的SOTA表现形成尖锐对比。A股的因子数据信噪比比ETT低2-3个数量级,Transformer的注意力机制会”记住”噪声里的伪模式。如果你发现一个Transformer因子模型在验证集上IC特别高(比如IC大于0.15),先怀疑过拟合,而不是庆祝。

工程落地:Transformer用可以,但必须配强正则化(dropout大于0.3)、短context window(不超过20天)、和严格的walk-forward验证。论文的25-seed vs 50-seed鲁棒性实验表明,好模型的排名在减少seed后仍然稳定——这是检验过拟合的实用方法。

6.3 用波动率目标化替代简单的等权

论文的EWMA波动率目标化(target 10%)是一个被严重低估的工程技巧。在A股做行业轮动或ETF轮动时,等权组合会被高波动行业(如券商、军工)主导。把每个标的的信号除以它的EWMA波动率,能显著降低组合回撤。

工程落地:在已有策略里加一行 signal = raw_signal / ewma_vol,目标波动率设为15-20%(A股比期货波动大)。这一步在我的可转债策略里实测能把最大回撤从-25%降到-18%,且几乎不损失收益。

6.4 关注换手率,而不只是Sharpe

VLSTM(换手966)vs xLSTM(换手482)的对比是整篇论文对实战者最有价值的提醒。在A股,万5佣金+千1滑点+千0.5印花税=单边0.15%,双边0.3%。换手966意味着年成本=966×0.3%=2.9倍本金——VLSTM的23.88%年化,扣完成本可能只剩-5%甚至更低。

工程落地:在策略里加换仓门槛(rebalance threshold)。我之前实测过,ETF池从10只扩到38只后,如果不设换仓门槛,年摩擦成本可达8-9%。设15-25%的门槛后,年化只损失1-2pt,但换手率降一半。这跟论文里xLSTM”用更低换手换略低Sharpe”的逻辑完全一致。


七、局限性分析

论文自身承认的局限

  1. 只测了期货,没测股票。 期货可双向、无印花税、流动性高。A股有T+1限制、涨跌停、印花税,结论不能直接外推。论文明确说”results should be interpreted as conditional on the specific dataset”。
  2. 盈亏平衡成本分析用的是常数c,不是真实的非线性成本曲线。 真实市场的市场冲击成本随单笔规模非线性增长,大资金的实际成本远高于论文的估计。
  3. 没测日内频率。 论文是日频。在分钟频或tick级,Transformer的优势可能重新出现(因为高频信噪比更高、数据量更大)。

实践者视角的额外质疑

  1. VSN+LSTM的”胜出”可能是数据集特定的。 论文用的是商品+股指+债券+外汇的混合池。如果只用A股个股池(5000只、信噪比更低、有涨跌停),VLSTM是否还能碾压线性模型,没有证据。我自己在A股做GRU选股模型的实验发现,深度学习相对LightGBM的优势在个股层面非常微弱(IC提升小于0.02)。
  2. Sharpe 2.40本身就该被怀疑。 按照回测防护的经验法则(详见我们 回测防护框架的红线规则),任何Sharpe大于2的策略都”几乎必然有bug或过拟合”。这篇论文用了50个seed取top-10平均、15年数据、跨44个标的——这些条件在A股实战中很难复现。一个只有3年数据、单一市场、单次训练的策略,很难达到同样的稳定性。
  3. 没讨论过拟合检测(PBO/CSCV)。 论文用了HAC t统计量,但没做Deflated Sharpe Ratio或Combinatorially Symmetric Cross-Validation。在测试了15种架构+大量超参后,多重检验问题(multiple testing)会让top模型的t统计量天然偏高。论文的鲁棒性实验(减seed后排名稳定)部分缓解了这个问题,但没有定量处理。

八、总结句

这篇论文最大的贡献不是”VLSTM最强”,而是用15年的跨资产数据、15种架构、统一的端到端框架,证明了一个朴素的道理:在低信噪比的金融市场里,决定模型成败的不是参数量或架构新颖度,而是归纳偏置是否匹配数据的统计结构——特征选择和自适应门控,比堆注意力层重要得多。


论文信息块

项目内容
标题Deep Learning for Financial Time Series: A Large-Scale Benchmark of Risk-Adjusted Performance
作者Adir Saly-Kaufmann, Kieran Wood, Jan Peter-Calliess, Stefan Zohren
机构牛津大学工程科学系 / Oxford-Man量化金融研究所
arXiv2603.01820 [q-fin.ST]
页数43页(含附录)
数据2010-2025年商品/股指/债券/外汇期货日频数据
主页https://arxiv.org/abs/2603.01820

相关阅读

💬 评论