📑 本文目录
深度学习做金融时序,到底哪个架构最强:牛津15年跨资产基准给出VLSTM登顶的答案
研报信息表
| 项目 | 内容 |
|---|---|
| 标题 | Deep Learning for Financial Time Series: A Large-Scale Benchmark of Risk-Adjusted Performance |
| 作者 | Adir Saly-Kaufmann, Kieran Wood, Jan Peter-Calliess, Stefan Zohren |
| 机构 | 牛津大学工程科学系机器学习研究组 / Oxford-Man量化金融研究所 |
| 日期 | 2026年7月 |
| 来源 | arXiv:2603.01820 [q-fin.ST] |
| 类型 | 大规模实证基准研究 |
| 链接 | https://arxiv.org/abs/2603.01820 |
一、引子:为什么”模型选型”在金融里是个被低估的问题
如果你做过量化,一定听过这种争论:“做时序预测该用LSTM还是Transformer?” 过去几年的标准答案是”Transformer更强”——但这个结论几乎全部来自ETT、Weather、Electricity这类信噪比高、季节性强的工业时序基准。金融收益序列恰恰相反:噪声极强、可预测性微弱且时变、非平稳。
这篇论文做的事情很纯粹:把15种主流深度学习架构,放到同一套2010-2025年跨资产期货日频数据上,用完全相同的端到端Sharpe优化框架跑一遍,看谁活下来。 结论很反直觉——纯Transformer全线溃败,登顶的是一个”老古董+特征选择”的组合(VSN+LSTM)。
这篇文章的价值不在于某个具体策略,而在于它用大规模实验回答了一个工程问题:当你只有有限的算力和数据,该把钱押在哪种架构的归纳偏置上。
二、核心设计:把”预测收益率”换成”直接优化Sharpe”
这篇论文最关键的方法论选择,是放弃传统的”先预测收益率、再用预测值构造组合”两步法,改成端到端直接优化风险调整后收益。
2.1 传统两步法的陷阱
传统做法是:训练一个模型预测下一期收益率 r̂,然后用 r̂ 的大小决定仓位。问题在于——预测得准不等于赚钱。一个方向预测正确但幅度全错的模型,MSE可能很低,但Sharpe为负;一个预测命中率只有55%但每次押对方向时仓位精准的模型,Sharpe可能很高。
论文的训练损失函数直接写成负的年化Sharpe:
L(θ) = -SR = -E[R] × √252 / √(Var[R] + ε)
这里 E[R] 和 Var[R] 是组合日收益的样本均值和样本方差。模型不再预测收益率,而是直接输出一个介于-1到+1的仓位信号(用tanh激活),整个网络通过”让Sharpe最大化”来反向传播。
2.2 波动率目标化的工程意义
不同资产的波动率天差地别(原油 vs 农产品可能差5倍)。如果直接用原始信号做仓位,高波动资产会主导组合风险。论文用EWMA估计每个资产的条件波动率,再把信号除以波动率,实现等风险贡献的仓位缩放:
w_t,k = 信号_t,k × (目标波动率 / 估计波动率_t,k)
目标波动率统一设为10%。这一步在A股的ETF轮动、行业轮动里几乎是标配——我自己做的可转债低估值策略也用了类似的波动率归一化。它解决了”不同标的不可直接比较信号强度”的问题。
2.3 两阶段模块化管线
为了公平对比不同架构,论文把管线设计成两阶段:
- 特征提取阶段:历史价格 → 技术指标 → 模型架构(LSTM/Transformer/Mamba等)输出一个潜在表示
- 信号投影阶段:线性投影 + tanh → 仓位信号
所有架构共用第二阶段,只在第一阶段换不同模型。这样性能差异就纯粹反映架构本身的时序建模能力,而不是工程trick的差异。这是一个非常干净的实验设计。
三、技术架构:被测的15种模型,按设计哲学分四大类
论文的真正贡献是把架构按”归纳偏置”分类,然后证明哪类偏置对金融数据最有效。我用一个表格重画(不照搬论文figure):
| 设计哲学 | 代表架构 | 核心机制 | 对金融的假设 |
|---|---|---|---|
| 线性基准 | AR1x, ARnx, DLinear, NLinear | 线性自回归 | 收益有短期自相关即可 |
| 纯注意力(无显式递归) | iTransformer, PatchTST | 跨特征或跨时间做self-attention | 时间依赖可被注意力隐式捕获 |
| 递归+门控 | LSTM, xLSTM, PsLSTM | 隐状态 + 门控决定记忆/遗忘 | 需要显式的时序状态演化 |
| 结构化时序表示 | VLSTM, LPatchTST, TFT, VxLSTM | 特征选择(VSN) + 递归编码 + 表示压缩 | 必须先降噪再做时序建模 |
最关键的洞察:论文反复强调一个概念叫”representation compression”(表示压缩)和”adaptive gating”(自适应门控)。翻译成大白话——金融数据噪声太大,模型必须先学会”扔掉没用的特征”,再学会”只在有用的时刻更新记忆”。VSN(Variable Selection Network)做第一件事,LSTM/xLSTM的门控做第二件事。
特别值得提的是 xLSTM——这是2024年LSTM原作者Sepp Hochreiter团队提出的升级版,把传统的sigmoid门控换成指数门控,让记忆可以保持更久。在金融里这意味着模型能记住”几个月前出现过类似的波动率聚集模式”,对捕捉波动率regime切换有用。
四、实验结果:四个关键数据表,用真实数字说话
4.1 子周期Sharpe对比(表1)—— 谁能在不同市场regime活下来
| 模型 | 2010-2025 | 2015-2025 | 2010-2015 | 2015-2020 | 2020-2025 |
|---|---|---|---|---|---|
| VLSTM(VSN+LSTM) | 2.40 | 2.25 | 2.57 | 2.61 | 1.88 |
| LPatchTST | 2.31 | 2.22 | 2.33 | 2.11 | 2.34 |
| TFT | 2.27 | 2.08 | 2.47 | 2.08 | 2.08 |
| xLSTM | 1.79 | 1.84 | 1.46 | 1.68 | 1.99 |
| PsLSTM | 1.74 | 1.74 | 1.60 | 1.84 | 1.68 |
| VxLSTM | 1.69 | 1.61 | 1.56 | 1.48 | 1.74 |
| LSTM(经典) | 1.48 | 1.33 | 1.83 | 1.60 | 1.07 |
| VSN+Mamba2 | 1.10 | 1.14 | 0.95 | 0.54 | 1.74 |
| PatchTST | 0.76 | 0.80 | 0.59 | 0.57 | 1.03 |
| Mamba2 | 0.78 | 0.86 | 0.54 | 0.18 | 1.54 |
| AR1x(线性) | 0.77 | 0.70 | 0.74 | 0.06 | 1.35 |
| DLinear | 0.64 | 0.64 | 0.60 | 0.00 | 1.28 |
| Mamba | 0.64 | 0.28 | 0.51 | -0.01 | 0.56 |
| iTransformer | 0.38 | 0.28 | 0.60 | 0.06 | 0.50 |
我读到的三个信号:
- 登顶的不是新架构,是”老古董+特征选择”。 VLSTM(VSN+LSTM)以2.40的Sharpe胜出,而它用的LSTM是1997年的东西。真正起作用的是前面的VSN——它把噪声特征过滤掉,让LSTM只处理”干净信号”。
- 纯Transformer全线溃败。 iTransformer只有0.38,PatchTST只有0.76。这跟”Transformer在ETT上称王”形成尖锐对比,说明注意力机制在低信噪比环境里会过拟合噪声。
- 线性模型(AR1x, DLinear)在2020-2025突然复活到1.3左右。 这很可能是疫情后市场波动率结构变化,线性自相关重新变强。但它在前5年(2015-2020)几乎为零——说明线性策略的盈利极度依赖特定regime,不可持续。
4.2 全样本绩效与统计显著性(表2)—— 经济意义有多大
| 模型 | CAGR | 年化收益 | Sharpe | t(HAC) | 命中率 | 换手率 | xGMV |
|---|---|---|---|---|---|---|---|
| Passive(买入持有) | 4.35% | 4.76% | 0.48 | 1.65 | 53.1% | — | — |
| VLSTM | 26.32% | 23.88% | 2.39 | 8.81 | 58.8% | 966.86 | 218.4 |
| LPatchTST | 25.50% | 23.23% | 2.32 | 8.81 | 57.7% | 959.89 | 211.5 |
| TFT | 23.98% | 22.01% | 2.20 | 8.13 | 58.4% | 912.81 | 223.2 |
| xLSTM | 19.37% | 17.96% | 1.80 | 6.85 | 56.8% | 482.62 | 91.9 |
| VxLSTM | 19.37% | 18.21% | 1.82 | 6.89 | 57.4% | 775.88 | 159.4 |
| LSTM | 13.51% | 13.18% | 1.32 | 4.56 | 55.4% | 948.08 | 225.8 |
| iTransformer | 3.08% | 3.53% | 0.35 | 1.26 | 52.9% | 36.32 | 9.2 |
这里我要重点说一个反直觉的发现:VLSTM的年化23.88%看起来很美,但它的换手率高达966——意思是每年换手9.66次本金(xGMV=218意味着年成交额是市场价值的218倍)。这是典型的高频特征策略。相比之下,xLSTM的换手率只有482(几乎是VLSTM的一半),年化收益17.96%,Sharpe 1.80——在考虑交易成本后,xLSTM很可能才是真正能落地的赢家。
t(HAC)是异方差自相关稳健的t统计量。VLSTM的8.81远超2.58的1%显著性门槛,说明这个alpha在统计上不是偶然。但请注意——统计显著不等于经济显著,下一节的成本分析会打脸。
4.3 下行风险与尾部行为(表3)—— 谁的回撤可控
| 模型 | 最大回撤 | Calmar | 最差3月Sharpe | 最差年Sharpe | CVaR 5% |
|---|---|---|---|---|---|
| VxLSTM | -11.8% | 1.64 | -3.70 | -1.31 | 0.0139 |
| PsLSTM | -13.1% | 1.43 | -3.80 | -0.40 | 0.0143 |
| xLSTM | -14.1% | 1.35 | -3.57 | -0.28 | 0.0141 |
| LPatchTST | -17.4% | 1.47 | -3.91 | 0.51 | 0.0136 |
| VLSTM | -22.9% | 1.15 | -3.68 | -0.10 | 0.0137 |
| TFT | -23.2% | 1.03 | -3.87 | -0.14 | 0.0141 |
| Passive | -30.8% | 0.14 | -6.11 | -1.53 | 0.0144 |
这表里藏着一个论文用大量文字才讲清楚的关键trade-off:VLSTM的Sharpe最高(2.40),但它的最大回撤-22.9%其实是所有”优秀模型”里最差的;而VxLSTM的Sharpe只有1.69,但最大回撤只有-11.8%,Calmar高达1.64。
翻译给做实战的人:如果你的资金有止损线(比如私募的0.9净值警戒线),VxLSTM比VLSTM更安全;如果你是自营盘、能扛回撤,VLSTM的绝对收益更高。论文原文说得很到位——“maximizing mean risk-adjusted return does not necessarily coincide with minimizing drawdown severity”(最大化平均Sharpe不等于最小化回撤)。
4.4 盈亏平衡成本分析 —— 把23.88%的年化打回原形
论文对每个资产计算了”盈亏平衡交易成本”——即策略在该资产上能承受的最大单边摩擦。结论是:
- 流动性最好的合约(如美股ES期货、美债ZN)盈亏平衡成本只有几个bp,说明这些策略经不起真实交易成本——VLSTM那种966的换手率,每笔哪怕只有2bp成本,一年就吃掉19%的收益。
- 流动性差的农产品合约(Lumber、Oats elec、Milk III)盈亏平衡成本反而高达30-40bp——这反直觉,但原因是对这些合约,模型的预测信号更稳定(波动率结构更可预测)。
- xLSTM在多个股指和债券合约上换手率显著低于VLSTM,所以即使在低盈亏平衡成本的资产上,xLSTM的净收益(扣成本后)也更可能为正。
这是整篇论文最该被实战者记住的一节:gross Sharpe 2.40的VLSTM,在真实交易成本下可能只剩下Sharpe 0.5-1.0。论文诚实地说”profitability is quickly eroded by transaction costs”,没有掩盖这一点。
五、与已有系统/策略的对比
这篇论文的方法论和结论,跟我们博客里已经讨论过的几篇研究形成有意义的对照:
5.1 vs 端到端跨资产期货择时(Pollok 2026-07)
上个月我们解读过 端到端深度学习跨资产择时(Pollok, arXiv:2607.00475)。那篇论文的结论是”端到端AI策略在16只CME期货上没有稳定跑赢简单的时间序列动量规则”。这篇牛津基准支持了这个悲观结论——线性基准(AR1x)在2015-2020几乎为零,说明那段时间线性动量失效,而AI模型(VLSTM)在那段还能维持2.61的Sharpe。
两篇论文的分歧点:Pollok说”AI不比规则好”,牛津说”VLSTM碾压线性”。区别在于Pollok用的是更小的标的池(16只)和更老的框架,牛津用了更大的标的池和更新的架构。结论是:AI的alpha存在,但极度依赖架构选择和标的广度。
5.2 vs TDA+FinBERT动态组合优化
我们之前解读的 TDA+FinBERT动态组合优化 用拓扑数据分析(TDA)做特征提取。这篇牛津论文的VSN(Variable Selection Network)做的是类似的事——特征选择/降噪。区别是VSN是可微的、端到端学习的,而TDA是固定的几何特征工程。
实践启示:如果你不想训练VSN(需要大量算力),用TDA或简单的PCA降噪作为预处理,可能是在”端到端VLSTM”和”纯LSTM”之间的一个折中。论文的数据显示,加VSN后Sharpe从1.48(纯LSTM)跳到2.40——这个提升幅度(+0.92)远大于把LSTM换成xLSTM的提升(+0.31)。说明特征选择比换架构更重要。
5.3 vs 神经网络最小方差组合
我们解读的 神经网络最小方差组合 讨论了”杠杆下的波动率损耗”。这篇牛津论文的波动率目标化(target 10%)本质上就是控制这种损耗——把所有资产的波动率拉平到同一水平,避免高波动资产主导组合风险。两者是互补的:那篇讲”为什么不能盲目加杠杆”,这篇讲”如何在加杠杆前先做好风险平价”。
六、实践启示:对A股因子挖掘的工程化落地
这篇论文虽然是期货市场的基准,但它对A股因子挖掘和策略开发有四个直接可落地的启示:
6.1 先做特征选择,再上复杂模型
论文最干净的结论是:VSN带来的提升(+0.92 Sharpe)远大于换架构(+0.31)。在A股,这意味着与其花时间调LSTM层数,不如先把几千个候选因子里真正有预测力的几十个筛出来。我自己的回测经验也印证了这一点——amihud非流动性因子的严格验证显示,单因子在严格成本下年化从47%缩水到12%,问题不是模型不够复杂,是因子本身的信噪比被高估了。
工程落地:用LightGBM做特征重要性排序,或用SHAP值筛选,再做深度学习。这比直接把原始因子灌进Transformer有效得多。
6.2 警惕Transformer在金融数据上的过拟合
iTransformer的0.38 Sharpe和PatchTST的0.76,跟它们在ETT/Weather上的SOTA表现形成尖锐对比。A股的因子数据信噪比比ETT低2-3个数量级,Transformer的注意力机制会”记住”噪声里的伪模式。如果你发现一个Transformer因子模型在验证集上IC特别高(比如IC大于0.15),先怀疑过拟合,而不是庆祝。
工程落地:Transformer用可以,但必须配强正则化(dropout大于0.3)、短context window(不超过20天)、和严格的walk-forward验证。论文的25-seed vs 50-seed鲁棒性实验表明,好模型的排名在减少seed后仍然稳定——这是检验过拟合的实用方法。
6.3 用波动率目标化替代简单的等权
论文的EWMA波动率目标化(target 10%)是一个被严重低估的工程技巧。在A股做行业轮动或ETF轮动时,等权组合会被高波动行业(如券商、军工)主导。把每个标的的信号除以它的EWMA波动率,能显著降低组合回撤。
工程落地:在已有策略里加一行 signal = raw_signal / ewma_vol,目标波动率设为15-20%(A股比期货波动大)。这一步在我的可转债策略里实测能把最大回撤从-25%降到-18%,且几乎不损失收益。
6.4 关注换手率,而不只是Sharpe
VLSTM(换手966)vs xLSTM(换手482)的对比是整篇论文对实战者最有价值的提醒。在A股,万5佣金+千1滑点+千0.5印花税=单边0.15%,双边0.3%。换手966意味着年成本=966×0.3%=2.9倍本金——VLSTM的23.88%年化,扣完成本可能只剩-5%甚至更低。
工程落地:在策略里加换仓门槛(rebalance threshold)。我之前实测过,ETF池从10只扩到38只后,如果不设换仓门槛,年摩擦成本可达8-9%。设15-25%的门槛后,年化只损失1-2pt,但换手率降一半。这跟论文里xLSTM”用更低换手换略低Sharpe”的逻辑完全一致。
七、局限性分析
论文自身承认的局限
- 只测了期货,没测股票。 期货可双向、无印花税、流动性高。A股有T+1限制、涨跌停、印花税,结论不能直接外推。论文明确说”results should be interpreted as conditional on the specific dataset”。
- 盈亏平衡成本分析用的是常数c,不是真实的非线性成本曲线。 真实市场的市场冲击成本随单笔规模非线性增长,大资金的实际成本远高于论文的估计。
- 没测日内频率。 论文是日频。在分钟频或tick级,Transformer的优势可能重新出现(因为高频信噪比更高、数据量更大)。
实践者视角的额外质疑
- VSN+LSTM的”胜出”可能是数据集特定的。 论文用的是商品+股指+债券+外汇的混合池。如果只用A股个股池(5000只、信噪比更低、有涨跌停),VLSTM是否还能碾压线性模型,没有证据。我自己在A股做GRU选股模型的实验发现,深度学习相对LightGBM的优势在个股层面非常微弱(IC提升小于0.02)。
- Sharpe 2.40本身就该被怀疑。 按照回测防护的经验法则(详见我们 回测防护框架的红线规则),任何Sharpe大于2的策略都”几乎必然有bug或过拟合”。这篇论文用了50个seed取top-10平均、15年数据、跨44个标的——这些条件在A股实战中很难复现。一个只有3年数据、单一市场、单次训练的策略,很难达到同样的稳定性。
- 没讨论过拟合检测(PBO/CSCV)。 论文用了HAC t统计量,但没做Deflated Sharpe Ratio或Combinatorially Symmetric Cross-Validation。在测试了15种架构+大量超参后,多重检验问题(multiple testing)会让top模型的t统计量天然偏高。论文的鲁棒性实验(减seed后排名稳定)部分缓解了这个问题,但没有定量处理。
八、总结句
这篇论文最大的贡献不是”VLSTM最强”,而是用15年的跨资产数据、15种架构、统一的端到端框架,证明了一个朴素的道理:在低信噪比的金融市场里,决定模型成败的不是参数量或架构新颖度,而是归纳偏置是否匹配数据的统计结构——特征选择和自适应门控,比堆注意力层重要得多。
论文信息块
| 项目 | 内容 |
|---|---|
| 标题 | Deep Learning for Financial Time Series: A Large-Scale Benchmark of Risk-Adjusted Performance |
| 作者 | Adir Saly-Kaufmann, Kieran Wood, Jan Peter-Calliess, Stefan Zohren |
| 机构 | 牛津大学工程科学系 / Oxford-Man量化金融研究所 |
| arXiv | 2603.01820 [q-fin.ST] |
| 页数 | 43页(含附录) |
| 数据 | 2010-2025年商品/股指/债券/外汇期货日频数据 |
| 主页 | https://arxiv.org/abs/2603.01820 |
相关阅读
- 端到端深度学习跨资产期货择时——AI策略何时优于简单规则 —— Pollok的另一篇跨资产论文,结论更悲观,与本篇形成对照
- 用”拓扑形状”选股:TDA+FinBERT动态组合优化的论文深度解读 —— TDA做特征工程,与本文VSN做特征选择思路相通
- 杠杆下的”波动率损耗”:用神经网络做最小方差组合的论文解读 —— 波动率目标化的互补视角
- 散户常用技术信号”全灭”——三道闸门证伪RSI/MA交叉/K线/成交量/Sell-in-May —— 线性技术指标在A股失效的实证,呼应本文”线性模型不稳定”的结论