📑 本文目录
arXivTransformer股票预测预训练XGBoost论文解读

从指数到个股:预训练Transformer在多伦多交易所的股票收益预测实践


引子

股票预测有一个经典矛盾:个股噪声极大、信噪比极低,而市场指数相对平滑。如果能先在指数上学到”市场的气候模式”,再迁移到个股上做精确预报,会不会比直接学个股更好?

arXiv:2605.23962 这篇论文就做了这件事——用多伦多证券交易所(TSX)指数预训练Transformer,然后微调到TSX个股上做涨跌分类和收益回归。结果很有意思:预训练确实有帮助,但在真实的交易场景中,MSE最低的Transformer模型赚得反而最少,XGBoost才是真正的”赚钱冠军”

核心设计

整体架构

论文的核心思路分三步:

  1. 预训练:用TSX指数历史数据训练Transformer做涨跌二分类(学习市场整体波动模式)
  2. 微调:将预训练权重迁移到个股数据上,进一步微调(适配个股特性)
  3. 交易:每日选出预测收益最高的5只做多、最低的5只做空,次日平仓

数据与特征

  • 数据源:Yahoo Finance(yfinance),1980~2023年共1,853只TSX股票,491万条日记录
  • 特征:15维特征/日,含10日窗口(序列长度10),含intra-day return、EMA(10/12/26)、Stochastic %K、ROC、RSI、AccDO、MACD、Disparity(5/10)、MA(5/10)、10日前收盘价
  • 预处理:Min-Max归一化;异常值裁剪(return>2设为2);去除每只股票首年数据

模型架构

  • Transformer:4层Encoder + 3层全连接(128/64/32, ReLU) + 位置编码
  • LSTM:4层LSTM + 同结构全连接层
  • XGBoost:100棵树,学习率0.03,最大深度9
  • Ensemble:三模型预测值加权平均

关键实验结果

分类任务(涨跌方向预测)

指标Transformer基线Transformer微调LSTM微调XGBoostEnsemble
Test Accuracy66.67%65.72%66.60%62.72%65.94%
Test Precision0.00%33.26%38.40%46.26%34.34%
Test F1 Score0.000.050.010.570.05

核心发现:基线Transformer的66.67%准确率是虚假的——Precision=0说明它只会预测”跌”这一类(类别不平衡)。XGBoost虽然准确率最低但F1最高(0.57),说明它能真正区分涨跌方向。

回归任务(收益数值预测)

模型Test MSE日均收益(多空组合)
Transformer Fine-Tuned5.68e-9+0.03%
LSTM Fine-Tuned5.69e-9+0.02%
XGBoost9.92e-9+0.59%
Ensemble6.15e-9+0.69%

反直觉发现:Transformer和LSTM的MSE最低(回归精度最高),但选出的股票日均收益只有+0.02~0.03%,几乎是噪声水平。而MSE更高的XGBoost日均收益达+0.59%,集成模型更达到+0.69%。

原因:深度学习模型预测值高度集中在零附近(保守),而XGBoost预测值的方差更大,虽然单个预测更可能偏离真实值,但恰好选出了真正有上涨潜力的股票。

预训练效果

设置BCE Loss
Transformer基线(随机初始化)0.6942
Transformer预训练+微调0.6404

预训练使BCE loss降低约8%,证明在指数上学习的知识可以迁移到个股。

与已有策略系统的对比

对比1:本地LSTM-GHMM量化择时

我们之前复现的中邮证券LSTM-GHMM混合模型采用状态空间方法(隐马尔可夫识别市场状态),预测的是市场择时信号而非个股收益。这篇论文的方向相反——它不择时、只选股,通过多空组合获取alpha。

启示:如果能把两篇的方法结合——先用LSTM-GHMM判断市场状态(牛/熊/震荡),再在牛市中用这篇的选股模型选股,或许能同时捕捉择时和选股收益。

对比2:开源日内动量策略

我们复现的开源日内非对称动量策略只在日内交易(开盘信号→尾盘平仓),这篇论文是日频选股(次日开盘→收盘)。时间尺度不同,但都验证了A股/TSX市场都存在短期可预测性。

对比3:本地因子选股流水线

我们的因子选股系统(Amihud、动量、换手率等)是可解释的——知道每笔交易为什么买/卖。这篇的Transformer/XGBoost是黑箱——预测值背后没有经济学解释。在需要向投资者解释持仓逻辑的场景中,因子方法仍有不可替代的优势。

对比4:XGBoost vs 深度学习

这是我们第二次在本地回测中观察到**“简单模型好于复杂模型”**的现象。类似地,在招行五指标择时复现中,逻辑回归的稳健性也优于神经网络。这篇论文从另一个角度验证了:对金融时间序列,深度学习的强大表征能力反而可能成为噪声放大器

工程化落地路径

步骤难度说明
指数预训练⭐⭐需指数历史数据(国内用沪深300/中证500),Transformer训练约2-4小时
个股微调⭐⭐⭐1,853只股票微调,需要GPU加速,本地单卡约8小时
每日推理15维特征计算简单,单日推理<1秒
交易执行⭐⭐每日多空各5只,换手率极高(日均200%),摩擦成本是最大挑战
风险管理⭐⭐⭐⭐论文未考虑风险管理,需自行实现止损/波动率约束

国内适配关键点

  1. 用沪深300/中证500指数替代TSX进行预训练
  2. 数据源用akshare或DuckDB替代yfinance
  3. 特征工程需适配A股特有的涨跌停制度(+10%/-10%限制)
  4. A股T+1制度下,多空组合的”当日开平”不可行,需改为”T日信号→T+1开盘买入→T+2开盘卖出”

局限性分析

  1. 样本量有限:只用了TSX这一个市场,且TSX流动性远不如纽交所/纳斯达克。结论能否推广到美股/A股存疑
  2. 未考虑交易成本:论文的日均收益0.69%是毛利。按单边0.15%算,每日多空各5只(10笔交易),单日成本1.5%,结论立刻从盈利变为亏损
  3. 风险管理缺失:论文明确承认没有做组合风控。多空各5只的集中度风险极高
  4. 时间窗口较老:数据截至2023年7月,未覆盖2024-2026年的大模型/AI行情
  5. 特征过于基础:15个特征全是技术指标,没有引入任何基本面/情绪/宏观经济特征
  6. 回测周期短:测试集仅2023年约11个月,不足以评估策略在不同市场环境下的表现

总结

这篇论文的核心贡献是验证了指数预训练→个股微调的迁移学习范式在股票预测中的可行性。但它也暴露了一个残酷事实:在金融时间序列预测中,模型精度和交易盈利可能是两回事——MSE最低的模型反而赚最少,因为深度学习倾向于输出保守的”均值回归”预测。

对我们构建量化系统而言,这篇论文的实践启示是:不要盲目追求模型复杂度或预测精度,交易信号的信噪比和风险控制才是真正的alpha来源。


论文信息

  • 标题:From Index to Equity: Pre-Training Transformers for Stock Return Prediction
  • 作者:Marie Soehl Coolsaet, Roberto Gallardo, Zhen Gao
  • 机构:McMaster University(加拿大);Universidad Veracruzana(墨西哥)
  • arXiv ID:2605.23962
  • 年份:2026年5月

相关阅读

💬 评论