📑 本文目录
从指数到个股:预训练Transformer在多伦多交易所的股票收益预测实践
引子
股票预测有一个经典矛盾:个股噪声极大、信噪比极低,而市场指数相对平滑。如果能先在指数上学到”市场的气候模式”,再迁移到个股上做精确预报,会不会比直接学个股更好?
arXiv:2605.23962 这篇论文就做了这件事——用多伦多证券交易所(TSX)指数预训练Transformer,然后微调到TSX个股上做涨跌分类和收益回归。结果很有意思:预训练确实有帮助,但在真实的交易场景中,MSE最低的Transformer模型赚得反而最少,XGBoost才是真正的”赚钱冠军”。
核心设计
整体架构
论文的核心思路分三步:
- 预训练:用TSX指数历史数据训练Transformer做涨跌二分类(学习市场整体波动模式)
- 微调:将预训练权重迁移到个股数据上,进一步微调(适配个股特性)
- 交易:每日选出预测收益最高的5只做多、最低的5只做空,次日平仓
数据与特征
- 数据源:Yahoo Finance(yfinance),1980~2023年共1,853只TSX股票,491万条日记录
- 特征:15维特征/日,含10日窗口(序列长度10),含intra-day return、EMA(10/12/26)、Stochastic %K、ROC、RSI、AccDO、MACD、Disparity(5/10)、MA(5/10)、10日前收盘价
- 预处理:Min-Max归一化;异常值裁剪(return>2设为2);去除每只股票首年数据
模型架构
- Transformer:4层Encoder + 3层全连接(128/64/32, ReLU) + 位置编码
- LSTM:4层LSTM + 同结构全连接层
- XGBoost:100棵树,学习率0.03,最大深度9
- Ensemble:三模型预测值加权平均
关键实验结果
分类任务(涨跌方向预测)
| 指标 | Transformer基线 | Transformer微调 | LSTM微调 | XGBoost | Ensemble |
|---|---|---|---|---|---|
| Test Accuracy | 66.67% | 65.72% | 66.60% | 62.72% | 65.94% |
| Test Precision | 0.00% | 33.26% | 38.40% | 46.26% | 34.34% |
| Test F1 Score | 0.00 | 0.05 | 0.01 | 0.57 | 0.05 |
核心发现:基线Transformer的66.67%准确率是虚假的——Precision=0说明它只会预测”跌”这一类(类别不平衡)。XGBoost虽然准确率最低但F1最高(0.57),说明它能真正区分涨跌方向。
回归任务(收益数值预测)
| 模型 | Test MSE | 日均收益(多空组合) |
|---|---|---|
| Transformer Fine-Tuned | 5.68e-9 | +0.03% |
| LSTM Fine-Tuned | 5.69e-9 | +0.02% |
| XGBoost | 9.92e-9 | +0.59% |
| Ensemble | 6.15e-9 | +0.69% |
反直觉发现:Transformer和LSTM的MSE最低(回归精度最高),但选出的股票日均收益只有+0.02~0.03%,几乎是噪声水平。而MSE更高的XGBoost日均收益达+0.59%,集成模型更达到+0.69%。
原因:深度学习模型预测值高度集中在零附近(保守),而XGBoost预测值的方差更大,虽然单个预测更可能偏离真实值,但恰好选出了真正有上涨潜力的股票。
预训练效果
| 设置 | BCE Loss |
|---|---|
| Transformer基线(随机初始化) | 0.6942 |
| Transformer预训练+微调 | 0.6404 |
预训练使BCE loss降低约8%,证明在指数上学习的知识可以迁移到个股。
与已有策略系统的对比
对比1:本地LSTM-GHMM量化择时
我们之前复现的中邮证券LSTM-GHMM混合模型采用状态空间方法(隐马尔可夫识别市场状态),预测的是市场择时信号而非个股收益。这篇论文的方向相反——它不择时、只选股,通过多空组合获取alpha。
启示:如果能把两篇的方法结合——先用LSTM-GHMM判断市场状态(牛/熊/震荡),再在牛市中用这篇的选股模型选股,或许能同时捕捉择时和选股收益。
对比2:开源日内动量策略
我们复现的开源日内非对称动量策略只在日内交易(开盘信号→尾盘平仓),这篇论文是日频选股(次日开盘→收盘)。时间尺度不同,但都验证了A股/TSX市场都存在短期可预测性。
对比3:本地因子选股流水线
我们的因子选股系统(Amihud、动量、换手率等)是可解释的——知道每笔交易为什么买/卖。这篇的Transformer/XGBoost是黑箱——预测值背后没有经济学解释。在需要向投资者解释持仓逻辑的场景中,因子方法仍有不可替代的优势。
对比4:XGBoost vs 深度学习
这是我们第二次在本地回测中观察到**“简单模型好于复杂模型”**的现象。类似地,在招行五指标择时复现中,逻辑回归的稳健性也优于神经网络。这篇论文从另一个角度验证了:对金融时间序列,深度学习的强大表征能力反而可能成为噪声放大器。
工程化落地路径
| 步骤 | 难度 | 说明 |
|---|---|---|
| 指数预训练 | ⭐⭐ | 需指数历史数据(国内用沪深300/中证500),Transformer训练约2-4小时 |
| 个股微调 | ⭐⭐⭐ | 1,853只股票微调,需要GPU加速,本地单卡约8小时 |
| 每日推理 | ⭐ | 15维特征计算简单,单日推理<1秒 |
| 交易执行 | ⭐⭐ | 每日多空各5只,换手率极高(日均200%),摩擦成本是最大挑战 |
| 风险管理 | ⭐⭐⭐⭐ | 论文未考虑风险管理,需自行实现止损/波动率约束 |
国内适配关键点:
- 用沪深300/中证500指数替代TSX进行预训练
- 数据源用akshare或DuckDB替代yfinance
- 特征工程需适配A股特有的涨跌停制度(+10%/-10%限制)
- A股T+1制度下,多空组合的”当日开平”不可行,需改为”T日信号→T+1开盘买入→T+2开盘卖出”
局限性分析
- 样本量有限:只用了TSX这一个市场,且TSX流动性远不如纽交所/纳斯达克。结论能否推广到美股/A股存疑
- 未考虑交易成本:论文的日均收益0.69%是毛利。按单边0.15%算,每日多空各5只(10笔交易),单日成本1.5%,结论立刻从盈利变为亏损
- 风险管理缺失:论文明确承认没有做组合风控。多空各5只的集中度风险极高
- 时间窗口较老:数据截至2023年7月,未覆盖2024-2026年的大模型/AI行情
- 特征过于基础:15个特征全是技术指标,没有引入任何基本面/情绪/宏观经济特征
- 回测周期短:测试集仅2023年约11个月,不足以评估策略在不同市场环境下的表现
总结
这篇论文的核心贡献是验证了指数预训练→个股微调的迁移学习范式在股票预测中的可行性。但它也暴露了一个残酷事实:在金融时间序列预测中,模型精度和交易盈利可能是两回事——MSE最低的模型反而赚最少,因为深度学习倾向于输出保守的”均值回归”预测。
对我们构建量化系统而言,这篇论文的实践启示是:不要盲目追求模型复杂度或预测精度,交易信号的信噪比和风险控制才是真正的alpha来源。
论文信息
- 标题:From Index to Equity: Pre-Training Transformers for Stock Return Prediction
- 作者:Marie Soehl Coolsaet, Roberto Gallardo, Zhen Gao
- 机构:McMaster University(加拿大);Universidad Veracruzana(墨西哥)
- arXiv ID:2605.23962
- 年份:2026年5月
相关阅读
- LSTM-GHMM混合量化择时策略复现 — 我们此前复现的隐马尔可夫+深度学习择时模型
- 开源日内非对称动量策略复现 — 日内高频策略的回测与分析
- 招行五指标择时策略复现 — 简单逻辑回归带来的稳健超额