📑 本文目录
因子挖掘方法论的三大进化路径:算子化因子 vs GAN_GRU vs LLM-MCTS
引言
因子挖掘是量化投资的”军火工业”——谁拥有更高效的因子发现管道,谁就能在Alpha衰减加速的市场中持续获利。2026年7月,三条因子挖掘路径同时进入视野:
- 长江金工 — 算子化因子体系:从成交匹配波动率出发,系统化构建低波类因子
- 西南证券 — GAN_GRU深度因子:生成对抗网络+GRU时序编码,2019-2026年IC均值0.1045
- 海通证券 — LLM-MCTS可解释因子框架:大语言模型驱动Alpha探索,MCTS实现因子表达式搜索
三条路径代表了因子挖掘的三个不同演进方向:工程化提效、深度学习自动化、大语言模型赋能。本文从量化实践者的视角,逐一拆解三者的核心设计、工程代价和适用场景,并探讨它们与用户已有量化基础设施的整合可能性。
一、长江金工:算子化因子体系的工程化突围
1.1 核心逻辑
长江金工在2026年7月8日的内资闭门会上首次展示了其”算子化因子体系”。核心思想是:将因子构建过程拆解为可组合、可复用的原子算子,每个算子完成一个独立的数学或统计变换,通过算子的排列组合快速生成因子族。
首秀因子为成交匹配波动因子,其构建逻辑:
基于个股每笔成交额与各时段成交量占全天比例,计算回归残差的波动率
这个因子本质上属于”量的低波”类因子:
- 偏小盘属性(小盘股成交模式不规整→残差波动大)
- 与传统低波因子相关性低(从成交结构角度而非价格角度定义低波)
- 可在已有低波因子组合中提供增量信息
1.2 工程化特征
算子化体系的最大价值不在某个因子本身,而在可组合性:
| 特性 | 说明 |
|---|---|
| 原子算子 | 排序、标准化、回归、残差、滚动波动率等基础操作 |
| 组合规则 | 算子通过DAG(有向无环图)组合,自动并行计算 |
| 因子衍生 | 替换算子组合快速衍生新因子(如将波动率改为偏度) |
| 可解释性 | 每个因子可回溯到其算子链,定位Alpha来源 |
1.3 对已有系统的借鉴意义
用户已有的因子挖掘引擎(quant-factor-mining-engine)采用的是遗传规划表达式搜索。算子化体系提供了一个互补思路:将因子设计从”黑盒搜索”转向”白盒组合”。对于已知有效的因子类型(动量、低波、价值、质量),算子化体系可以更高效地生成变体,而不需要重新启动遗传规划搜索。
二、西南证券 GAN_GRU:深度学习因子自动化的持续验证
2.1 核心设计
西南证券的GAN_GRU因子最早发布于2024年7月的报告《量价时序特征挖掘模型在深度学习因子中的应用》,2026年7月的月报是其定期跟踪更新。
模型架构:
量价特征(18维) → LSTM生成器 → CNN判别器 ← [GAN对抗训练]
↓
提取特征 → GRU时序编码 → 因子值
- 输入:收盘价、开盘价、成交量、换手率等18个量价特征
- 训练窗口:过去400个交易日
- 预测目标:未来20个交易日累计收益
- 调仓频率:月度
- 选股范围:全A股
2.2 实绩数据
| 指标 | 数值 |
|---|---|
| 回测区间 | 2019.02 ~ 2026.06(约7.5年) |
| IC均值 | 0.1045***(statistically significant) |
| 年化超额收益率 | 17.75% |
| 近一年IC均值 | 0.0370***(Alpha有所衰减) |
| 近期IC | -0.0499***(阶段性失效) |
| 表现突出行业 | 传媒、钢铁、电力及公用事业 |
2.3 关键观察:Alpha衰减与阶段性失效
最值得关注的是近一年IC均值从0.1045降到0.0370,且近期IC已转为负值(-0.0499)。这验证了深度学习因子在A股市场的两个典型特征:
- 超额收益随发布后时间衰减:因子公开后,市场参与者开始逆向工程和套利,Alpha被快速吞噬
- 过拟合的滞后暴露:2019-2023年的训练窗口学到的是”大熊市后反弹”模式,而2025-2026年市场结构已变
这与用户已有博客文章《LLM Agentic Trading: 77篇论文审计》(llm-agentic-trading-77-paper-audit-2026) 中观察到的”公开论文因子复现后超额衰减”现象完全一致。
2.4 复现可行性
GAN_GRU因子的可复现性中等:
- ✅ 18维量价特征在DuckDB中均可构造
- ✅ 训练/推理流程相对标准(Python + PyTorch即可)
- ❌ GAN训练不稳定,超参数调优成本高
- ❌ 7.5年数据全量训练需要GPU加速
更务实的路径是:忽略GAN对抗训练,直接用GRU时序编码,简化后的单GRU模型在Alpha质量上可能损失5-10%,但工程复杂度下降一个数量级。
三、海通证券 LLM-MCTS:从人工写因子到AI写因子
3.1 背景
海通证券发布的《深度学习系列之四:从人工写因子到AI写因子——LLM-MCTS驱动的可解释因子迭代框架》是对前沿学术论文(Saizhuo Wang, Hang Yuan等)的深度评述。核心论文中的Alpha-GPT系统代表了因子挖掘的第三代范式:
| 阶段 | 范式 | 特征 |
|---|---|---|
| 第一代 | 人工推导 | 依赖研究员经验,效率低,可解释性强 |
| 第二代 | 遗传规划/自动搜索 | 效率高,因子可解释性差,易过拟合 |
| 第三代 | LLM人机交互 | LLM理解交易想法→生成因子表达式→MCTS迭代优化 |
3.2 架构拆解
Alpha-GPT的核心是一套人机协作管道:
用户交易想法(自然语言)
↓
AlphaBot层(四个功能模块)
├── Intent Parser:将自然语言转为结构化查询
├── Domain Knowledge Injection:注入金融先验知识
├── Expression Generator:生成候选因子表达式
└── Iteration Optimizer:根据反馈迭代修改
↓
Alpha挖掘算法层(MCTS + 回测)
└── MCTS节点=因子表达式,路径=迭代优化轨迹
↓
可解释因子(表达式+自然语言解释)
与用户已有的遗传规划因子引擎(quant-factor-mining-engine)相比,LLM-MCTS方案的最大优势是:
- 可解释性:LLM对每个生成的因子提供自然语言解释
- 先验注入:研究员可以输入”寻找低波动但高ROE的因子”这类语义约束
- 搜索效率:MCTS的导向性高于纯随机遗传规划
3.3 工程化挑战
| 挑战 | 影响 | 缓解方案 |
|---|---|---|
| LLM API调用成本 | 每轮迭代需多次调用,成本随搜索深度线性增长 | 用本地小模型(GLM-5.2/DeepSeek-R1)替代GPT-4 |
| MCTS搜索空间爆炸 | 因子表达式组合数天文数字 | 限制表达式深度≤5层,预置算子池 |
| 回测频率成瓶颈 | 每生成一个候选因子需全量回测 | 用快速代理评估(如单因子IC替代全组合回测) |
四、三条路径的横向对比
4.1 技术路线对比
| 维度 | 长江算子化因子 | 西南GAN_GRU | 海通LLM-MCTS |
|---|---|---|---|
| 技术核心 | 算子化组合 | GAN+GRU深度学习 | LLM+MCTS搜索 |
| 数据依赖 | 逐笔成交/分钟线 | 18维日线量价 | 任意结构化+文本数据 |
| Alpha可解释性 | ⭐⭐⭐⭐(算子链回溯) | ⭐⭐(黑盒CNN+GRU) | ⭐⭐⭐⭐⭐(自然语言解释) |
| 工程复杂度 | ⭐⭐ | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐ |
| GPU需求 | 无 | 高(GAN训练) | 中(LLM推理) |
| 因子新颖性 | ⭐⭐⭐(组合旧因子) | ⭐⭐⭐⭐(深度学习挖掘) | ⭐⭐⭐⭐⭐(语义驱动搜索) |
| 维护成本 | 低 | 高(需定期重训练) | 中(API成本+搜索管理) |
4.2 Alpha生成效率对比(估算)
| 方法 | 单因子生成时间 | 10因子候选池周期 | 有效因子占比 |
|---|---|---|---|
| 人工推导 | 2-5天 | 2-3周 | ~30% |
| 遗传规划 | 2-4小时 | 1天 | ~15% |
| 算子化组合 | 10-30分钟 | 2小时 | ~20% |
| GAN_GRU | 6-12小时(训练) | 1-2天 | ~25% |
| LLM-MCTS | 1-3小时 | 0.5-1天 | ~35% |
估算基于公开报告数据推断,实际因实现质量差异较大。算子化组合在”时间效率”上明显占优,而LLM-MCTS在”有效因子占比”上有优势。
五、与已有系统的整合路径
5.1 算子化体系 ➡ 因子引擎补充
用户已有的遗传规划因子引擎可以吸纳算子化体系作为前置筛选:
- 用算子化体系快速生成候选因子池(100+个)
- 用遗传规划在候选池中搜索最优组合
- 二者形成”广度搜索+深度优化”双层结构
5.2 GAN_GRU ➡ 深度学习因子模块
建议简化为 纯GRU时序编码模型(去掉GAN对抗训练):
- 独立开发成本约2-3天
- 预测效果约为原版的80-90%
- 可在用户已有CPU环境中运行(3000只股票×400天×18维≈216MB数据)
5.3 LLM-MCTS ➡ 新一代因子挖掘管道
如果在用户已有的 quant_v2.duckdb 上搭建 LLM-MCTS 管道:
- 成本:DeepSeek API调用约5-10元/搜索轮次
- 与已有
quant-factor-mining-engine共享因子计算基础设施 - 最大增量价值:因子可解释性的提升——研究员不再需要从表达式反推逻辑
六、局限性分析
6.1 来自研报自身的局限
| 研报 | 已承认局限 | 实践者视角的额外思考 |
|---|---|---|
| 长江算子化因子体系 | (首次亮相,局限待观察) | 算子化体系的有效性高度依赖算子设计的完备性;缺失关键算子则整个体系失效 |
| 西南GAN_GRU | 近期IC已转负 | 深度学习因子的”大起大落”特性——IC高时神话,IC低时废纸。2019-2025的高IC可能包含过拟合成分 |
| 海通LLM-MCTS | 基于学术论文评述,非自有研究 | LLM对金融领域先验知识的掌握程度决定因子质量上限;MCTS搜索空间管理仍需人工介入 |
6.2 通用局限
- 三条路径均依赖历史数据,在A股市场制度变迁(注册制、T+0讨论)时都会遇到分布外(OOD)问题
- 因子的公开化=Alpha的死亡:三条路径的因子一旦被市场广泛使用,超额收益将显著衰减
- 没有免费午餐:算子化节省了时间但牺牲了新颖性;深度学习突破了人均限制但引入了黑盒风险;LLM提高了可解释性但增加了成本
七、总结
2026年7月,因子挖掘方法论走到了一个十字路口:
- 长江算子化体系代表”工程化提效”路线——不找新矿,而是更高效地开采已知矿脉
- 西南GAN_GRU代表”深度学习自动化”路线的巅峰与困境——IC均值0.1045曾是奇迹,近一年IC 0.0370是现实
- 海通LLM-MCTS代表”大语言模型赋能”路线——因子可解释性可能是下一代因子挖掘的核心突破点
对于用户已有的量化基础设施,最务实的路径是分步整合:
- 近期:引入算子化体系,提升已有因子引擎的候选因子生成效率
- 中期:搭建简化版GRU时序编码模型,补充深度学习因子维度
- 长期:评估LLM-MCTS管道的成本效益比,重点利用其因子解释能力而非搜索能力
这三条路径不是互斥的,而是对应了因子挖掘三个不同层面的需求:效率、自动化、可解释性。
数据来源
| 来源 | 机构 | 日期 | 类型 |
|---|---|---|---|
| 成交匹配波动因子与算子化因子体系 | 长江证券金工团队 | 2026-07-08 | 内资闭门会 |
| 机器学习因子选股月报(2026年7月) | 西南证券 | 2026-07 | 月度跟踪报告 |
| 深度学习系列之四:从人工写因子到AI写因子 | 海通证券(浙商分析师陈冀) | 2023-09-18 / 2026-06-23收录 | AI前沿跟踪系列 |
| Alpha-GPT / AlphaBot(原始论文) | Saizhuo Wang, Hang Yuan 等 | 2024-2025 | 学术论文 |