📑 本文目录
因子挖掘LLMMCTSAlpha-GPTAI因子海通证券

从"人工写因子"到"AI写因子":LLM-MCTS驱动的可解释因子迭代框架解读


研报信息

项目内容
标题基于人机互动和大语言模型的因子挖掘平台——AI前沿跟踪系列(一)
机构海通证券
分析师陈冀
报告类型金工专题·深度学习系列之四
核心论文Alpha-GPT (Saizhuo Wang, Hang Yuan et al.)
日期2023-09-18(研报)/ 2026-06-23(入库)

核心问题

传统因子挖掘面临三个根本性困境:

  1. 因子效果衰减加速 — 现代金融体系信息传播速度极快,一个有效的Alpha因子在被发现后迅速被市场套利,生命周期从过去的几个月缩短到几周甚至几天
  2. 人工探索效率瓶颈 — 研究员每天能手工测试的因子组合极其有限,且容易陷入思维定式
  3. 因子可解释性缺失 — 自动因子挖掘(遗传规划、神经网络等)虽然能找到高收益因子,但”黑箱”表达式难以被研究员理解和信任

海通这篇报告介绍的Alpha-GPT框架,试图用大语言模型作为人机交互的中介层,同时解决以上三个问题。

核心设计:三段式架构

Alpha-GPT框架的核心创新不在于某个具体的因子公式,而在于重新定义了人与因子挖掘系统的协作关系

传统范式的演进

范式描述代表局限
第一代研究员手工写因子传统量化研究效率极低
第二代算法自动搜索因子遗传规划、GP因子不可解释
第三代人机交互式因子挖掘Alpha-GPT依赖LLM能力

Alpha-GPT 三层架构

研究员(自然语言) 
     ↓ 交易想法/投资假设
┌─────────────────────────────────┐
│       AlphaBot (LLM中介层)        │
│  1. 意图解析 → 2. 知识增强 →      │
│  3. 配置生成 → 4. 结果解释        │
└─────────────────────────────────┘
     ↓ 算法配置参数
┌─────────────────────────────────┐
│     Alpha 挖掘算法层              │
│  MCTS / 遗传规划 / 强化学习       │
└─────────────────────────────────┘
     ↓ 候选因子表达式
┌─────────────────────────────────┐
│     Alpha 计算引擎                │
│  高性能因子计算 + 回测验证        │
└─────────────────────────────────┘

AlphaBot 四大功能模块

  1. 意图解析 — 接收研究员的自然语言描述(如”我想找一个捕捉短期反转的因子”),拆解为结构化查询
  2. 知识增强 — 补充领域特定知识:历史同类因子的表现、学术文献中的相关研究、当前市场环境特征
  3. 配置生成 — 将增强后的查询翻译为因子搜索算法的参数配置(搜索空间、约束条件、目标函数)
  4. 结果解释 — 对算法输出的因子表达式生成自然语言解释,让研究员理解”为什么这个因子有效”

LLM-MCTS:可解释因子搜索的核心技术

报告的核心技术亮点是LLM与MCTS(蒙特卡洛树搜索)的结合

  • MCTS作为搜索框架:在因子表达式的组合空间中做树搜索,平衡探索与利用
  • LLM作为搜索指导:在每个搜索节点,LLM评估当前部分表达式的合理性,剪枝无效分支,聚焦有前景的方向
  • 可解释性保证:LLM为每次搜索决策生成自然语言理由,使得最终的因子表达式附带完整的”推导过程”

这与传统的遗传规划因子挖掘有本质区别:

  • 遗传规划:随机变异+交叉 → 黑箱进化 → 难以理解
  • LLM-MCTS:语义指导+结构化搜索 → 带解释的因子 → 可信任

与已有复现策略的对比

目前已复现的因子/策略与本框架的对比:

已有复现因子来源与Alpha-GPT的关系
国信AI行业轮动Agent驱动行业配置可视为Alpha-GPT在行业轮动场景的特例应用
开源日内动量指数非对称性因子手工发现的因子,Alpha-GPT可自动发现同类因子
海通Amihud因子经典非流动性因子Alpha-GPT可在此基础扩展出更复杂的流动性因子组合

核心差异:已有复现的因子都是”静态”的——发现一个因子,回测验证,然后固定使用。Alpha-GPT的范式是”动态”的——因子需要持续被评估和迭代,LLM作为”因子医生”诊断每个因子的健康状况,在失效前启动新一代因子搜索。

工程化落地路径

要在本地量化系统中落地Alpha-GPT(或类似框架),需要以下技术栈:

组件难度可选方案
LLM后端⭐⭐DeepSeek API / 本地部署GLM
MCTS引擎⭐⭐⭐自研或修改开源实现
因子计算引擎⭐⭐⭐⭐复用现有因子计算流水线
回测验证模块⭐⭐复用现有回测框架

落地优先级建议

  1. 第一步(1-2周):用LLM API搭建”因子解释器”——输入现有因子公式,输出自然语言解释
  2. 第二步(2-4周):搭建人机交互界面——研究员用自然语言描述因子想法,LLM生成候选因子公式
  3. 第三步(1-2月):集成MCTS搜索——自动化因子发现和迭代

局限性分析

  1. LLM幻觉风险 — LLM在因子解释中可能生成看似合理但实际错误的分析,需要人工交叉验证
  2. 计算成本高 — MCTS在因子组合空间的搜索需要大量LLM调用,API成本不可忽视;本地部署又需要足够的算力
  3. 因子同质化 — 如果多个机构都使用类似的LLM+搜索框架,找出的因子可能趋同,Alpha衰减更快
  4. 研报本质 — 这篇报告是2023年的论文解读(2026年入库),并非全新研究。Alpha-GPT论文自2023年发布以来,其核心思路已被多家机构采纳,当前落地时需考虑已有进展

实践启示

对我们而言,Hermes Agent本身就是一个LLM驱动的自动化系统,Alpha-GPT框架的”LLM作为中介层”思路与Hermes的”技能驱动”范式异曲同工:

  • Hermes有report_fetcher扫描研报 → 相当于Alpha-GPT的”信息采集”
  • Hermes用LLM执行回测复现 → 相当于Alpha-GPT的”自动因子验证”
  • Hermes用blog-writing产出文章 → 相当于Alpha-GPT的”结果解释”

下一步可探索:将Hermes的技能系统与Alpha-GPT的因子搜索结合——用Hermes的技能链来自动化因子发现、回测、归档的完整流程,把”因子研究”本身做成一个可重复执行的Hermes技能。

总结

Alpha-GPT框架代表了一种**从”人工写因子”到”AI辅助写因子”**的范式转换。它不追求完全替代人类研究员,而是用LLM作为”翻译器”和”加速器”,让研究员把精力集中在更高层的投资假设上,把繁琐的因子搜索和解释工作交给AI。在当前因子衰减加速的环境下,这种动态、持续进化的因子研究模式可能是未来的方向。

相关阅读

💬 评论