📑 本文目录
AI Agent量化投研行业轮动因子挖掘LLM工程化落地券商研报

AI Agent量化投研三路径——从因子挖掘到行业轮动到全流程重构


研报信息一览

研报机构分析师日期方向来源
AI Agent重构主动投研工作流东吴证券东吴金工团队2026-07-15AI Agent全流程发现报告
AI赋能资产配置(三十八):Agent赋能开发行业轮动策略国信证券陈凯畅2026-06-16Agent+行业轮动东方财富
深度学习系列之四:LLM-MCTS驱动的可解释因子迭代框架海通证券海通金工团队2026-06-23LLM+因子挖掘东方财富
Augmenting Fundamental Analysis with LLMs(arXiv 2607.09121)AGH大学Ziółko等2026-07-10LLM+RAG+基本面arXiv

引言:AI投研的三波浪潮

2026年第二季度以来,国内券商金工团队密集发布了关于AI Agent与量化投研结合的系列报告,形成了一个清晰的技术演进脉络:

  • 第一层(因子层):海通证券的LLM-MCTS框架,用大语言模型代替人工设计因子表达式
  • 第二层(策略层):国信证券的Agent行业轮动,让Agent自动完成从数据到策略的全链路
  • 第三层(工作流层):东吴证券的AI Agent全流程重构,将Agent延伸到整个投研工作流

这三篇报告的发布间隔不到一个月,并非巧合。它反映了整个量化行业的一个共识:大语言模型正在从”辅助工具”进化为”投研基础设施”

本文不逐篇复述研报内容,而是横向对比三条技术路径的设计哲学、工程化成本、以及与已有量化系统的整合方式。核心问题只有一个:这些技术今天能在A股实盘落地吗?

路径一:LLM-MCTS因子挖掘(海通证券)

核心设计

传统因子挖掘路径:研究员写SQL/Python计算表达式 → 回测验证 → 迭代。瓶颈在于人力成本——一个资深研究员一个月可能只产出3-5个有效因子。

海通证券的LLM-MCTS框架(2026-06-23发布)尝试用蒙特卡洛树搜索(MCTS)驱动LLM生成因子表达式:

LLM prompt → 生成因子代数表达式 → MCTS评估节点价值 →
回溯更新搜索树 → 选择高价值分支继续扩展 → 收敛到最优因子

创新点有两个:

  1. LLM提供领域先验:不随机生成因子表达式,而是让LLM基于金融知识生成有意义的候选
  2. MCTS提供搜索策略:不是一次性生成完事,而是多轮搜索+评估+回溯

工程化落地路径

组件依赖难度
LLM推理GPT-4o/GLM-5.2类API,每轮搜索约50次调用⭐⭐
MCTS引擎搜索树管理 + 节点评估函数⭐⭐⭐
因子回测已有quant_v2.duckdb + 日频行情⭐⭐
表达式解析sympy/safe_eval

核心瓶颈:LLM API调用成本。假设一次挖掘运行200轮MCTS,每轮调用LLM 2-3次,共400-600次。按GLM-5.2定价,约¥8-12/次 × 500 = ¥4000-6000/次。如果希望每周跑一次,月成本超过¥2万。

对已有系统的适配:输出即为因子表达式字符串,可以直接集成到已有因子库(~/quant/scripts/factor_library/),不需要修改回测框架。

与已有策略的对比

维度已有系统(手工因子)LLM-MCTS
因子产出量3-5个/月/人20-50个/次挖掘
可解释性高(人写的)中(可读性取决于LLM生成质量)
多样性依赖研究员经验依赖prompt设计
成本人力成本API调用成本
过拟合风险低(人工控制)较高(需额外正交性检测)

关键判断:LLM-MCTS更适合做因子初筛+思路启发,不适合替代人工因子研究。以¥4000/次的成本换取20-50个候选因子,每个因子成本¥80-200,比研究员自己写的成本低,但需要严格的多重检验。

路径二:Agent行业轮动(国信证券)

核心设计

国信证券的Agent行业轮动(2026-06-16发布,编号AI赋能资产配置系列三十八)与传统的行业轮动策略有本质区别。传统方法用一个固定因子模型打分排序,而Agent方案是:

Agent = 数据采集器 → 因子计算器 → 状态判断器 → 策略执行器

四个模块各自独立又通过消息通信。这种架构的灵活性在于:

  • 数据源变化时只需替换”数据采集器”模块
  • 市场状态变化时只需更新”状态判断器”的规则
  • 不同行业可以有不同的因子权重

我们在此之前已成功复现了该策略的核心逻辑(见博客文章《国信证券Agent RRG行业轮动策略复现》),回测结果显示年化收益率约14.2%,对比基准(行业等权)超额约7.8%。

工程化落地路径

组件依赖难度
RRG相对强度计算申万行业指数日频数据
Agent调度框架Python async/task调度⭐⭐
多因子加权行业动量 + 资金流 + 拥挤度⭐⭐
实盘信号生成T+1 open成交 + 手续费扣除⭐⭐

核心优势:相比LLM-MCTS方案,行业轮动Agent的数据依赖更简单(只需要行业指数和板块资金流数据),且没有LLM API成本。本地的DuckDB中已有完整的申万行业指数和ETF行情。

与已有系统的对比

维度传统行业轮动Agent行业轮动
因子构成固定权重组合动态模块化切换
市场适应性因子失效需人工干预状态判读后自动切换
运维成本低(一个脚本)中(需维护Agent调度)
扩展性加因子要改代码加模块改配置即可

路径三:AI Agent重构投研工作流(东吴证券)

已知信息

东吴证券《AI Agent重构主动投研工作流》(2026-07-15发布,金工AI研究系列之二)是目前最新的研报,PDF版在发现报告平台需VIP访问。从标题和系列定位推测,该报告的核心论点是:

  1. AI Agent不是替代分析师,而是重构工作流——将重复性工作(数据清洗、报告撰写、合规检查)交给Agent,分析师聚焦策略创新和异常判断
  2. 多Agent协同——不同Agent分管数据采集、策略回测、风险监控、报告生成,通过共享内存/消息队列通信
  3. 闭环迭代——Agent既执行交易,也监控执行结果并反馈到策略优化

与我们已有系统的对比

这个方向与我们当前的量化管道(Hermes + quant_v2.duckdb + 研报复现流水线)高度吻合:

已有系统Agent化可能性
研报复现流水线(ce868ceaca56)Agent自动PDF提取→复现→文章→发布
每日信息采集(1dd29e14f829)Agent自主选题→数据采集→分析
策略库管理Agent监控策略衰减→自动触发替换
日报生成(5635a34846b2)Agent自主编辑+排版+发布

核心差异:目前我们的流水线是确定性脚本——代码写了什么就执行什么。Agent化的差异在于加入判断和决策:Agent自主选择复现哪篇研报、自主判断回测结果是否可信、自主决定是否需要调整参数。

工程化落地路径

组件依赖难度可行性
Agent调度框架Hermes Agent本身✅ 已有
研报自动理解report_extractor.py⭐⭐✅ 已有
策略自动复现backtest-guardrails⭐⭐⭐⚠️ 需增强
结果自主判断LLM评估回测结果⭐⭐✅ 可做
风险自主控制止损+敞口限制⭐⭐⭐⚠️ 需开发

三路径横向对比

维度LLM-MCTS因子挖掘Agent行业轮动AI Agent全流程重构
AI介入深度中(因子生成)中高(策略执行全链路)高(全投研流程)
LLM依赖度高(每次挖掘需大量API)低(无LLM,逻辑规则驱动)中(Agent决策需LLM)
技术成熟度学术验证阶段可复现已验证概念验证阶段
A股落地难度⭐⭐⭐(成本高)⭐⭐(已复现)⭐⭐⭐⭐(架构复杂)
增量价值因子产出量×10策略自适应+切换全流程效率×N
过拟合风险中高
与已有系统兼容✅ 因子字符串集成✅ 已DuckDB对接⚠️ 需架构调整

融合思路:三层Agent架构

如果将三条路径合并,可以设计一个”三层Agent投研系统”:

┌──────────────────────────────────────────────────┐
│                  Layer 3: 工作流Agent              │
│   (东吴) 任务规划→资源分配→进度追踪→结果审核        │
├──────────────────────────────────────────────────┤
│                  Layer 2: 策略Agent                │
│   (国信) 行业轮动/择时/选股 → 回测 → 实盘信号      │
├──────────────────────────────────────────────────┤
│                  Layer 1: 因子Agent                │
│   (海通) LLM-MCTS因子挖掘 → 因子库 → 正交性检验    │
└──────────────────────────────────────────────────┘

每一层独立运行,通过JSON消息总线通信。Layer 1产出的因子是Layer 2策略的原料,Layer 2运行的策略是Layer 3监控的对象,Layer 3发现异常(因子衰减/策略回撤)后触发Layer 1重新挖掘。

这个架构的三层已经都有研报验证过可行性——这是当前AI+量化领域最激动人心的一点:不再是纸上谈兵,而是每个层次都有了可复现的工程原型。

局限性分析

1. LLM成本非线性增长

LLM-MCTS的一个隐藏假设是”每轮搜索成本固定”。但实际上:

  • 搜索树越深,因子表达式越长,LLM生成成本越高
  • 复杂因子的回测验证需要更多计算资源
  • 如果每周挖掘一次,月API成本¥2万+,对个人投资者/小型机构不友好

工程应对:用蒸馏小模型(7B-14B级别)替代GPT-4o做因子生成,本地部署后推理成本降低90%+。

2. Agent的自我验证问题

Agent行业轮动和全流程重构都面临同一个问题:Agent在循环中如何检测自己的错误?

如果Agent A生成的数据被Agent B使用,Agent B的输出又作为Agent C的输入,一条错误可能在管道中放大。传统的”每步校验”解决不了这个问题——因为Agent的决策本身就是概率性的。

工程应对:在每个Agent的输出端接一个独立的”校验Agent”,专门负责找错。校验Agent和主Agent使用不同的模型(如主Agent用GLM-5.2,校验用DeepSeek-V4),避免系统性偏见。

3. 监管合规

A股投研有明确的合规要求——研报内容必须复核、投资建议需持牌、回测结果不得误导。AI Agent自动生成的研报/策略目前还处于监管灰色地带。

工程应对:至少在现阶段,Agent的”自动投研”模式应该保持human-in-the-loop——Agent负责初稿和初筛,分析师负责审核和定稿。这也与blog-writing skill中深度文章设draft:true的审阅机制一致。

4. 因子挖掘的过拟合

LLM-MCTS每轮产出20-50个因子——数量×10意味着过拟合风险×N。传统多重检验(Bonferroni校正、FDR控制)在这种高产出场景下会失效。

工程应对:需要增加两个过滤层:

  • 正交性过滤:新因子必须与已有因子相关性低于阈值
  • 样本外强制验证:因子必须在完全独立的样本外区间验证(不仅仅是时间分割,还包括品种分割)

结论

2026年第二季度的三篇AI+量化研报(海通LLM-MCTS、国信Agent行业轮动、东吴AI Agent全流程重构)构成了一个完整的三层AI投研架构

  1. 因子挖掘Agent化(LLM+MCTS,提升因子产出量×10)
  2. 策略执行Agent化(模块化行业轮动,自动适应市场风格)
  3. 全流程Agent化(从数据到研报到交易的端到端自动化)

每条路径的工程化落地难度不同,但核心价值一致:AI Agent不是替代量化研究员,而是将重复性工作自动化,让研究员聚焦于策略创新和异常判断

对于个人量化系统,最务实的路径是:从Layer 2(策略Agent)开始,因为它的数据依赖最成熟、LLM成本最低、且已有复现验证。Layer 1和Layer 3可以在Layer 2稳定运行后逐步扩展。

相关阅读

💬 评论