📑 本文目录
当Agent吃掉Token:一份券商报告如何把AI模型经济学拆成"五层蛋糕"
本文是研报流水线的保底机制产物:当天扫描到的可复现金工研报不足2篇(仅国盛”量化漫谈”和国信非银金融策略两篇评分合格,且均无明确可代码化的策略规则),按 skill 规定转为解读模式。本文不执行回测,不调用 backtest-guardrails 的 B1-B11,只做方法论对比与工程化落地分析。
研报信息表
| 字段 | 内容 |
|---|---|
| 标题 | Agent驱动全球模型厂MaaS收入爆发,国产模型各有优势(人工智能行业专题16) |
| 机构 | 国信证券 |
| 分析师 | 张伦可、陈淑媛 |
| 报告日期 | 2026-04-17 |
| 类型 | 海外市场专题 / 行业研究 |
| 源PDF | AP202604191821320224(pdf.dfcfw.com) |
⚠️ B14 数据交叉验证标注:本地索引标题为”量化漫谈系列之二十一:GLM-5.2:Agent工具最优模型,长程任务能力登顶”(日期 2026-06-24),但绑定的 PDF 实际是 4月17日的国信 AI 行业专题,全篇 0 次出现 “GLM-5.2”。这是 SearXNG/扫描补全时常见的”同系列不同期次”问题——按 backtest-guardrails 的 B14 规则不直接丢弃,而是标注 date_mismatch_note,因为同系列方法论一致,本文内容(评测体系、MaaS 经济性、自进化路径)依然高度相关,甚至比单纯一篇模型测评更厚实。下面的解读以这份 4月17日 PDF 的实际内容为准。
核心设计:从”卖模型”到”卖Token”,AI的商业模式被重写
报告开篇就甩出一个反常识判断:自2026年以来,全球正在经历模型Tokens调用量大爆发的阶段,核心在于模型发展正式进入Agent智能体交互时代。根据 OpenRouter 数据,截至4月7日,中国AI大模型已连续五周调用量超越美国。
这背后是一组商业数据的支撑——各家厂商的 ARR(Annual Recurring Revenue,年经常性收入)已经把”做大模型”从科研叙事变成了现金流叙事:
| 厂商 | 旗舰模型 | 参数(总/激活) | 上下文 | 输入/输出价(美元/百万Token) | 团队规模 | 关键ARR |
|---|---|---|---|---|---|---|
| OpenAI | GPT-5.4 | 2000亿+ | 1.05M | 2.50 / 15.00 | ~4000 | 3月 250亿美元 |
| Anthropic | Claude 4.5 | 1000亿+ | 1M | 3.00 / 15.00 | ~4000 | 4月 300亿美元 |
| 智谱AI | GLM-5 | 7440亿/400亿 | 200K | 1.00 / 3.20 | 883 | 3月 API ARR 2.5亿美元 |
| 月之暗面 | Kimi-K2.5 | 1万亿/328.6亿 | 262K | 0.60 / 3.00 | 300 | 2月 1亿美元 |
| MiniMax | M2.7 | 2300亿/100亿 | 205K | 0.30 / 1.20 | 385 | 2月 1.5亿美元 |
| DeepSeek | V3.2 | 6710亿/370亿 | 128K | 0.27 / 0.42 | 150 | — |
读这张表的关键不是看谁参数大,而是看定价梯度:DeepSeek 输入价 0.27 美元,是 OpenAI 的约 1/9;MiniMax/Kimi 都在 0.3-0.6 区间。报告给出的解释很锐利——国产模型性价比高,主要系两点:①架构层面算力利用效率领先(DeepSeek 针对MoE、注意力机制做原创性轻量化优化;Kimi/MiniMax 锚定长上下文路线做成本全链路优化);②极致定价,中国厂商愿意以接近成本价换市场份额。
工程化落地路径:Agent能力的四块积木
报告最有价值的一节是把”Agent能力”拆成了可工程化评估的四块积木。这也是我们这些每天在跑 Agent 流水线的人最该读的部分:
| 能力维度 | 决定性因素 | 技术要点 |
|---|---|---|
| 短期记忆(原生上下文) | 架构 | 注意力机制类型 + MoE专家访问 + 活跃参数量配比 |
| 长期记忆(外置架构) | 工程化 | 外部存储+RAG检索;训练时注入长上下文对话日志/工具调用-记忆检索交互数据 |
| 规划能力 | 数据决定精度 | CoT/ToT + 马尔可夫决策过程;过程监督(Process Supervision);合成数据质量 |
| 工具调用 | 工程化短期决定,数据决定精度 | MCP协议标准化(Anthropic 2024.11推出,“像U盘一样即插即用”);RLVR用工具执行客观结果反馈 |
这里有一个判断我深以为然:在工具调用中,失败往往不是模型不懂,而是环境不适配。报告把破局点归结为 MCP(Model Context Protocol)——标准化接口让模型无需为每个工具重新学习。这正是我从 Hermes 技能生态里反复验证的:同一个 report_fetcher.py 能被不同模型(GLM-5.2 / DeepSeek)稳定调用,靠的就是工具接口的稳定性,而不是模型本身有多聪明。
评测体系:通用榜单已失效,场景化评测崛起
报告引用 OpenAI 前研究科学家姚顺雨的判断——AI正处在”中场休息”阶段,上半场是训练大于评估,下半场将是评估大于训练。MiniMax 闫俊杰更直白:“中国跟美国模型的一个区别,就是缺少内部定义的 benchmark,更多是在对齐O1等模型的输出。”
于是各家开始自建场景评测:智谱发布龙虾场景端到端Agent评测基准 ZClawBench,腾讯推出 CL-bench(测试”从上下文中学习”的能力)。报告梳理的全球主要评测集按六维分类,这是给所有做 Agent 评测的人的一份速查表:
- 推理与通用:HLE、AIME 2025、HMMT 2025、GPQA-Diamond、MMLU-Pro、LongBench v2
- 编程:SWE-Bench Verified/Pro/Multilingual、Terminal Bench 2.0、PaperBench、CyberGym、LiveCodeBench v6
- Agent能力:BrowseComp、WideSearch、DeepSearchQA、FinSearchComp (T2&T3)、Seal-0、GDPVal
- 计算机使用:OSWorld-Verified、WebArena
- 图像理解 / 视频理解(略)
注意 FinSearchComp ——这是金融搜索能力的专项评测。对我们做量化研究流水线的 Agent 而言,这才是真正衡量”模型能不能帮你找研报、读数据”的标尺,而不是去比谁 MMLU 分高。
自进化:从”3-5年”压缩到”1-2年”
报告用了不小篇幅讲自进化(Self-Evolution),并对比了 OpenAI 与 Anthropic 两条哲学分叉的路径:
| 维度 | OpenAI 路径 | Anthropic 路径 |
|---|---|---|
| 进化驱动力 | 客观结果(可验证的奖励) | 宪法原则(价值对齐) |
| 关键技术 | RLVR:模型生成答案→编译器验证器自动判对错→用正确样本训练自己 | 宪法AI & RLAIF:模型据”宪法”生成回答→另一个AI审查员据同一”宪法”评估改写→生成训练数据 |
| 商业逻辑 | 追求极致能力,吸引前沿开发者 | 把安全转化为信任和收入,赢得金融/医疗/法律高端企业客户 |
一个让我印象深刻的数据点:MiniMax M2.7 在内部测试中可连续执行超过100轮”分析—改进—验证”循环,自主调整采样参数、优化工作流策略,在内部评测集中实现约30%的效果提升,已在部分研发流程中承担30%-50%的工作量。小米 MiMo 负责人罗福莉说,一年前大模型实现”自进化”还需要3-5年,现在觉得1-2年就能完成。
这个时间表的压缩速度,意味着我们今天搭建的 Agent 流水线(比如本篇就是一条研报→解读→发布的自动化管道)面临的不是”模型会不会进化”,而是”模型进化速度会不会让现有编排逻辑快速过时”。
入口变迁:从 App Store 到 ClawHub 技能市场
报告后半段提出了一个对开发者最切身的影响判断:OpenClaw 是智能体计算机的操作系统,它的爆火标志着AI从”对话助手”向”执行员工”的范式跃迁。
传统互联网是 App Store「人找 App」,AI 时代是 ClawHub(技能市场)「AI 自主发现/调用技能」,用户感知更间接。竞争焦点从”争夺App Store曝光”变成两点:①能否被AI高效调用(接口标准化、可靠性);②在垂直领域是否不可替代(专业度、数据壁垒、基建壁垒)。
我跑这条研报流水线时对此感受极深:我的 report_fetcher.py / report_extractor.py / backtest-guardrails 这些技能,本质上就是 ClawHub 生态里的”原子化服务”。它们能不能被 GLM-5.2 / DeepSeek 稳定调用,不取决于我写得多花哨,而取决于接口是否标准化、错误是否可被模型自纠。
报告还顺带点了一个商业拐角:模型巨头开启广告模式。OpenAI 计划 2030 年广告收入达到 1000 亿美元,每次对话展示1-2条”Sponsored”推荐卡片(与AI回答物理隔离)。这会直接挤压传统广告市场——App 时代靠中心化分发吃的广告费,可能被Agent入口重新分配。
与已有系统的对比(核心增价值)
把这份报告的判断,对照我实际在跑的 Hermes Agent 量化流水线,能看到三处明确的映射与落差:
1. 评测维度选择——不要被通用榜单带偏。 报告点明通用榜单已失效。我的实战体感一致:GLM-5.2 / DeepSeek 在跑这条研报流水线时,决定成败的不是谁的 MMLU 高,而是长程任务稳定性 + 工具调用成功率 + 输出格式纪律。我更该关注的是 OSWorld-Verified(计算机使用)和 FinSearchComp(金融搜索)这类场景评测,而不是去比拼 GPQA-Diamond。本篇流水线里 report_fetcher.py download --search 超时(SearXNG/搜索补全不稳定)就是”工具调用环境不适配”的典型案例——这恰恰印证了报告中”失败往往不是模型不懂,而是环境不适配”的判断。
2. MCP/接口标准化的落地优先级。 报告把 MCP(Model Context Protocol)列为工具调用的工程化突破。这对应到我博客里反复强调的”技能即原子化服务”——本站已有《Hermes Agent 技能装机指南》《从三个顶级Agent项目中提取设计模式》等文章都在论证同一件事:未来竞争力的护城河不是模型,而是垂直技能的专业度与数据壁垒。一个量化研报复现技能,如果做透了数据缺口地图(见《主力资金凭空消失、可转债算不出YTM》),它的不可替代性远高于一个通用 chat 接口。
3. 模型路由的成本经济学。 报告的定价表直接指导了我的 cron 模型分配策略(见本站《模型配置与零成本方案》《cron 调度》):高峰期避开 GLM-5.2(14-18h)和 DeepSeek(9-12h+14-18h),把研报流水线这种长程、可容错的任务放到 18:30(本 cron 就是这个时间点),用性价比而不是峰值智力来跑——这和报告”国产模型接近成本价换市场份额”的判断完全吻合。
局限性分析
报告自身的局限:
- 数据时效性:报告为 2026-04-17,ARR/调用量数据截至4月初。AI 行业月度变化剧烈,OpenAI/Anthropic 的 ARR 与 OpenRouter 排名到7月可能已有显著变化(本站 AI 周报系列跟踪了 GPT-5.6、Claude Opus 5 等后续发布)。
- 定性判断多、量化模型缺:报告是行业研究而非量化策略,没有给出可回测的因子或择时规则。这也是本次触发保底机制(而非直接复现)的根本原因。
- 国产模型优势的”性价比”叙事偏单一:报告强调国产模型靠工程化+数据弥补算力,但对算力约束的长期天花板(先进制程获取、训练集群规模)讨论不足。
- B14 期次错配:如开头标注,本地绑定的 PDF 与索引标题不符,解读时以 PDF 实际内容为准,无法直接引用到 GLM-5.2 的具体跑分——这部分需以智谱官方 ZClawBench 数据补充。
实践者视角的额外质疑:
- “自进化30%提升”的口径存疑:MiniMax M2.7 “连续100轮循环、30%效果提升、承担30-50%工作量”这类数字,未说明基线和评测集。内部评测集的 30% 提升往往无法外推到真实任务。我跑 Agent 流水线时,“内部评测”和”真实cron成功率”之间的落差经常是巨大的。
- 广告模式与中立性的冲突:OpenAI 计划每次对话插”Sponsored”卡片,若这种模式蔓延到 Agent 工具调用层(比如技能市场里竞价排名),会破坏 Agent 为用户执行任务的中立性——这是报告中轻描淡写但实际影响深远的风险。
- “入口去中心化”对中国市场的适用性:ClawHub/技能市场模式建立在开放协议(MCP)和全球模型生态上,国内受限于模型访问与监管,技能市场的繁荣路径未必复刻。
总结句
这份报告最大贡献不是某一条数据,而是把 Agent 时代模型竞争的评价坐标系从”谁更聪明”切换到了”谁的Token被调用得更多、谁的技能被AI稳定调用”——对每天在跑 Agent 流水线的人,这意味着护城河要从”换更强的模型”转向”做更垂直、更标准、更难替代的技能”。