📑 本文目录
研报解读AI Agent大模型MaaSbenchmark智谱GLM-5.2

当Agent吃掉Token:一份券商报告如何把AI模型经济学拆成"五层蛋糕"


本文是研报流水线的保底机制产物:当天扫描到的可复现金工研报不足2篇(仅国盛”量化漫谈”和国信非银金融策略两篇评分合格,且均无明确可代码化的策略规则),按 skill 规定转为解读模式。本文不执行回测,不调用 backtest-guardrails 的 B1-B11,只做方法论对比与工程化落地分析。

研报信息表

字段内容
标题Agent驱动全球模型厂MaaS收入爆发,国产模型各有优势(人工智能行业专题16)
机构国信证券
分析师张伦可、陈淑媛
报告日期2026-04-17
类型海外市场专题 / 行业研究
源PDFAP202604191821320224(pdf.dfcfw.com)

⚠️ B14 数据交叉验证标注:本地索引标题为”量化漫谈系列之二十一:GLM-5.2:Agent工具最优模型,长程任务能力登顶”(日期 2026-06-24),但绑定的 PDF 实际是 4月17日的国信 AI 行业专题,全篇 0 次出现 “GLM-5.2”。这是 SearXNG/扫描补全时常见的”同系列不同期次”问题——按 backtest-guardrails 的 B14 规则不直接丢弃,而是标注 date_mismatch_note,因为同系列方法论一致,本文内容(评测体系、MaaS 经济性、自进化路径)依然高度相关,甚至比单纯一篇模型测评更厚实。下面的解读以这份 4月17日 PDF 的实际内容为准。

核心设计:从”卖模型”到”卖Token”,AI的商业模式被重写

报告开篇就甩出一个反常识判断:自2026年以来,全球正在经历模型Tokens调用量大爆发的阶段,核心在于模型发展正式进入Agent智能体交互时代。根据 OpenRouter 数据,截至4月7日,中国AI大模型已连续五周调用量超越美国

这背后是一组商业数据的支撑——各家厂商的 ARR(Annual Recurring Revenue,年经常性收入)已经把”做大模型”从科研叙事变成了现金流叙事:

厂商旗舰模型参数(总/激活)上下文输入/输出价(美元/百万Token)团队规模关键ARR
OpenAIGPT-5.42000亿+1.05M2.50 / 15.00~40003月 250亿美元
AnthropicClaude 4.51000亿+1M3.00 / 15.00~40004月 300亿美元
智谱AIGLM-57440亿/400亿200K1.00 / 3.208833月 API ARR 2.5亿美元
月之暗面Kimi-K2.51万亿/328.6亿262K0.60 / 3.003002月 1亿美元
MiniMaxM2.72300亿/100亿205K0.30 / 1.203852月 1.5亿美元
DeepSeekV3.26710亿/370亿128K0.27 / 0.42150

读这张表的关键不是看谁参数大,而是看定价梯度:DeepSeek 输入价 0.27 美元,是 OpenAI 的约 1/9;MiniMax/Kimi 都在 0.3-0.6 区间。报告给出的解释很锐利——国产模型性价比高,主要系两点:①架构层面算力利用效率领先(DeepSeek 针对MoE、注意力机制做原创性轻量化优化;Kimi/MiniMax 锚定长上下文路线做成本全链路优化);②极致定价,中国厂商愿意以接近成本价换市场份额

工程化落地路径:Agent能力的四块积木

报告最有价值的一节是把”Agent能力”拆成了可工程化评估的四块积木。这也是我们这些每天在跑 Agent 流水线的人最该读的部分:

能力维度决定性因素技术要点
短期记忆(原生上下文)架构注意力机制类型 + MoE专家访问 + 活跃参数量配比
长期记忆(外置架构)工程化外部存储+RAG检索;训练时注入长上下文对话日志/工具调用-记忆检索交互数据
规划能力数据决定精度CoT/ToT + 马尔可夫决策过程;过程监督(Process Supervision);合成数据质量
工具调用工程化短期决定,数据决定精度MCP协议标准化(Anthropic 2024.11推出,“像U盘一样即插即用”);RLVR用工具执行客观结果反馈

这里有一个判断我深以为然:在工具调用中,失败往往不是模型不懂,而是环境不适配。报告把破局点归结为 MCP(Model Context Protocol)——标准化接口让模型无需为每个工具重新学习。这正是我从 Hermes 技能生态里反复验证的:同一个 report_fetcher.py 能被不同模型(GLM-5.2 / DeepSeek)稳定调用,靠的就是工具接口的稳定性,而不是模型本身有多聪明。

评测体系:通用榜单已失效,场景化评测崛起

报告引用 OpenAI 前研究科学家姚顺雨的判断——AI正处在”中场休息”阶段,上半场是训练大于评估,下半场将是评估大于训练。MiniMax 闫俊杰更直白:“中国跟美国模型的一个区别,就是缺少内部定义的 benchmark,更多是在对齐O1等模型的输出。”

于是各家开始自建场景评测:智谱发布龙虾场景端到端Agent评测基准 ZClawBench,腾讯推出 CL-bench(测试”从上下文中学习”的能力)。报告梳理的全球主要评测集按六维分类,这是给所有做 Agent 评测的人的一份速查表:

  • 推理与通用:HLE、AIME 2025、HMMT 2025、GPQA-Diamond、MMLU-Pro、LongBench v2
  • 编程:SWE-Bench Verified/Pro/Multilingual、Terminal Bench 2.0、PaperBench、CyberGym、LiveCodeBench v6
  • Agent能力:BrowseComp、WideSearch、DeepSearchQA、FinSearchComp (T2&T3)、Seal-0、GDPVal
  • 计算机使用:OSWorld-Verified、WebArena
  • 图像理解 / 视频理解(略)

注意 FinSearchComp ——这是金融搜索能力的专项评测。对我们做量化研究流水线的 Agent 而言,这才是真正衡量”模型能不能帮你找研报、读数据”的标尺,而不是去比谁 MMLU 分高。

自进化:从”3-5年”压缩到”1-2年”

报告用了不小篇幅讲自进化(Self-Evolution),并对比了 OpenAI 与 Anthropic 两条哲学分叉的路径:

维度OpenAI 路径Anthropic 路径
进化驱动力客观结果(可验证的奖励)宪法原则(价值对齐)
关键技术RLVR:模型生成答案→编译器验证器自动判对错→用正确样本训练自己宪法AI & RLAIF:模型据”宪法”生成回答→另一个AI审查员据同一”宪法”评估改写→生成训练数据
商业逻辑追求极致能力,吸引前沿开发者把安全转化为信任和收入,赢得金融/医疗/法律高端企业客户

一个让我印象深刻的数据点:MiniMax M2.7 在内部测试中可连续执行超过100轮”分析—改进—验证”循环,自主调整采样参数、优化工作流策略,在内部评测集中实现约30%的效果提升,已在部分研发流程中承担30%-50%的工作量。小米 MiMo 负责人罗福莉说,一年前大模型实现”自进化”还需要3-5年,现在觉得1-2年就能完成。

这个时间表的压缩速度,意味着我们今天搭建的 Agent 流水线(比如本篇就是一条研报→解读→发布的自动化管道)面临的不是”模型会不会进化”,而是”模型进化速度会不会让现有编排逻辑快速过时”。

入口变迁:从 App Store 到 ClawHub 技能市场

报告后半段提出了一个对开发者最切身的影响判断:OpenClaw 是智能体计算机的操作系统,它的爆火标志着AI从”对话助手”向”执行员工”的范式跃迁

传统互联网是 App Store「人找 App」,AI 时代是 ClawHub(技能市场)「AI 自主发现/调用技能」,用户感知更间接。竞争焦点从”争夺App Store曝光”变成两点:①能否被AI高效调用(接口标准化、可靠性);②在垂直领域是否不可替代(专业度、数据壁垒、基建壁垒)

我跑这条研报流水线时对此感受极深:我的 report_fetcher.py / report_extractor.py / backtest-guardrails 这些技能,本质上就是 ClawHub 生态里的”原子化服务”。它们能不能被 GLM-5.2 / DeepSeek 稳定调用,不取决于我写得多花哨,而取决于接口是否标准化、错误是否可被模型自纠。

报告还顺带点了一个商业拐角:模型巨头开启广告模式。OpenAI 计划 2030 年广告收入达到 1000 亿美元,每次对话展示1-2条”Sponsored”推荐卡片(与AI回答物理隔离)。这会直接挤压传统广告市场——App 时代靠中心化分发吃的广告费,可能被Agent入口重新分配。

与已有系统的对比(核心增价值)

把这份报告的判断,对照我实际在跑的 Hermes Agent 量化流水线,能看到三处明确的映射与落差:

1. 评测维度选择——不要被通用榜单带偏。 报告点明通用榜单已失效。我的实战体感一致:GLM-5.2 / DeepSeek 在跑这条研报流水线时,决定成败的不是谁的 MMLU 高,而是长程任务稳定性 + 工具调用成功率 + 输出格式纪律。我更该关注的是 OSWorld-Verified(计算机使用)和 FinSearchComp(金融搜索)这类场景评测,而不是去比拼 GPQA-Diamond。本篇流水线里 report_fetcher.py download --search 超时(SearXNG/搜索补全不稳定)就是”工具调用环境不适配”的典型案例——这恰恰印证了报告中”失败往往不是模型不懂,而是环境不适配”的判断。

2. MCP/接口标准化的落地优先级。 报告把 MCP(Model Context Protocol)列为工具调用的工程化突破。这对应到我博客里反复强调的”技能即原子化服务”——本站已有《Hermes Agent 技能装机指南》《从三个顶级Agent项目中提取设计模式》等文章都在论证同一件事:未来竞争力的护城河不是模型,而是垂直技能的专业度与数据壁垒。一个量化研报复现技能,如果做透了数据缺口地图(见《主力资金凭空消失、可转债算不出YTM》),它的不可替代性远高于一个通用 chat 接口。

3. 模型路由的成本经济学。 报告的定价表直接指导了我的 cron 模型分配策略(见本站《模型配置与零成本方案》《cron 调度》):高峰期避开 GLM-5.2(14-18h)和 DeepSeek(9-12h+14-18h),把研报流水线这种长程、可容错的任务放到 18:30(本 cron 就是这个时间点),用性价比而不是峰值智力来跑——这和报告”国产模型接近成本价换市场份额”的判断完全吻合。

局限性分析

报告自身的局限:

  1. 数据时效性:报告为 2026-04-17,ARR/调用量数据截至4月初。AI 行业月度变化剧烈,OpenAI/Anthropic 的 ARR 与 OpenRouter 排名到7月可能已有显著变化(本站 AI 周报系列跟踪了 GPT-5.6、Claude Opus 5 等后续发布)。
  2. 定性判断多、量化模型缺:报告是行业研究而非量化策略,没有给出可回测的因子或择时规则。这也是本次触发保底机制(而非直接复现)的根本原因。
  3. 国产模型优势的”性价比”叙事偏单一:报告强调国产模型靠工程化+数据弥补算力,但对算力约束的长期天花板(先进制程获取、训练集群规模)讨论不足。
  4. B14 期次错配:如开头标注,本地绑定的 PDF 与索引标题不符,解读时以 PDF 实际内容为准,无法直接引用到 GLM-5.2 的具体跑分——这部分需以智谱官方 ZClawBench 数据补充。

实践者视角的额外质疑:

  1. “自进化30%提升”的口径存疑:MiniMax M2.7 “连续100轮循环、30%效果提升、承担30-50%工作量”这类数字,未说明基线和评测集。内部评测集的 30% 提升往往无法外推到真实任务。我跑 Agent 流水线时,“内部评测”和”真实cron成功率”之间的落差经常是巨大的。
  2. 广告模式与中立性的冲突:OpenAI 计划每次对话插”Sponsored”卡片,若这种模式蔓延到 Agent 工具调用层(比如技能市场里竞价排名),会破坏 Agent 为用户执行任务的中立性——这是报告中轻描淡写但实际影响深远的风险。
  3. “入口去中心化”对中国市场的适用性:ClawHub/技能市场模式建立在开放协议(MCP)和全球模型生态上,国内受限于模型访问与监管,技能市场的繁荣路径未必复刻。

总结句

这份报告最大贡献不是某一条数据,而是把 Agent 时代模型竞争的评价坐标系从”谁更聪明”切换到了”谁的Token被调用得更多、谁的技能被AI稳定调用”——对每天在跑 Agent 流水线的人,这意味着护城河要从”换更强的模型”转向”做更垂直、更标准、更难替代的技能”。

相关阅读

💬 评论