8月4日,AI赛道的故事分成了两条线:一条是AI正在接手那些”只有顶级专家才做得动”的硬核工程与数学——面壁智能的ForgeStencil让工业软件优化从HPC专家的手艺活变成了可规模化的自动流程,OpenAI则用一份62页手稿把”AI攻破数学难题”从新闻标题还原成了可审查的证明推演;另一条是中国厂商正在用”价格屠杀”重新定义全球AI的成本曲线——DeepSeek V4 Flash把游戏、agent任务的每次调用成本压到几毛几分,Wafer AI则证明了Kimi K3这样的万亿级模型不一定要绑死在英伟达的B200上。一边把天花板顶高,一边把地板砸低,这就是今天AI最真实的张力。以下是8月4日值得关注的AI动态。

一、面壁智能ForgeStencil开源:一周全自动优化百款工业软件,全程零人工

面壁智能联合OpenBMB开源社区发布全球首个Stencil优化AI系统ForgeStencil。它采用双Agent驱动,能在一周内自动完成100+款工业软件的优化,全程零人工介入——在同等精度下取得2.35倍加速,其中CAE求解器hypre达到3.86倍加速、电磁仿真FDTD达到2.47倍加速。

这件事的意义远超一个开源工具。工业仿真里的Stencil计算长期是HPC专家的”领地”,优化高度依赖人的经验、碎片化且不可累积。ForgeStencil真正打破的是**“性能优化必须靠专家”这个瓶颈**——它把软件性能优化变成了可自动化、可积累、可规模扩展的工程能力。对于正推进国产工业软件自主可控的生态而言,这是一条从”单点提速”走向”系统性加速”的新路径。

二、DeepSeek V4 Flash低价风暴打服硅谷:3D游戏7分钱、CS对战5毛钱

DeepSeek V4 Flash继续以超低价搅动硅谷:3D游戏运行一次仅约7分钱、CS对战5毛钱一把,性能却全面跃升——DeepSWE从7.3飙升至54.4,逼近顶级水平。海外平台争相倒贴补贴,开发者疯抢调用,有人感慨”每月30元就能让AI包揽脏活累活”。配套的DeepSeek Code编程工具也即将上线。

“倒贴”二字是这条新闻最值得玩味的信号。当海外云厂商愿意为接入一个中国模型自掏腰包补贴时,说明DeepSeek的定价已经不只是”便宜”,而是重构了agent类应用的经济模型——此前很多agent想法死于”调一次太贵”,V4 Flash把这条成本线压到了可以忽略的程度。这是国产模型从”性能追赶”切到”定价主导”的一个清晰信号。

三、OpenAI公开62页手稿:AI以2000美元成本攻破十道”菲尔兹奖级”数学难题

OpenAI发布62页核心手稿,公开AI模型攻克十道”菲尔兹奖级”数学难题的完整推演,总成本仅约2000美元。手稿由AI独立撰写,覆盖高维球体堆积(悬置46年未解)、非sofic群构造(27年无解)等难题的证明思路,并附249页论文合集。外界猜测执行该任务的可能是下一代主力模型Astra

但就在同一天,数学家Nielsen用24小时就驳回了OpenAI对Connes刚性猜想的”反例”——逐行审查那份37000行Lean 4代码后发现,AI构造的群既不满足ICC也不满足Kazhdan性质(T),反例不成立。结论是:“AI证对了每一句话,但它证明的已和原猜想无关。”

这两条放在一起读才完整。一方面,AI用2000美元走完了过去数学家一辈子都未必能启动的推演路径,这是惊人的效率;另一方面,Lean内核只能验证形式证明的正确性,却无法检查”结论与原问题的关联”——形式正确≠数学正确。对AI for Math的未来而言,这是一个既令人兴奋又必须警惕的分界线。

四、Kimi K3换上AMD跑:8张MI355X单节点跑通2.8万亿参数,吞吐量3.8倍于B200

Wafer AI在AMD MI355X上成功部署月之暗面的Kimi K3(2.8万亿参数)——原本需要16张B200跨两节点才能运行,如今8张MI355X单节点即可装下。实测MI355X单节点吞吐量952 Token/s,约为B200双节点部署的3.8倍;按性价比算每美元48 Token/s,远超B200的7 Token/s,ROCm适配过程也相对顺畅。

这是英伟达”算力霸权”被持续稀释的又一个例证。当万亿级MoE模型能在AMD单节点高效跑通,且性价比数倍于B200方案,“非英伟达不可”的叙事正在从工程假设退化为一种惯性。对国内从业者尤其关键——它意味着在高端GPU受限的背景下,国产/非英伟达路线正在从”能用”走向”好用、划算”。

五、商汤开源SenseNova U1.5-Lite:8B参数把手绘草图直出商业级海报

商汤开源SenseNova U1.5-Lite-Preview多模态模型,仅8B参数即可将手绘草图直接生成商业级海报,支持4K图像生成、复杂提示词执行、参考图创作与高精度图像编辑。评测显示其Qwen-Image-Bench成绩提升至55.20分,图像编辑能力超过一众更大参数模型,正式版近期推出。

8B这个数字很有杀伤力。过去”能出商业级图”基本是大参数闭源模型的专属,SenseNova U1.5-Lite把它压进8B并以开源形式放出,意味着端侧和低算力团队也能跑起高质量的图像生成与编辑。结合此前MiniMax H3的开源,视频与图像两大赛道都在经历”开源下沉到小参数”的同一股潮流。

六、墨奇智能10亿元天使轮:具身智能首轮融资规模创新高,阿里腾讯双双抢投

华为”天才少年”黄青虬等人创立的墨奇智能宣布完成超10亿元天使轮融资,投后估值70亿元,创下国内具身智能赛道首轮融资规模新高。阿里、腾讯及多家一线创投机构参投,公司专注通用人形机器人全栈技术研发,优先切入酒店服务、末端配送场景。

10亿天使轮、70亿估值,这个量级本身就说明了资本对具身智能的判断:它已经不是”下一个可能起来的方向”,而是被当作”必须押注的主线”。华为系团队+阿里腾讯同轮抢投的组合也颇值得玩味——大厂在具身智能上的卡位战,正从”自己做”延伸到”抢着投头部创业公司”。

七、Claude Fable 5登顶MirrorCode:64%绝对成功率,Ada等稀缺语种只降3个百分点

MirrorCode排行榜刷新,Claude Fable 5以64%的绝对成功率登顶,远超GPT-5.6 Sol的21%。即便在Ada等语料稀缺语言上,Fable 5的成绩也仅下降3个百分点——这表明最强模型已开始摆脱对语料的依赖,学会了从零构建完整软件项目

“摆脱语料牵引”是比”跑分更高”更值得关注的信号。长期以来,大模型在低资源语言、冷门框架上的拉胯都被归因于训练语料不足;Fable 5在Ada上几乎不掉分,暗示模型正在把”模仿语料”升级为”理解任务结构”。这是agent能否真正泛化到长尾场景的关键前提。

结语:当AI开始接管”专家的活”,最该升级的是”验证的活”

今天最值得记下的不是某个模型的跑分,而是两种能力的同步进阶:AI接管硬核工程与数学的能力在变强,但它输出的”可信度”仍需要人类专家来兜底——ForgeStencil能自动优化工业软件,Connes猜想的反例却需要数学家逐行复核才被推翻。能力在膨胀,验证却仍是瓶颈。谁先把”高效验证AI产出”做成系统化工具,谁就握住了下一波AI落地的钥匙。