面壁 ForgeStencil:两个 Agent 一周优化 100+ 工业软件,把「性能调优」从专家手艺变成流水线

给工业软件做性能优化,过去是一个 HPC 专家一年调不过二十个应用。面壁智能这次用一个双 Agent 系统,把...

给工业软件做性能优化,过去是一个 HPC 专家一年调不过二十个应用。面壁智能这次用一个双 Agent 系统,把这件事压到了一周一百多个。

8 月 4 日,面壁智能联合 OpenBMB 开源社区发布 ForgeStencil,全球首个支持 Stencil 自动研究、自动部署的 AI 优化系统。Stencil 是科学计算与工业仿真里最基础也最耗算力的计算模式——气象、地震勘探、电磁仿真、流体力学底层都是它,对内存带宽极度敏感,往往占应用大部分运行时间。ForgeStencil 把「找瓶颈—写代码—验证—集成」整条链全自动化:KernelAgent 负责「写代码」,针对场景和硬件自动合成逼近硬件极限的高效计算核心;AppAgent 负责「装软件」,分析真实应用、定位热点、验证正确性、再无缝集成回原软件。用户只给源码,其余系统接手,全程 0 人工介入。

一周内它跑完了 100+ 真实工业和科学计算软件,其中约 42% 直接对应真实工业生产场景(hypre 加速 3.86、minisweep 核反应堆中子学 5.78、gprMax/FDTD 电磁仿真 2.47、RTM 油气地震成像 1.81、QuantLib 债券定价 1.82 等),端到端加速中位数 1.41 倍。算子层面,与 Halide、Devito、EBISU、DRStencil、FlashFFTStencil 等开源最优基线同硬件对比:fp32 几何平均 2.35 倍,fp16 再拿 1.95 倍,业界最难的变系数 Stencil 也快 1.34 倍。

这条和 AI coding 的关系很直接:它不是生成功能代码,而是生成「逼近硬件物理极限的高性能代码」并自主部署——Agent 第一次把 HPC 性能调优从依赖个别专家的手艺,变成可并行、可复制的流水线。一个应用从数周压到小时级,研发吞吐提升约两个数量级,且能随算力并行放大。面壁把它归到 ForgeEngineering 范式,是 5 月 ForgeTrain(「AI 制造 AI」)之后的又一跳。Agent 共享知识库、经验实时同步,这点是人脑经验共享做不到的。

限制也要说清:加速比来自厂商在应用自带 GPU 实现上的端到端评测,对照基线和硬件配置未完全公开,第三方独立复现尚早;它只覆盖 Stencil 这一类计算热点,不是通用代码优化器;「8 位工程师一年近千万的工作 7 天搞定」是媒体换算口径,不宜当精确基准。仓库 github.com/OpenBMB/ForgeStencil 已面向全球开源,但许可证与完整基准集需到仓库核对。

来源: – 开源仓库 https://github.com/OpenBMB/ForgeStencil – 面壁智能官网 https://modelbest.cn – 新华财经报道 https://www.eeo.com.cn/2026/0804/986209.shtml – 网易·产业家详细稿 https://www.163.com/dy/article/L3GLM6PM053179F1.html

发表回复

人生梦想 - 关注前沿的计算机技术 acejoy.com 🐾 步子哥の博客 🐾 背多分论坛 🐾 借一步网 🐾 智柴网 沪ICP备2024052574号-1