大数跨境

全程0人工!AI打通模板计算优化闭环,硬核重构国产CAE与芯片电磁仿真底座

全程0人工!AI打通模板计算优化闭环,硬核重构国产CAE与芯片电磁仿真底座 维科网机器人
2026-08-04
2
导读:面壁智能开源了全球首个 Stencil 优化「自动研究+自动部署」大闭环的 AI 系统

当前,中国正处于从“制造大国”向“智造强国”跨越的关键节点,工业软件(如 CAE 仿真、流体力学计算、电磁 EDA 等)是核心桥梁。现代工业与科研的突破离不开高性能计算(HPC)软件的支持。

近年来,国产工业软件在算法和建模上进展迅速,但在航空航天、芯片设计等高精尖场景中,常面临“性能不足、跑得慢”的核心瓶颈。其底层最消耗算力的 Stencil(模板计算)模式,因极度依赖显存带宽,若代码与硬件适配不佳,会导致 GPU 性能闲置。

传统优化依赖少数 HPC 专家手工调试,耗时数周且难以规模化。如今,面壁智能联合 OpenBMB 开源社区正式发布全球首个 Stencil 优化“自动研究 + 自动部署”大闭环 AI 系统——ForgeStencil。该系统仅用 1 周时间,在零人类专家介入的情况下,自动完成了 100+ 真实工业和科学计算软件的重构优化。

作为面壁智能基于 Forge Engineering 新范式研发的又一成果,ForgeStencil 实现了从“提出优化想法”到“应用无缝部署”的全自动闭环。用户只需提供源码,系统即可自动分析、定位热点、锻造 Kernel、替换算子并验证集成。这不仅证明了无需追加硬件投资即可成倍释放既有物理性能的可能,更以算力平替人力,为国产工业软件按下自演化加速键。

开源链接:https://github.com/OpenBMB/ForgeStencil

双 Agent 驱动:零人工介入的全球首创

Stencil 是工业软件与科学计算中最基础的核心计算模式,广泛应用于大气动力学、地震波场、电磁场演化等领域。其特点是访存密集、受内存带宽主导,往往占据应用大部分运行时间。由于数据量巨大且读写频繁,一旦路径设计不合理,极易成为性能瓶颈。

过去,挖掘硬件极限速度依赖 HPC 专家针对特定应用和芯片进行定制化代码调整,难以应对庞大的软件优化需求。ForgeStencil 通过Kernel AgentApp Agent的双 Agent 协同,打破了这一困局:

  • Kernel Agent(算子优化):专注于底层算子编写,针对不同类型的 Stencil、网格形状和精度,自动生成大量候选 Kernel。通过编译、运行和性能反馈的多轮筛选,使算子无限逼近硬件物理极限。测试显示,在同精度(fp32)下获得几何平均 2.35×加速;混合精度(fp16)下额外提速 1.95×;即便在最难的“变系数 Stencil"场景下,仍取得 1.34×的加速优势。
  • App Agent(工程部署):解决从“算子快”到“应用快”的关键一环。它负责定位性能热点、建立 GPU 基线、提取待优化算子,并利用应用自带的测例进行端到端评测与集成,确保优化方案在真实场景中有效。

两者紧密协同,实现了从“自动生成代码”向“自动研究优化”、从“局部提速”向“真实应用部署”的智能进化,全程无需人工介入。

一周优化百项应用,效率超越人类专家

在双 Agent 闭环驱动下,ForgeStencil 将单个应用的优化周期从数天压缩至小时级。据统计,系统在一周内完成了 100+ 真实工业与科学计算应用的自动优化,研发吞吐提升 1-2 个数量级,效率远超人类专家。

(ForgeStencil 性能效率表)

此外,AI 优化具备“集体同步进化”优势:多个并行 Agent 共享知识库,经验实时流通,避免了人类专家经验难以复制共享的局限。

在优化的 100+ 个软件中,约 42% 直接对应真实的实体工业生产场景。以下是两个代表性案例:

攻克通用 CAE 软件数学心脏:hypre(加速 3.86×)

hypre 是全球工业仿真求解器广泛依赖的数值库,其内部的“红黑高斯 - 赛德尔”迭代计算因内存不连续导致 GPU 带宽吃紧。ForgeStencil 在无干预前提下深入源码优化,使 hypre 在 GPU 上实现 3.86×的真实端到端加速,相当于在不增加硬件成本的情况下显著提升了 CAE 求解器性能。

重构电磁仿真通用底盘:FDTD(加速 2.47×)

FDTD 算法是电磁仿真领域的数字底盘,代码复杂且极难优化。ForgeStencil 接管该底座后,在标准测例上取得 2.47×的真实加速,意味着电磁仿真迭代周期缩短一半,大幅提升了国产探地雷达等设备的研发效率。

此外,系统在更多领域表现卓越:minisweep 核反应堆中子学计算加速 5.78×,RTM 油气地震成像加速 1.81×,非笛卡尔 MRI 重建加速 2.45×,DBT 数字乳腺断层成像加速 1.63×。

从真实应用加速到工业软件自主可控

面壁智能此前曾提出:一旦 AI 构建速度超过人类,人工智能发展将更多取决于算力与自动化系统。ForgeTrain 验证了这一判断在大模型基础设施中的可行性,而 ForgeStencil 则将其延伸至工业与科学计算领域。

这标志着一种新的软件生产范式:代码可按需现场锻造,工程经验在 Agent 间持续流动。软件基础设施从“一次性编写、长期维护”转变为“按需生成、持续演进”的生产力。短期看,它能快速释放存量软件红利;长期看,它将算法设计与硬件性能解耦,让工程师专注于模型与创新,而非被性能优化琐事牵绊。

ForgeStencil 补上了国产工业软件走向“性能自主”的关键一环:打破对少数 HPC 专家的依赖,让工业计算软件具备针对具体应用和硬件持续自我进化的能力。这种效率优势将传导至制造业研发链,加速工程仿真、能源勘探及医学成像等领域的创新进程,为中国制造业升级提供可规模化的技术底座。

【声明】内容源于网络
0
0
维科网机器人
维科网机器人
内容 5473
粉丝 0
维科网机器人 维科网机器人
总阅读69.9k
粉丝0
内容5.5k