热门搜索:和平精英 原神 街篮2 

您的位置:首页 > > 教程攻略 > ai资讯 >ForgeStencil – 面壁智能推出的 Stencil 全自动研究部署系统

ForgeStencil – 面壁智能推出的 Stencil 全自动研究部署系统

来源:互联网 更新时间:2026-08-04 22:13

ForgeStencil是什么

先说说ForgeStencil是什么。这是面壁智能联合OpenBMB开源社区推出的一个AI优化系统,号称全球首个支持Stencil自动研究、自动部署的系统。它的核心是两个智能体——Kernel Agent和App Agent——形成一个闭环,能从优化策略的发现一直干到真实生产软件的集成,全程不需要人插手。效果怎么样?一周之内,它完成了100多个工业与科学计算软件的端到端优化,中位加速1.41倍,覆盖油气勘探、电磁仿真、医学影像等8大工业领域和5大科学领域。这可不是纸上谈兵,而是实实在在跑出来的数据。

ForgeStencil – 面壁智能推出的 Stencil 全自动研究部署系统

ForgeStencil的主要功能

  • 双 Agent 闭环优化

    :Kernel Agent 负责研究并合成高性能 CUDA Kernel,App Agent 则搞定热点定位、算子锻造、正确性验证和应用集成,分工明确,自动配合。
  • 自动策略发现

    :Agent 不是在一个固定的搜索空间里瞎转,而是自主探索分块、融合、布局、占用率甚至主机端重构这些优化策略——说白了,它自己会“想办法”。
  • 真实应用部署

    :直接面向生产级软件优化,以应用自身的GPU代码为基线进行端到端验证,而不是用那些简化的Benchmark糊弄事。
  • 可审计测量协议

    :通过一个单一的环境开关,在原始路径和优化路径之间来回切换,用程序自带的检查和计时器,确保加速比真实可信,没水分。
  • 跨代 GPU 适配

    :支持A100、H100、B200这些GPU,同一套代码库会根据架构自动选择最优的Kernel路径,省心。

ForgeStencil的技术原理

  • 双 Agent 协同架构

    :Kernel Agent 负责理论层面,通过Plan→Code→Profile这个循环,自主研究并合成逼近硬件物理极限的Stencil算子;App Agent 负责工程落地,定位应用性能热点、建立GPU基线、调用Kernel Agent构建的算子矩阵知识库,锻造出应用专属的优化方案,最后完成正确性验证和集成。两个Agent一研究一落地,配合默契。
  • 算子矩阵与知识库进化

    :Kernel Agent 在优化过程中不断构建专用的算子矩阵作为知识库,后续App Agent可以直接复用已有技术。多个并行Agent共享这个知识库,经验实时共享、集体同步进化——这就突破了人类专家经验难以规模化传递的瓶颈。说白了,一个Agent学会的,所有Agent都能用。
  • 可审计端到端协议

    :测量以应用自身的生产级GPU实现为唯一基线,原始路径和优化路径只通过一个USE_OURS开关区分,而且原始路径与上游代码字节一致。使用程序内置的正确性检查和计时器,多轮交错运行后取中位数,最后报告所有标准用例的几何平均加速比。这套机制从系统层面杜绝了造假空间。
  • Patch 模式与零源码捆绑

    :不捆绑任何第三方的源码,每个应用只提供上游出处记录、获取脚本和集成补丁,通过vendor.sh自动拉取指定版本的上游代码。这样既保证了许可证清洁,结果也完全可复现。
ForgeStencil – 面壁智能推出的 Stencil 全自动研究部署系统

如何使用ForgeStencil

  • 环境准备

    :先把仓库克隆下来,确保手上有NVIDIA GPU(A100上验证过)、CUDA 12.x、C++17编译器以及Python 3.9+环境。这些是基础门槛。
  • 快速体验算子

    :想试试单算子效果?跑一行命令 python tools/run.py --stencil star_1 --shape 256 --gpu 0,一分钟内就能测出性能,还能跟Halide基线对比。
  • 端到端复现

    :进到目标应用目录,执行 ./vendor.sh 拉取上游源码,应用集成补丁后,再跑 python ../../harness/run_e2e.py --app --gpu auto,就能完成真实应用验证。
  • 驱动 Agent 工作

    :参考 agents/README.md 配置好,然后启动Kernel Agent和App Agent的自主优化循环,剩下的交给它们。
  • 查阅结果注册表

    :通过 results/integration_registry.json 可以查看100个已验证应用的审计加速比数据,一目了然。

ForgeStencil的核心优势

  • 零人工介入

    :从应用分析、热点定位、Kernel锻造到集成验证,全流程自动化,HPC专家可以歇着了。
  • 真实场景导向

    :直接优化生产级工业软件,42%是真实工业生产软件,基线就是应用自身的GPU代码,不是玩具。
  • 研发效率飞跃

    :以前优化一个应用可能需要好几个月,现在一天内搞定。一周完成100多个应用,相当于省下了20-30人年的研发投入。
  • 性能表现强劲

    :端到端中位加速1.41倍,43%的应用达到1.5倍以上,算子级几何平均2.16倍领先最优开源基线。这成绩相当硬核。
  • 跨架构可持续

    :支持多代NVIDIA GPU运行时分发,架构升级时自动重锻Kernel,捕获新硬件特性,不怕过时。

ForgeStencil的项目地址

  • GitHub仓库

    :https://github.com/OpenBMB/ForgeStencil

ForgeStencil的同类竞品对比

维度ForgeStencilHalide
优化策略来源Agent 自主发现新策略,非固定空间搜索人类设计 DSL 与调度策略,自动化受限于预设规则
部署范围支持真实应用端到端集成与验证主要面向单算子/图像处理管线,缺乏应用级自动部署
基线对比以应用自身生产 GPU 代码为基准通常以简化参考实现或 CPU 版本为基准
正确性验证使用程序自带检查,交错测量确保可信依赖框架内置测试,无系统级防造假协议
知识积累多 Agent 共享算子矩阵知识库,经验可复用优化经验分散于各专家,难以规模化传递

ForgeStencil的应用场景

  • 油气地震勘探

    :优化RTM逆时偏移、道达尔mini-app等核心算法,加速石油勘探数据处理流程。
  • 电磁仿真设计

    :提升gprMax/FDTD等Yee网格Maxwell方程求解效率,服务于雷达与芯片电磁分析。
  • 医学影像重建

    :加速非笛卡尔MRI重建、数字乳腺断层成像反投影等医疗影像计算负载。
  • 气候与天体物理

    :优化大气动力学、宇宙学模拟等Stencil密集型科学计算应用。
  • 量化金融计算

    :为QuantLib等金融机构定价库提供Stencil热点自动优化,降低交易计算时延。

热门手游

手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc