大数跨境

昇腾AI框架Agent Skills:让Ascend for PyTorch开发告别经验主义

昇腾AI框架Agent Skills:让Ascend for PyTorch开发告别经验主义 昇腾AI开发者
2026-07-24
3

Ascend for PyTorch的研发链中,初级开发者常遇到这些问题:


上游PyTorch社区每周合入数百个Pull Request (PR),哪些需要NPU适配?

单个算子适配要修改10+个文件,功能失败是哪一处不一致所致?

图模式相关报错,从Python到ACL运行时四层架构,从哪查起?

它们不是难在代码本身,而是那条“先做什么、再做什么、出错往哪查”藏在资深工程师脑子里的路径地图。


我们将这套路径沉淀成了可复用的Agent Skills与Bot能力矩阵,贯穿四个环节:看懂→动手→守住→修复。



看懂:分析“如何开发、影响谁”


需求分析Skill:自动感知与分析原生PyTorch特性



场景痛点


上游PyTorch社区每周合入上百个PR,哪些会影响NPU兼容性?如何适配到NPU?技术专家逐条分析变更内容、评估影响、制定适配方案,耗时长且容易遗漏关键特性。



解决方案


pytorch-pr-analysis Skill自动拉取指定时段全部PR,逐条分析变更与TorchNPU 耦合关系,标注影响等级和适配建议,最终生成一份带超链接的Excel报告。


以往耗时耗力的人工分析,现在一条命令10分钟产出完整分析报告,每条结论都附带源码证据,大幅释放技术专家的方案设计时间。



效果展示



TorchNPU Helper:在线智能机器人



场景痛点


开发者常常在问“这个模块的设计思路”、“这个报错日志怎么修复”。传统方式需要人工查找文档、阅读源码,层层定位修复,耗时耗力且容易遗漏关键信息。



解决方案


TorchNPU Helper是一个满载TorchNPU知识与问题定位方案的在线机器人,部署在云NPU上,支持运行代码。开发者提问后,TorchNPU Helper会结合源码,知识库,Skills直接给出可操作答案,从“反复翻文档”到“超80%准确率”的即问即答,充当开发者的外置大脑。链接:

https://ai.gitcode.com/ascend-model-ecosystem#mofix-agent



效果展示



动手:代码开发的全自动流水线


算子适配Skill:一套适配方案的端到端落地



场景痛点


算子适配是TorchNPU开发中需求量大且持续,细节复杂多样的工作。单个算子的适配就涉及约14个TorchNPU文件修改:YAML注册、C++实现、Meta入图、autograd反向等——任意一环的错漏,都会导致编译报错,调试失败或留下隐患。但传统方式依赖资深工程师经验,上手难度大,不同类型算子的适配流程和细节差异巨大。



解决方案


算子适配Skill op-adaptation,实现"解析输入→确认参数→生成YAML→推导反向 →编写C++→生成Meta→验证→构建"的自动闭环。同时支持从0适配新算子,和为不同代际芯片修改适配逻辑。


其中自动调用两个子Skills:op-test自动生成覆盖正例、负例和FakeTensor的单元测试。如果测试失败,它会区分是测试用例自身的问题、适配源码的bug还是测试环境扰动,给出明确处置建议。op-apidoc生成符合规范的API文档,确保开发者始终获得准确、最新的API参考信息。


新人从此一键上手,不仅可以快速完成适配,效率提升10倍,还能基于Skills快速跟随学习算子适配的逻辑原理与边界条件。


案例展示:grouped_matmul算子,依托op-adaptation,可端到端完成适配到自验证全流程:



守住:让隐藏问题自动被及时拦截


门禁检查Skill



场景痛点


某些PR可能影响大量测试用例,导致TorchNPU的PR门禁产生大量错误信息,全靠人工修复相当耗时,社区贡献者的PR容易因代码风格等细节规范问题被驳回,既拖慢合入进度,也影响社区贡献体验。



解决方案


ci-static-errors-fix Skill针对每次次修改合入的代码执行处理,按白名单规则执行安全修复,每条自主修复都记录改动理由,确保行为不变。这层防护让"格式问题"不再阻塞合入,也通过可控的修复边界避免误改引入新缺陷。同时会输出完整的执行命令、残留问题与修复明细清单,所有改动可追溯、可审查。


修复:一条全自动的从报错到修复的流水线


API一致性问题修复Skill



场景痛点


PyTorch API是模型稳定可靠的基石,API的能力一致性是关键的一环。当某个API 在NPU上的行为和CPU不一致,或在功能,确定性,精度,显存上出了问题,需要快速定位根因。



解决方案


api-consistency Skill通过"三出口分流+两遍规则"端到端解决一致性问题:



面对不同的芯片版本,也会自动分流处理。复现、定位、修复三步走完,证据以日志和数值对比为准。批量问题也能统一调度,共用前置环境,每个问题独立诊断。端到端解决成功率超过60%。同时会将排障中的判断依据沉淀到分析报告中,大幅降低了技术问题排查的经验门槛。



案例展示


torch_npu.npu_mrope精度异常问题定位

问题:fp16场景下NPU输出出现inf/nan,CPU正常


Skill工作流:


智能路由→识别为ATK分支

精准定位→锁定问题算子为aclnnRopeWithSinCosCacheV2

产出报告→自动生成分析结论.md和复现记录.md

运行明细、xlsx摘要与关键判读


复现时间线与交付产物


社区用例修复Skill



场景痛点


上游PyTorch的测试用例需要在NPU中验证并修复可能的问题。失败用例的修复需走环境搭建→复现→诊断→验证→交付完整流程。人工排查耗时长,易陷入循环,缺乏标准化流程。



解决方案


两套Skills按问题类型智能分流:


torch-npu-issue-pipeline-core Skills处理TorchNPU Core组件相关的失败用例,自动管理PyTorch,TorchNPU,OpPlugin三仓库,完成从诊断到PR创建的完整交付。

torch-npu-issue-pipeline-distributed Skills处理分布式/图模式组件的失败用例,专注于HCCL 通信、图模式、Triton codegen等复杂场景。

图模式诊断Skill:四层架构精准定位



场景痛点


模型层面的复杂图模式问题,定位修复调用链跨越四层:Python API→C++核心→ OpPlugin算子→ACL运行。任一层报错都需要跨栈追踪,定位门槛非常高。



解决方案


npu-graph-skill套件按"知识问答→报错诊断→性能剖析→日志分析"智能路由,5个子技能统一入口自动分发。


诊断采用逐层下沉策略(从上层用户代码向下层框架深入),输出结构化结论:用户代码问题/框架Bug(已定位/待定位)/OpPlugin算子问题/ACL运行时问题/环境/配置问题。


从“经验驱动”到“能力沉淀”


这套Ascend for PyTorch的Agent Skills与Bot能力的价值不在于替代人写代码,解决问题,而是将资深工程师脑中的“路径地图”转化为可复用、可调用的标准流程。


对于TorchNPU初学者,大幅降低上手成本,不必吃透各类隐性问题就能开展代码贡献;工具本身会持续动态更新指引内容,操作步骤与问题排查方向一目了然、有据可查。


性能提升不仅发生在模型层,也发生在研发过程本身——当“看懂、动手、守住、修复”每个环节都有Agent护航,工程师才能将更多精力将留给那些没有标准答案的创新问题。


Agent Skills可在昇腾官方Skill仓获取,点击进入,并查看使用说明:

https://gitcode.com/Ascend/agent-skills/tree/master/official/PyTorch


后续将上线Ascend for PyTorch Agent能力的系列直播课,赋能与答疑如何使用这套Agent能力,更好更快地学习与完成Ascend for PyTorch相关的研发全链路。欢迎进群交流讨论。




【声明】内容源于网络
0
0
昇腾AI开发者
昇腾社区
内容 983
粉丝 0
昇腾AI开发者 昇腾社区
总阅读5.7k
粉丝0
内容983