[{"data":1,"prerenderedAt":593},["ShallowReactive",2],{"content-query-0s8NLULSvA":3},{"_path":4,"_dir":5,"_draft":6,"_partial":6,"_locale":7,"title":8,"description":9,"date":10,"type":11,"body":12,"_type":587,"_id":588,"_source":589,"_file":590,"_stem":591,"_extension":592},"\u002Fversion-updates\u002Fzh\u002F2_10","zh",false,"","昇思MindSpore 2.10版本正式发布，超节点亲和并行协同图算融合模式重磅升级，实现深度优化与效率提升","昇思MindSpore 2.10版本搭载超节点亲和并行方案，依托Muon与通算优化实现六倍性能提升，Mfusion图算融合组件对接Inductor，适配昇腾芯片带来显著编译加速收益。","2026-07-30","version-updates",{"type":13,"children":14,"toc":551},"root",[15,23,29,34,39,46,53,58,63,70,75,86,91,96,103,109,116,121,127,132,137,144,149,154,161,181,194,200,205,210,216,221,226,233,243,249,254,259,266,272,277,282,289,295,300,305,312,317,327,333,339,344,350,355,362,368,373,379,384,391,396,406,412,418,423,428,435,445,451,457,462,472,477,482,488,493,499,504,514,520,525,531,536,546],{"type":16,"tag":17,"props":18,"children":20},"element","h1",{"id":19},"昇思mindspore-210版本正式发布超节点亲和并行协同图算融合模式重磅升级实现深度优化与效率提升",[21],{"type":22,"value":8},"text",{"type":16,"tag":24,"props":25,"children":26},"p",{},[27],{"type":22,"value":28},"经过昇思MindSpore开源社区开发者们几个月的开发与贡献，现正式发布昇思MindSpore2.10版本。",{"type":16,"tag":24,"props":30,"children":31},{},[32],{"type":22,"value":33},"超节点亲和并行MindSpore HyperParallel，支持Muon+通算优化，实现6倍性能提升，同时激活值重计算与Swap协同升级，突破显存瓶颈，充分释放昇腾算力。\n昇腾亲和图模式MindSpore AKG，其中Mfusion图算融合组件化接入Inductor，支持Ascend亲和，获得更高编译加速收益。\n在基础框架演进方面，新增mccl集合通信异步初始化能力，提升大规模训练启动效率。\nMindSpore Lite能力持续增强，云侧推理模型支持列表全面扩展，新增多模态推理加速插件，实现端到端推理加速。",{"type":16,"tag":24,"props":35,"children":36},{},[37],{"type":22,"value":38},"下面就为大家详细解读昇思MindSpore 2.10版本的关键特性。",{"type":16,"tag":40,"props":41,"children":43},"h2",{"id":42},"超节点亲和并行mindspore-hyperparallel",[44],{"type":22,"value":45},"——超节点亲和并行MindSpore HyperParallel——",{"type":16,"tag":47,"props":48,"children":50},"h3",{"id":49},"_1-支持muon通算优化实现6倍性能提升",[51],{"type":22,"value":52},"1 支持Muon+通算优化，实现6倍性能提升",{"type":16,"tag":24,"props":54,"children":55},{},[56],{"type":22,"value":57},"随着大语言模型训练规模持续扩大，FSDP（Fully Sharded Data Parallel）已成为缓解显存压力、支撑千亿至万亿参数模型训练的重要分布式并行技术。同时，Muon 优化器得益于其高效率收敛也逐渐成为主流选择。然而，Muon 优化器的 Newton-Schulz 计算需要对完整参数矩阵进行正交化更新，而 FSDP 通常将参数、梯度和优化器状态切分存储在不同设备上，二者在计算粒度和数据布局上存在天然冲突。在大规模集群下，存在全矩阵通信开销高、数据并行域内重复计算严重、Host 侧小算子调度开销大等问题。",{"type":16,"tag":24,"props":59,"children":60},{},[61],{"type":22,"value":62},"基于 MindSpore HyperParallel FSDP2 框架，设计并实现了面向昇腾超节点训练平台的 FSDP-Muon 融合优化方案。该方案针对大规模集群下FSDP+Muon优化器的冗余计算和冗余通信提供多个性能优化手段，包括AllGather+DP去冗余技术、高维参数通信计算去冗余、Newton-Schulz矩阵融合、HSDP（Hybrid Sharded Data Parallel）分组去冗余技术。综合多项优化后，在昇腾超节点512 die集群测试下，千亿级别MoE Muon优化器计算耗时从最初的2700 ms优化至450 ms，性能提升约6倍。",{"type":16,"tag":64,"props":65,"children":67},"h4",{"id":66},"_11-dp-去冗余-hsdp-去冗余",[68],{"type":22,"value":69},"1.1 DP 去冗余\u002F HSDP 去冗余",{"type":16,"tag":24,"props":71,"children":72},{},[73],{"type":22,"value":74},"核心矛盾：FSDP的参数按行切分机制与Muon优化器Newton-Schulz正交化所需完整矩阵存在根本性冲突。",{"type":16,"tag":76,"props":77,"children":79},"div",{"style":78},"text-align: center;",[80],{"type":16,"tag":81,"props":82,"children":85},"img",{"src":83,"style":84,"alt":7},"\u002Fcategory\u002Finformation\u002Fversion-updates\u002Fbanner\u002Fzh\u002F2_10\u002F1.png","display: block;margin: 0 auto;max-width:60%",[],{"type":16,"tag":24,"props":87,"children":88},{},[89],{"type":22,"value":90},"Muon优化器特点挖掘：如上图所示，Newton-Schulz过程通过AllGather获得所有完整的矩阵，并进行Newton-Schulz计算，多卡之间存在重复计算。",{"type":16,"tag":24,"props":92,"children":93},{},[94],{"type":22,"value":95},"优化思路：减少冗余计算，每张卡只计算部分Param的Newton-Schulz\n优化1：HSDP分组去冗余，每个HSDP组内存在一个完整的矩阵副本，副本组内分配计算参数，计算量随副本数线性下降，即下图（1）。\n优化2：DP组去冗余，下图（2）中每个HSDP组内有多个DP组，且DP组内含有的矩阵一致，可进一步去冗余优化，即下图（2）。",{"type":16,"tag":76,"props":97,"children":98},{"style":78},[99],{"type":16,"tag":81,"props":100,"children":102},{"src":101,"style":84,"alt":7},"\u002Fcategory\u002Finformation\u002Fversion-updates\u002Fbanner\u002Fzh\u002F2_10\u002F2.png",[],{"type":16,"tag":64,"props":104,"children":106},{"id":105},"_12-极致降显存",[107],{"type":22,"value":108},"1.2 极致降显存",{"type":16,"tag":76,"props":110,"children":111},{"style":78},[112],{"type":16,"tag":81,"props":113,"children":115},{"src":114,"style":84,"alt":7},"\u002Fcategory\u002Finformation\u002Fversion-updates\u002Fbanner\u002Fzh\u002F2_10\u002F3.png",[],{"type":16,"tag":24,"props":117,"children":118},{},[119],{"type":22,"value":120},"如上图所示，控制参数分batch更新，实现中间激活显存可控，显存峰值降低40%，同时实现 HSDP 去冗余的通算掩盖。",{"type":16,"tag":64,"props":122,"children":124},{"id":123},"_13-newton-schulz的性能优化",[125],{"type":22,"value":126},"1.3 Newton-Schulz的性能优化",{"type":16,"tag":24,"props":128,"children":129},{},[130],{"type":22,"value":131},"在完成 DP\u002FHSDP 去冗余的 Muon 优化器方案实现后，我们通过 Profiling 分析，Newton-Schulz 的计算开销成为了系统的主要瓶颈，针对 Newton-Schulz 计算进一步优化。",{"type":16,"tag":24,"props":133,"children":134},{},[135],{"type":22,"value":136},"1）\t高维参数通信计算去冗余优化",{"type":16,"tag":76,"props":138,"children":139},{"style":78},[140],{"type":16,"tag":81,"props":141,"children":143},{"src":142,"style":84,"alt":7},"\u002Fcategory\u002Finformation\u002Fversion-updates\u002Fbanner\u002Fzh\u002F2_10\u002F4.png",[],{"type":16,"tag":24,"props":145,"children":146},{},[147],{"type":22,"value":148},"如上图所示，无需进行跨卡的全局通信聚合，可直接按本地分片的 Batch 维度独立并行执行Muon 计算，实现了完全的免通信通算去冗余，专家矩阵的绝对耗时由 4.9 ms 大幅缩减至 1.1 ms，耗时骤降约 77.5%。",{"type":16,"tag":24,"props":150,"children":151},{},[152],{"type":22,"value":153},"2）矩阵融合优化",{"type":16,"tag":76,"props":155,"children":156},{"style":78},[157],{"type":16,"tag":81,"props":158,"children":160},{"src":159,"style":84,"alt":7},"\u002Fcategory\u002Finformation\u002Fversion-updates\u002Fbanner\u002Fzh\u002F2_10\u002F5.png",[],{"type":16,"tag":24,"props":162,"children":163},{},[164,166,172,174,179],{"type":22,"value":165},"如上图所示，通过在 Host 端构建统一的 Batch 维度，我们将原本零散的海量小矩阵重组为连续的高维张量 ",{"type":16,"tag":167,"props":168,"children":169},"span",{},[170],{"type":22,"value":171},"B, M, N",{"type":22,"value":173},"，从而在底层硬件触发高效的批量矩阵乘（BMM）算子，该优化显著降低了执行延迟。以 74 个形状为 ",{"type":16,"tag":167,"props":175,"children":176},{},[177],{"type":22,"value":178},"24, 10240",{"type":22,"value":180}," 的参数为例，批量执行 Newton-Schulz 迭代的总耗时降至 2.4 ms，远低于优化前逐个参数执行的理论总耗时（74*1.0  = 74 ms）。",{"type":16,"tag":24,"props":182,"children":183},{},[184,186],{"type":22,"value":185},"参考链接：",{"type":16,"tag":187,"props":188,"children":192},"a",{"href":189,"rel":190},"https:\u002F\u002Fgitcode.com\u002Fmindspore\u002Fhyper-parallel\u002Ftree\u002Fmaster\u002Fhyper_parallel\u002Fcore\u002Foptimizer",[191],"nofollow",[193],{"type":22,"value":189},{"type":16,"tag":47,"props":195,"children":197},{"id":196},"_2-激活值重计算与swap协同升级突破显存瓶颈充分释放昇腾算力",[198],{"type":22,"value":199},"2 激活值重计算与Swap协同升级，突破显存瓶颈，充分释放昇腾算力",{"type":16,"tag":24,"props":201,"children":202},{},[203],{"type":22,"value":204},"随着大模型规模、序列长度和微批次数持续增长，训练过程中需要为反向传播保留的激活值快速增加，激活显存逐渐成为制约模型规模和训练吞吐的关键因素。传统激活值重计算通过“以算换存”降低显存占用，但固定在反向阶段触发重算，难以充分利用流水线中的空闲窗口；在复杂训练场景中，单一内存优化手段也难以兼顾显存与执行效率。",{"type":16,"tag":24,"props":206,"children":207},{},[208],{"type":22,"value":209},"MindSpore HyperParallel 1.0版本基于昇思MindSpore 2.10版本PyNative模式统一升级激活内存优化能力，将“保留、重计算、换出”纳入同一套声明式策略，并支持重计算任务独立调度。用户可以根据算子计算量、激活大小和调度空窗灵活组合策略，在减少Device显存占用的同时，尽可能隐藏重计算与Host-Device数据搬运开销。",{"type":16,"tag":64,"props":211,"children":213},{"id":212},"_21-动态图重计算新增swap策略兼顾性能与显存",[214],{"type":22,"value":215},"2.1 动态图重计算新增Swap策略，兼顾性能与显存",{"type":16,"tag":24,"props":217,"children":218},{},[219],{"type":22,"value":220},"MindSpore HyperParallel 1.0版本在PyNative模式下支持选择性激活重计算，并将Swap作为与“保存”“重计算”并列的策略。用户可通过统一策略接口，对计算代价高的算子保留结果、对计算代价低的算子执行重计算、对大激活异步换出到Host，无需依赖整图捕获或编译，即可在同一重计算区域内组合使用多种激活内存策略。",{"type":16,"tag":24,"props":222,"children":223},{},[224],{"type":22,"value":225},"该能力无需依赖完整前后向图的统一规划，可直接适配Python动态控制流和动态图原生执行方式，策略粒度更灵活，也更便于接入已有模型代码，三种策略的资源取舍如下图所示。",{"type":16,"tag":76,"props":227,"children":228},{"style":78},[229],{"type":16,"tag":81,"props":230,"children":232},{"src":231,"style":84,"alt":7},"\u002Fcategory\u002Finformation\u002Fversion-updates\u002Fbanner\u002Fzh\u002F2_10\u002F6.png",[],{"type":16,"tag":24,"props":234,"children":235},{},[236,237],{"type":22,"value":185},{"type":16,"tag":187,"props":238,"children":241},{"href":239,"rel":240},"https:\u002F\u002Fgitcode.com\u002Fmindspore\u002Fhyper-parallel\u002Fblob\u002Fr1.0.0\u002Fdocs\u002Fguide\u002Factivation_checkpoint.md",[191],[242],{"type":22,"value":239},{"type":16,"tag":64,"props":244,"children":246},{"id":245},"_22-函数与模块级重计算抑制简化配置并降低host开销",[247],{"type":22,"value":248},"2.2 函数与模块级重计算抑制，简化配置并降低Host开销",{"type":16,"tag":24,"props":250,"children":251},{},[252],{"type":22,"value":253},"算子级策略适合精细控制激活的保存、重计算与换出，但当用户希望整个函数或模块不参与重计算时，逐一识别和配置内部算子并不方便。MindSpore HyperParallel 1.0版本提供checkpoint_exclude_wrapper，用户可直接从代码组织方式出发，包裹不需要重计算的函数或模块，无需感知其内部包含哪些算子。",{"type":16,"tag":24,"props":255,"children":256},{},[257],{"type":22,"value":258},"该能力在函数或模块边界完成重计算抑制，不依赖算子级Dispatch机制，运行时无需对区域内的算子逐一校验，减少了随算子数量累积的Host检查开销，两种配置方式的差异如下图所示。",{"type":16,"tag":76,"props":260,"children":261},{"style":78},[262],{"type":16,"tag":81,"props":263,"children":265},{"src":264,"style":84,"alt":7},"\u002Fcategory\u002Finformation\u002Fversion-updates\u002Fbanner\u002Fzh\u002F2_10\u002F7.png",[],{"type":16,"tag":64,"props":267,"children":269},{"id":268},"_23-重计算输入支持异步swap进一步压缩显存驻留",[270],{"type":22,"value":271},"2.3 重计算输入支持异步Swap，进一步压缩显存驻留",{"type":16,"tag":24,"props":273,"children":274},{},[275],{"type":22,"value":276},"即使中间激活通过重计算释放，重计算区域的输入仍需一直保留到反向阶段。MindSpore HyperParallel 1.0版本支持将重计算输入异步换出到Host，并在反向使用前预取回Device。数据搬运通过独立拷贝流执行，可与后续计算重叠，从而进一步缩短大输入在Device上的驻留时间。",{"type":16,"tag":24,"props":278,"children":279},{},[280],{"type":22,"value":281},"对于长序列、大 hidden size 或重计算边界输入较大的模型，该能力可在保留重计算收益的基础上继续降低激活显存，重计算输入异步换出与预取的执行时序如下图所示。",{"type":16,"tag":76,"props":283,"children":284},{"style":78},[285],{"type":16,"tag":81,"props":286,"children":288},{"src":287,"style":84,"alt":7},"\u002Fcategory\u002Finformation\u002Fversion-updates\u002Fbanner\u002Fzh\u002F2_10\u002F8.png",[],{"type":16,"tag":64,"props":290,"children":292},{"id":291},"_24-重计算支持独立调度与提前触发释放-pp-通算重叠空间",[293],{"type":22,"value":294},"2.4 重计算支持独立调度与提前触发，释放 PP 通算重叠空间",{"type":16,"tag":24,"props":296,"children":297},{},[298],{"type":22,"value":299},"在进一步降低显存之外，MindSpore HyperParallel 1.0版本还支持对重计算时机进行独立调度。传统重计算通常由反向传播按需触发，重算时延会直接进入反向关键路径；昇思MindSpore 2.10版本动态图重计算独立调度能力可在正向阶段收集重计算任务，在合适的调度窗口提前触发，并由后续反向阶段复用重算结果。",{"type":16,"tag":24,"props":301,"children":302},{},[303],{"type":22,"value":304},"该能力尤其适用于 PP overlap_b_f 场景。调度器可以在配对的前向计算启动前完成对应micro batch的重计算，避免二者竞争执行资源，同时为前向、反向及专家并行通信创造更充分的重叠空间，传统触发方式与独立调度方式的差异如下图所示。",{"type":16,"tag":76,"props":306,"children":307},{"style":78},[308],{"type":16,"tag":81,"props":309,"children":311},{"src":310,"style":84,"alt":7},"\u002Fcategory\u002Finformation\u002Fversion-updates\u002Fbanner\u002Fzh\u002F2_10\u002F9.png",[],{"type":16,"tag":24,"props":313,"children":314},{},[315],{"type":22,"value":316},"借助昇思MindSpore 2.10版本动态图能力，MindSpore HyperParallel 1.0版本通过算子级策略、函数与模块级重计算抑制、异步输入换出和独立重计算调度，将激活显存优化从单一功能升级为可组合、可调度的完整能力，帮助用户在不同模型结构与并行策略下，更灵活地平衡显存、算力和Host带宽。",{"type":16,"tag":24,"props":318,"children":319},{},[320,321],{"type":22,"value":185},{"type":16,"tag":187,"props":322,"children":325},{"href":323,"rel":324},"https:\u002F\u002Fgitcode.com\u002Fmindspore\u002Fhyper-parallel",[191],[326],{"type":22,"value":323},{"type":16,"tag":40,"props":328,"children":330},{"id":329},"昇腾亲和图模式mindspore-akg",[331],{"type":22,"value":332},"——昇腾亲和图模式MindSpore AKG——",{"type":16,"tag":47,"props":334,"children":336},{"id":335},"_3-mfusion图算融合组件化接入inductor支持ascend亲和获得更高编译加速收益",[337],{"type":22,"value":338},"3 Mfusion图算融合组件化接入Inductor，支持Ascend亲和，获得更高编译加速收益",{"type":16,"tag":24,"props":340,"children":341},{},[342],{"type":22,"value":343},"随着AI模型在昇思MindSpore、PyTorch等不同前端框架上演进，如果图融合能力与单一框架内部表示深度耦合，容易带来规则重复建设，也难以复用已经验证的硬件优化经验。围绕这一问题，MFusion将在昇思MindSpore中积累的可复用融合方法与Ascend优化经验，沉淀为独立MLIR组件，形成从组件化接入、Ascend亲和手工融合Pass和后端感知自动融合的完整能力体系，进一步拓展昇思MindSpore融合能力的跨框架复用边界。",{"type":16,"tag":64,"props":345,"children":347},{"id":346},"_31-基于mlir的组件化架构",[348],{"type":22,"value":349},"3.1 基于MLIR的组件化架构",{"type":16,"tag":24,"props":351,"children":352},{},[353],{"type":22,"value":354},"如下图所示，在PyTorch场景中，MFusion不是另起一个torch.compile后端，而是嵌入Inductor的post-grad图优化阶段。FX图经Torch-MLIR进入MFusion，完成融合与切分后，再以自定义算子形式返回原流水线；未融合区域沿用原NPU后端，融合子图则交由目标后端生成Ascend内核。由此可在保留Dynamo、AOTAutograd和Inductor原有能力的同时，让融合规则和代码生成后端作为独立组件持续演进。",{"type":16,"tag":76,"props":356,"children":357},{"style":78},[358],{"type":16,"tag":81,"props":359,"children":361},{"src":360,"style":84,"alt":7},"\u002Fcategory\u002Finformation\u002Fversion-updates\u002Fbanner\u002Fzh\u002F2_10\u002F10.png",[],{"type":16,"tag":64,"props":363,"children":365},{"id":364},"_32-ascend亲和的手工融合pass",[366],{"type":22,"value":367},"3.2 Ascend亲和的手工融合Pass",{"type":16,"tag":24,"props":369,"children":370},{},[371],{"type":22,"value":372},"MFusion首先通过可解释、可控的手工Pass锁定高价值结构。默认pipeline串联Torch侧和Mfuse侧的融合pattern，并支持自定义 DVM区域标注。在Transformer热点上，当前已覆盖RMSNorm、Add+RMSNorm、LayerNorm、RoPE、GELU、SwiGLU和Mean+Var；围绕MatMul\u002FBMM，则提供Cast与Bias吸收、Transpose吸收、二维BMM降级、K=1改写为Mul以及MatMul—Reshape—Bias重排。各Pass同步检查dtype、shape和数值语义，例如RoPE在BF16存在数值漂移风险时会主动保留原图，避免以融合换取不可控的精度代价。",{"type":16,"tag":64,"props":374,"children":376},{"id":375},"_33-后端感知的自动融合",[377],{"type":22,"value":378},"3.3 后端感知的自动融合",{"type":16,"tag":24,"props":380,"children":381},{},[382],{"type":22,"value":383},"在手工Pass优先锁定高价值结构之后，MFusion进一步以后端感知的自动融合覆盖长尾算子组合。系统先依据算子支持范围、dtype、shape和后端限制筛选候选节点，再通过依赖图搜索、并查集合并与环检测形成合法区域；当整段子图不存在统一的SSA插入位置时，通过动态规划补救切分，并结合Elementwise、Broadcast、Reduce、Reshape和MatMul等计算模式及Ascend启发式规则完成重组与outline，由此形成“确定性规则优先、自动融合补充”的两层优化路径。",{"type":16,"tag":76,"props":385,"children":386},{"style":78},[387],{"type":16,"tag":81,"props":388,"children":390},{"src":389,"style":84,"alt":7},"\u002Fcategory\u002Finformation\u002Fversion-updates\u002Fbanner\u002Fzh\u002F2_10\u002F11.png",[],{"type":16,"tag":24,"props":392,"children":393},{},[394],{"type":22,"value":395},"如上图所示，实际运行结果显示，在NVIDIA A100 Tensor Core GPU与昇腾Atlas A2训练系列产品的测试环境下，34个在两侧均通过精度验证的TorchBench网络，统一以“昇腾Atlas A2训练系列产品平台内E2E加速比÷NVIDIA A100 Tensor Core GPU平台内E2E加速比”计算，所得比值的几何平均为1.20倍，其中23个网络的比值大于1。在NLP Transformer、Vision Transformer、语音、多模态、经典CNN和生成式网络六类典型网络中，BERT_pytorch、timm_vision_transformer、speech_transformer、torch_multimodal_clip、resnet18和dcgan分别达到4.46倍、2.10倍、1.92倍、1.39倍、1.33倍和1.15倍，六项几何平均为1.84倍。结果表明，在本次测试覆盖的多类网络上，MFusion在昇腾Atlas A2训练系列产品中可以获得较高的编译加速收益。",{"type":16,"tag":24,"props":397,"children":398},{},[399,400],{"type":22,"value":185},{"type":16,"tag":187,"props":401,"children":404},{"href":402,"rel":403},"https:\u002F\u002Fgitcode.com\u002Fmindspore\u002Fakg\u002Ftree\u002Fmaster\u002Fmfusion",[191],[405],{"type":22,"value":402},{"type":16,"tag":40,"props":407,"children":409},{"id":408},"基础框架持续演进",[410],{"type":22,"value":411},"——基础框架持续演进——",{"type":16,"tag":47,"props":413,"children":415},{"id":414},"_4-新增mccl集合通信异步初始化能力提升大规模训练启动效率",[416],{"type":22,"value":417},"4 新增mccl集合通信异步初始化能力，提升大规模训练启动效率",{"type":16,"tag":24,"props":419,"children":420},{},[421],{"type":22,"value":422},"随着大模型训练集群规模持续扩大，CPU集合通信初始化涉及多节点地址同步和拓扑建连，千卡集群这一过程耗时可达分钟级，在同步阻塞模式下Device侧只能空转等待，造成算力严重浪费。",{"type":16,"tag":24,"props":424,"children":425},{},[426],{"type":22,"value":427},"昇思MindSpore 2.10版本新增mccl异步初始化能力，如下图所示，将mccl通信建连放入后台线程执行，主流程无需等待即可继续设备初始化，实现mccl通信建连与设备初始化的并行流水。这一改进在大规模集群场景下能有效降低初始化建链时间，提升Host与Device侧的并行利用率。当真正执行集合通信操作时，框架会自动等待后台线程完成初始化，并内置超时保护机制，保证安全可靠。",{"type":16,"tag":76,"props":429,"children":430},{"style":78},[431],{"type":16,"tag":81,"props":432,"children":434},{"src":433,"style":84,"alt":7},"\u002Fcategory\u002Finformation\u002Fversion-updates\u002Fbanner\u002Fzh\u002F2_10\u002F12.png",[],{"type":16,"tag":24,"props":436,"children":437},{},[438,439],{"type":22,"value":185},{"type":16,"tag":187,"props":440,"children":443},{"href":441,"rel":442},"https:\u002F\u002Fgitcode.com\u002Fmindspore\u002Fmindspore\u002Ftree\u002Fmaster\u002Fmindspore\u002Fccsrc\u002Fplugin\u002Fcpu\u002Fres_manager\u002Fcollective",[191],[444],{"type":22,"value":441},{"type":16,"tag":40,"props":446,"children":448},{"id":447},"mindspore-lite能力增强",[449],{"type":22,"value":450},"——MindSpore Lite能力增强——",{"type":16,"tag":47,"props":452,"children":454},{"id":453},"_5-云侧推理模型支持列表全面扩展覆盖六大类共100款sota模型",[455],{"type":22,"value":456},"5 云侧推理模型支持列表全面扩展，覆盖六大类共100款SOTA模型",{"type":16,"tag":24,"props":458,"children":459},{},[460],{"type":22,"value":461},"模型生态是推理框架落地业务的关键。MindSpore Lite 2.10版本云侧推理模型支持列表持续扩展，覆盖六大类共100款SOTA模型，其中47款已提供完整的转换配置与推理示例，新增Kandinsky-5.0系列、Qwen3-VL Thinking\u002FInstruct全量、Qwen3.5系列、Wan2.2系列、InternVL3_5 Flash系列、Qwen3-TTS\u002FQwen3-ASR等一批SOTA模型。",{"type":16,"tag":24,"props":463,"children":464},{},[465,466],{"type":22,"value":185},{"type":16,"tag":187,"props":467,"children":470},{"href":468,"rel":469},"https:\u002F\u002Fgitcode.com\u002Fmindspore\u002Fmindspore-lite#%E4%BA%91%E4%BE%A7%E6%8E%A8%E7%90%86%E6%A8%A1%E5%9E%8B%E6%94%AF%E6%8C%81%E5%88%97%E8%A1%A8",[191],[471],{"type":22,"value":468},{"type":16,"tag":24,"props":473,"children":474},{},[475],{"type":22,"value":476},"值得强调的是，MindSpore Lite 2.10版本云侧推理模型支持列表与多模态推理加速插件形成协同：多模态推理加速插件当前已支持Wan2.1 T2V\u002FI2V系列多卡并行推理加速，后续将基于模型注册机制扩展到更多开源模型。用户在使用云侧推理模型支持列表中的模型时，可结合该插件获得额外的多卡并行与稀疏注意力加速能力。",{"type":16,"tag":24,"props":478,"children":479},{},[480],{"type":22,"value":481},"通过持续扩展的模型支持列表与多模态推理加速插件，MindSpore Lite 2.10为昇腾云侧推理提供了“广覆盖 + 强加速”的端到端方案，协助从模型选型、转换、部署到加速的完整链路在统一框架下高效完成。",{"type":16,"tag":47,"props":483,"children":485},{"id":484},"_6-多模态推理加速能力增强实现端到端推理加速",[486],{"type":22,"value":487},"6 多模态推理加速能力增强，实现端到端推理加速",{"type":16,"tag":24,"props":489,"children":490},{},[491],{"type":22,"value":492},"随着大模型推理在生产环境的规模化部署，业务方在昇腾NPU上获取极致推理性能时普遍面临挑战：融合算子、稀疏注意力、多卡序列并行等关键加速能力散落在不同实现中，缺乏统一、易用的入口。针对这一痛点，MindSpore Lite 2.10面向昇腾硬件，通过C++自定义算子深度调用昇腾CANN aclnn接口，结合Python层的优化Attention、RoPE实现以及HCCL多卡通信，实现端到端推理加速。",{"type":16,"tag":64,"props":494,"children":496},{"id":495},"_61-rainfusionattention原生昇腾融合的块级稀疏注意力",[497],{"type":22,"value":498},"6.1 RainFusionAttention：原生昇腾融合的块级稀疏注意力",{"type":16,"tag":24,"props":500,"children":501},{},[502],{"type":22,"value":503},"视频生成、长序列语言模型等场景下，标准注意力计算量随序列长度二次增长。内置稀疏注意力算子直接封装昇腾CANN原生aclnnRainFusionAttention接口，在保留精度的基础上对注意力计算进行块级稀疏化。完整流程包含Token重排、块级池化、Top-k稀疏Mask生成、aclnnRainFusionAttention调用、逆重排五个阶段，借助token重排与稀疏Mask的协同，即便sparsity=0也能比dense attention更快。为兼顾定制化集成与开箱即用，提供两层接口：rain_fusion_attention为底层算子，sparse_attention为上层封装，补充完整的前后处理逻辑。",{"type":16,"tag":24,"props":505,"children":506},{},[507,508],{"type":22,"value":185},{"type":16,"tag":187,"props":509,"children":512},{"href":510,"rel":511},"https:\u002F\u002Fgitcode.com\u002Fmindspore\u002Fmindspore-lite\u002Fblob\u002Fmaster\u002Fmindspore-lite\u002Flite_boost\u002Fdocs\u002Fops\u002FRainFusionAttention.md",[191],[513],{"type":22,"value":510},{"type":16,"tag":64,"props":515,"children":517},{"id":516},"_62-npu兼容flashattention与优化rope",[518],{"type":22,"value":519},"6.2 NPU兼容FlashAttention与优化RoPE",{"type":16,"tag":24,"props":521,"children":522},{},[523],{"type":22,"value":524},"针对常用注意力实现做了NPU兼容化处理：FlashAttention按优先级自动选择FA3 → FA2 → NPU原生npu_prompt_flash_attention后端，自动匹配最优路径；RoPE采用float32实运算 + cos\u002Fsin表缓存实现，在视频生成模型实测中RoPE耗时降低约88%。",{"type":16,"tag":64,"props":526,"children":528},{"id":527},"_63-多卡并行ulysses序列并行-vae数据并行时间切片",[529],{"type":22,"value":530},"6.3 多卡并行：Ulysses序列并行 + VAE数据并行时间切片",{"type":16,"tag":24,"props":532,"children":533},{},[534],{"type":22,"value":535},"多卡并行提供两类不切分模型参数的并行策略，Ulysses Sequence Parallel (USP) 是面向Transformer自注意力层的序列维度并行，每卡持有完整模型权重，仅在激活上通过all_to_all通信，约束为num_heads可被world_size整除，适合长序列、大batch场景。VAE数据并行时间切片 针对视频VAE因果卷积的跨帧状态依赖，将视频沿时间维切分为重叠帧chunk分发到各卡独立处理，再通过all_gather收集拼接，重叠帧覆盖VAE时间感受野保证拼接一致性。插件采用模型注册机制支持快速扩展：实现boost_xxx(model)函数并在SUPPORTED_MODELS注册类名即可，当前已支持Wan2.1 T2V\u002FI2V系列，通过ParallelManager(model)一行代码即可原地转为USP多卡推理模式。",{"type":16,"tag":24,"props":537,"children":538},{},[539,540],{"type":22,"value":185},{"type":16,"tag":187,"props":541,"children":544},{"href":542,"rel":543},"https:\u002F\u002Fwww.mindspore.cn\u002Flite\u002Fapi\u002Fzh-CN\u002Fmaster\u002Flite_boost\u002Flite_boost.parallel.ParallelManager.html#lite_boost.parallel.ParallelManager",[191],[545],{"type":22,"value":542},{"type":16,"tag":24,"props":547,"children":548},{},[549],{"type":22,"value":550},"MindSpore Lite为基于PyTorch接口的云侧推理提供了“原生算子 + 自动并行 + 极简接入”的统一加速方案，通过LiteBoost多模态推理加速插件，用户无需重写模型脚本即可在昇腾NPU上获得融合算子、稀疏注意力与多卡并行的端到端性能收益。",{"title":7,"searchDepth":552,"depth":552,"links":553},4,[554,569,576,579],{"id":42,"depth":555,"text":45,"children":556},2,[557,563],{"id":49,"depth":558,"text":52,"children":559},3,[560,561,562],{"id":66,"depth":552,"text":69},{"id":105,"depth":552,"text":108},{"id":123,"depth":552,"text":126},{"id":196,"depth":558,"text":199,"children":564},[565,566,567,568],{"id":212,"depth":552,"text":215},{"id":245,"depth":552,"text":248},{"id":268,"depth":552,"text":271},{"id":291,"depth":552,"text":294},{"id":329,"depth":555,"text":332,"children":570},[571],{"id":335,"depth":558,"text":338,"children":572},[573,574,575],{"id":346,"depth":552,"text":349},{"id":364,"depth":552,"text":367},{"id":375,"depth":552,"text":378},{"id":408,"depth":555,"text":411,"children":577},[578],{"id":414,"depth":558,"text":417},{"id":447,"depth":555,"text":450,"children":580},[581,582],{"id":453,"depth":558,"text":456},{"id":484,"depth":558,"text":487,"children":583},[584,585,586],{"id":495,"depth":552,"text":498},{"id":516,"depth":552,"text":519},{"id":527,"depth":552,"text":530},"markdown","content:version-updates:zh:2_10.md","content","version-updates\u002Fzh\u002F2_10.md","version-updates\u002Fzh\u002F2_10","md",1785469194856]