PyPTO vf.reduce_min 寄存器最小值归约算子详解:从掩码筛选到索引回传的完整实现 📅 发布时间:2026/9/20 3:34:19 👁 浏览次数: 人工智能编译器模型编译高性能计算深度学习CANN【免费下载链接】pyptoPyPTO发音: pai p-t-oParallel Tensor/Tile Operation编程范式。项目地址https://gitcode.com/cann/pypto点击查看免费下载导读vf.reduce_min是 PyPTO 向量函数库Vector Functionvf中用于寄存器内in-register最小值归约的核心原语对应硬件vcmin全寄存器归约与vcgmindatablock 粒度归约指令。它能够在单个寄存器内完成掩码筛选 → 求最小值 → 回写结果与首个最小值索引的全流程是 softmax、min-pooling、动态规划等需要跨通道/跨行求极值的算子中高频使用的基础构件。阅读本文后你将掌握reduce_min的语义、参数与边界行为NaN、±0、空掩码并能在 Ascend 950PR/950DT 上直接落地 FP32 与 INT64 两种可运行示例。产品支持情况产品形态支持状态Ascend 950PR / Ascend 950DT支持Atlas A3 训练系列产品 / Atlas A3 推理系列产品不支持Atlas A2 训练系列产品 / Atlas A2 推理系列产品不支持从代码仓库的平台配置也能印证这一点vcgmin指令能力仅出现在 Ascend950DT 与 Ascend950PR 的模拟平台配置如Ascend950DT_9572.ini、Ascend950PR_9579.ini中而 A2/A3 系列配置中未声明该指令与文档的产品支持情况完全一致。功能说明reg_tensor最小值归约的执行语义为遍历源寄存器src中所有被谓词寄存器preg选中的有效元素求出其中的最小值将最小值写入目标寄存器的第一个元素dst[0]将第一个最小值所在的下标写入dst[1]其余元素全部置零。归约过程中值与索引的保存方式如下图所示其中索引语义需要注意当存在多个相等的最小值时保存的是首次出现下标最小的那个索引例如src [5, 3, 7, 3]时dst[0] 3、dst[1] 1。函数原型reduce_min(src, preg, datablock: bool False, merge_mode: Optional[MergeMode] None)该接口在源码中的声明位于 python/pypto_pro/language/_vf_api.py#L628-L650docstring 中明确标注其对应硬件指令为vcmin / vcgmin并将行为形式化为dstReg_0 min_{i ∈ active} srcReg_i参数说明参数输入/输出说明src输入源操作数reg_tensor。源操作数src与目的操作数dst的数据类型保持一致。支持的数据类型为DT_INT16、DT_UINT16、DT_FP16、DT_INT32、DT_UINT32、DT_FP32、DT_INT64、DT_UINT64。preg输入mask_reg 谓词掩码寄存器。当所有元素均不参与计算mask 为空时将该数据类型的最大值写入dst[0]。datablock输入可选决定接口工作模式。True时按 datablock 粒度归约对应vcgmin指令默认False对应vcmin指令。当datablockTrue时每个 datablock 独立归约32 位宽DT_INT32、DT_UINT32、DT_FP32类型每 16 个元素为一个 datablock16 位宽DT_INT16、DT_UINT16、DT_FP16类型每 32 个元素为一个 datablock各 datablock 分别求最小值并将结果依次写入dst的最低位。merge_mode输入可选对应 MergeMode 类型。-pypto_pro.language.MergeMode.ZEROING默认preg未筛选的元素在dst中置 0。-pypto_pro.language.MergeMode.MERGING当前不支持。参数底层实现源码佐证在 IR 层vf.reduce_min注册为VFOp类别算子携带dst、src、mask三个操作数以及datablockbool与merge_modeint两个属性见 framework/src/interface/ir/op/vf_ops.cpp#L247-L255REGISTER_OP(vf.reduce_min) .set_op_category(VFOp) .set_description(Min reduction across all lanes (vcmin/vcgmin)) .add_argument(dst, Destination register) .add_argument(src, Source register) .add_argument(mask, Mask register) .set_attrbool(datablock) .set_attrint(merge_mode) .f_deduce_type(DeduceVFFromDstArg);其中f_deduce_type(DeduceVFFromDstArg)表明目标寄存器dst的数据类型由源寄存器src推导而来二者保持一致这正是src 与 dst 类型一致约束的机制来源。后端生成阶段该算子注册到 CCE 后端发射器见 framework/src/interface/pypto_pro/backend/backend_cce_vf_ops.cpp#L5836由后端将datablock属性翻译为vcmin或vcgmin两条不同的硬件指令。在 Python 前端解析层reduce_min被注册为单源操作数调用见 python/pypto_pro/language/parser/_call_parser.py#L512确保调用时参数个数与类型检查与声明一致。约束说明datablockTrue时支持的数据类型收窄为DT_INT16、DT_UINT16、DT_FP16、DT_INT32、DT_UINT32、DT_FP32。即DT_INT64、DT_UINT64仅支持全寄存器归约模式datablockFalse。返回值说明返回目标 reg_tensor支持的数据类型与src一致归约结果写入第一个元素dst[0]索引写入dst[1]。需特别关注的边界行为多最小值并列存在多个最小值时将第一个下标最小最小值的索引保存在dst[1]中。NaN 输入如果输入数据存在 NaN将该数据类型的 NaN 写入dst[0]并将第一个 NaN 的索引保存在dst[1]中。符号零min(-0, 0) -0即负零在比较中优先于正零。空掩码当preg未选中任何元素时将对应数据类型的最大值如DT_FP32的Inf、DT_INT32的INT32_MAX写入dst[0]。调用示例基本调用示例DT_FP32以下示例展示完整的加载 → 归约 → 存储链路通过vf.create_mask生成全 1 掩码vf.load_align将 tile 数据对齐加载为寄存器reduce_min求最小值再vf.store_align写回 tileimport os import pypto_pro.language as pl import torch import torch_npu pl.vector_function def example_vf(src_tile, dst_tile): preg_all vf.create_mask(patternpl.MaskPattern.ALL, dtypepl.DT_FP32) src0 vf.load_align(src_tile, 0) min0 vf.reduce_min(src0, preg_all) vf.store_align(dst_tile, min0, preg_all) pl.jit() def example_kernel( a: pl.Tensor[[pl.DYNAMIC, pl.DYNAMIC], pl.DT_FP32], out: pl.Tensor[[pl.DYNAMIC, pl.DYNAMIC], pl.DT_FP32], ): tf pl.TileType(shape[1, 64], dtypepl.DT_FP32, target_memorypl.MemorySpace.Vec) in_a_grp pl.make_tile_group(typetf, addrs0x0, mutex_ids[0]) in_a in_a_grp.current() t_out_grp pl.make_tile_group(typetf, addrs0x100, mutex_ids[1]) t_out t_out_grp.current() with pl.section_vector(): pl.load(in_a, a, [0, 0]) example_vf(in_a, t_out) pl.store(out, t_out, [0, 0]) def test_example(): device_id int(os.environ.get(TILE_FWK_DEVICE_ID, 0)) device fnpu:{device_id} core_nums 1 torch.npu.set_device(device) a torch.randn([1, 64], devicedevice, dtypetorch.float32) out torch.empty([1, 64], devicedevice, dtypetorch.float32) example_kernelNone, core_nums torch.npu.synchronize() torch.testing.assert_close(out[0, 0], torch.min(a), rtol1e-5, atol1e-5) if __name__ __main__: test_example() print(PASSED)示例中的关键点out[0, 0]对应归约结果dst[0]与torch.min(a)做数值比对rtol/atol1e-5验证最小值语义设备号通过环境变量TILE_FWK_DEVICE_ID指定默认 0核数为 1输入[1, 64]的 tile 恰好对应 64 个 FP32 元素的寄存器归约注意reduce_min只使用dst[0]与dst[1]其余位置按ZEROING语义被置零。INT64 数据类型示例DT_INT64是reduce_min的特色能力同类归约接口如reduce_sum/reduce_max亦支持注意此类型不能与datablockTrue组合使用import os import pypto_pro.language as pl import torch import torch_npu pl.vector_function def example_vf_int64(src_tile, dst_tile): preg vf.create_mask(patternpl.MaskPattern.ALL, dtypepl.DT_INT64) reg_a vf.load_align(src_tile, 0) reg_out vf.reduce_min(reg_a, preg) vf.store_align(dst_tile, reg_out, preg) pl.jit() def example_kernel_int64( a: pl.Tensor[[pl.DYNAMIC, pl.DYNAMIC], pl.DT_INT64], out: pl.Tensor[[pl.DYNAMIC, pl.DYNAMIC], pl.DT_INT64], ): tf pl.TileType(shape[1, 32], dtypepl.DT_INT64, target_memorypl.MemorySpace.Vec) in_a_grp pl.make_tile_group(typetf, addrs0, mutex_ids[0]) in_a in_a_grp.current() t_out_grp pl.make_tile_group(typetf, addrs256, mutex_ids[1]) t_out t_out_grp.current() with pl.section_vector(): pl.load(in_a, a, [0, 0]) example_vf_int64(in_a, t_out) pl.store(out, t_out, [0, 0]) def test_example_int64(): device_id int(os.environ.get(TILE_FWK_DEVICE_ID, 0)) device fnpu:{device_id} core_nums 1 torch.npu.set_device(device) a torch.randint(-100, 100, [1, 32], devicedevice, dtypetorch.int64) out torch.zeros([1, 32], devicedevice, dtypetorch.int64) example_kernel_int64None, core_nums torch.npu.synchronize() torch.testing.assert_close(out[0, 0], torch.min(a), rtol0, atol0) if __name__ __main__: test_example_int64() print(PASSED)INT64 示例的两个细节tile 形状为[1, 32]64 位类型每个元素占 8 字节32 个元素正好对应一个寄存器的数据宽度torch.testing.assert_close使用rtol0, atol0精确比对因为整数最小值归约结果必须是位级精确的。与相邻归约接口的对照reduce_min属于 PyPTO 归约族reduction 目录与以下接口共享相同的签名与掩码语义便于对比记忆vf.reduce_max求最大值对应vcmax / vcgmaxdatablockTrue时每 datablock 求最大值写入dst最低位vf.reduce_sum求和对应vcadd / vcgadd注意其累加顺序与浮点舍入相关实际应用时可通过文档中的reduce_sum_accum_order图理解累加次序对结果精度的影响。三者均以dst[0]承载归约值且datablockTrue时的数据类型约束一致16 位宽类型每 32 元素一个 datablock32 位宽类型每 16 元素一个 datablock。典型应用场景与注意事项应用场景在矢量计算中reduce_min适合将按行/按组求极小值操作下沉到寄存器级完成例如softmax / log-softmax 中先求最大值reduce_max再做指数归一化最大值更利于数值稳定最小值归约则常用于 min-max 归一化的下界计算池化层 min-pooling 的列/行窗口约简动态规划或图算法中跨状态维度的最小值松弛。注意事项掩码是语义核心preg决定参与归约的元素集合务必与src的数据类型匹配生成create_mask的dtype参数与src一致空掩码、NaN、±0 三类边界行为需在算子正确性验证中单独用例覆盖datablockTrue模式下输出是多个datablock 结果依次写入dst低位此时dst不再是单值语义读取结果时需要按 16/32 元素步长解析当前仅在 Ascend 950PR/950DT 上可用跨产品移植前需先核对目标平台的指令集支持。赞分享人工智能编译器模型编译高性能计算深度学习CANN【免费下载链接】pyptoPyPTO发音: pai p-t-oParallel Tensor/Tile Operation编程范式。项目地址https://gitcode.com/cann/pypto点击查看免费下载相关推荐PyPTO pypto.argmin:多维张量归约索引算子的 API 约束与源码实现详解PyPTO pypto.argmin:多维张量归约索引算子的 API 约束与源码实现详解 pypto.argmin 是 PyPTOParallel Tenso人工智能编译器模型编译高性能计算深度学习CANNPyPTO pypto.argmaxTile 级最大值索引归约接口的语义、约束与源码实现解析PyPTO pypto.argmaxTile 级最大值索引归约接口的语义、约束与源码实现解析 本篇基于 PyPTOParallel Tensor/Tile人工智能编译器模型编译高性能计算深度学习CANNPyAsc 算子开发实战asc.language.basic.reduce_min 最小值归约 API 详解PyAsc 算子开发实战asc.language.basic.reduce_min 最小值归约 API 详解 在昇腾 AI 处理器的向量算子开发中从一批数编译器编程语言人工智能CANN创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考