#1361·warp

通过直接读取 blockIdx.x 来优化分块 CUDA 启动

作者: adenzler-nvidia创建于 2026年4月13日更新于 2026年9月19日
标签tile

对于分块 CUDA 内核启动,`blockIdx.x` 已经编码了分块索引,而`threadIdx.x` 则表示内部分块位置。当前的代码生成器首先计算线性线程索引,然后除以 `block_dim()` 以恢复分块坐标,这在 GPU 端是多余的。针对分块 CUDA 内核的专用代码生成路径可以直接读取 `blockIdx.x`,而不需要执行 `linear /= block_dim()` 的除法和乘法加法来重建线性索引。CPU 路径将继续使用当前的方法,因为它没有 `blockIdx` 的等价对象。