标签

CUDA

共 1 篇文章

2026

编程

卷积的实现与优化

从最朴素的实现方法开始,引入常量缓存优化滤波器读取,进一步使用平铺卷积算法减少带宽消耗。

编程

Triton 编程模板

以向量加法为例,讲解 Triton Kernel、启动网格、块内索引、边界掩码、PyTorch 包装、正确性验证和性能测试的一般写法。

编程

CUDA 性能优化

以矩阵乘法为例记录 CUDA 性能优化路径,从基础全局内存 kernel 到共享内存 tiling、bank conflict、向量化访问和 occupancy 调优。