标签

并行编程

共 1 篇文章

2026

编程

卷积的实现与优化

从最朴素的实现方法开始,引入常量缓存优化滤波器读取,进一步使用平铺卷积算法减少带宽消耗。

编程

CUDA 性能优化

以矩阵乘法为例记录 CUDA 性能优化路径,从基础全局内存 kernel 到共享内存 tiling、bank conflict、向量化访问和 occupancy 调优。