归档

文章归档

共 9 篇文章

2026

大模型训练

大模型分布式训练并行策略

大模型训练的本质不只是把计算摊到更多 GPU 上,而是把 Transformer 的不同维度映射到不同 GPU,并控制由此产生的通信、显存占用、流水线空泡与负载不均衡。

编程

卷积的实现与优化

从最朴素的实现方法开始,引入常量缓存优化滤波器读取,进一步使用平铺卷积算法减少带宽消耗。

文章发布统计图