归档
文章归档
共 9 篇文章
2026
大模型训练
大模型分布式训练并行策略
大模型训练的本质不只是把计算摊到更多 GPU 上,而是把 Transformer 的不同维度映射到不同 GPU,并控制由此产生的通信、显存占用、流水线空泡与负载不均衡。
大模型技术
FlashAttention:从 IO-Aware Attention 到 GPU Work Partitioning
剖析 FA 与 FA-2 两篇论文中的 IO 优化、Softmax 与 GPU 并行设计。
归档
共 9 篇文章
大模型训练的本质不只是把计算摊到更多 GPU 上,而是把 Transformer 的不同维度映射到不同 GPU,并控制由此产生的通信、显存占用、流水线空泡与负载不均衡。
剖析 FA 与 FA-2 两篇论文中的 IO 优化、Softmax 与 GPU 并行设计。
全站检索
输入关键词开始搜索