分类
人工智能
共 2 篇文章
2026
大模型训练
大模型分布式训练并行策略
大模型训练的本质不只是把计算摊到更多 GPU 上,而是把 Transformer 的不同维度映射到不同 GPU,并控制由此产生的通信、显存占用、流水线空泡与负载不均衡。
大模型技术
FlashAttention:从 IO-Aware Attention 到 GPU Work Partitioning
剖析 FA 与 FA-2 两篇论文中的 IO 优化、Softmax 与 GPU 并行设计。
人工智能
Transformer Block 解析
将 Hugging Face 内部隐藏的 Qwen TransformerBlock 拆成可阅读、可测试、未来可替换成 Triton/CUDA Kernel 的实现