大模型技术
FlashAttention:从 IO-Aware Attention 到 GPU Work Partitioning
剖析 FA 与 FA-2 两篇论文中的 IO 优化、Softmax 与 GPU 并行设计。
标签
共 1 篇文章
剖析 FA 与 FA-2 两篇论文中的 IO 优化、Softmax 与 GPU 并行设计。
梳理 NVIDIA GPU 从固定图形流水线、CUDA 通用计算,到 Tensor Core、光线追踪及机架级 AI 系统的演进历程,深入分析各代架构的关键突破、设计取舍与性能瓶颈,揭示其从“渲染像素”走向“生产智能”的技术脉络。
全站检索
输入关键词开始搜索