人工智能
Transformer Block 解析
将 Hugging Face 内部隐藏的 Qwen TransformerBlock 拆成可阅读、可测试、未来可替换成 Triton/CUDA Kernel 的实现
归档
共 9 篇文章
将 Hugging Face 内部隐藏的 Qwen TransformerBlock 拆成可阅读、可测试、未来可替换成 Triton/CUDA Kernel 的实现
Triton 实现 Softmax Attention 算子的基本思路。重点思考怎样不用存完整 attention matrix,仍然精确算出 softmax attention.
梳理 NVIDIA GPU 从固定图形流水线、CUDA 通用计算,到 Tensor Core、光线追踪及机架级 AI 系统的演进历程,深入分析各代架构的关键突破、设计取舍与性能瓶颈,揭示其从“渲染像素”走向“生产智能”的技术脉络。
全站检索
输入关键词开始搜索