专栏
AI Infra
共 6 篇文章,请按顺序阅读
- 第 1 篇阅读 →
拆解 Causal Language Model 的推理过程
将 Hugging Face generate() 隐藏起来的核心生成流程拆解出来,便于理解每阶段的具体行为。
- 第 2 篇阅读 →
Transformer Block 解析
将 Hugging Face 内部隐藏的 Qwen TransformerBlock 拆成可阅读、可测试、未来可替换成 Triton/CUDA Kernel 的实现
- 第 3 篇阅读 →
Reduce 算子的实现与优化
从最朴素的并行规约实现方法开始,逐步优化,提升内存带宽利用率。
- 第 4 篇阅读 →
GEMM 算子的实现与优化
从最朴素的实现方法开始,逐步优化,提升算数强度。
- 第 5 篇阅读 →
Softmax 算子的实现与优化
从最朴素的实现方法开始,逐步优化,并实现 Online Softmax。
- 第 6 篇阅读 →
卷积的实现与优化
从最朴素的实现方法开始,引入常量缓存优化滤波器读取,进一步使用平铺卷积算法减少带宽消耗。