AI Infra
从「拆解 Causal Language Model 的推理过程」开始,按专栏顺序阅读。
致虚极 守静笃
分类
专栏
从「拆解 Causal Language Model 的推理过程」开始,按专栏顺序阅读。
最近
大规模 MoE 的架构、路由、通信与 Scaling。
概述语言模型的缩放定律与计算最优训练两篇论文,强调模型参数量、训练数据量与算力合理配置。
NVIDIA GPU 训练性能下降、NCCL Hang、GPU 掉卡、NVLink 性能异常、单机或多机通信异常等问题的排故方法。
多头注意力的计算流程、维度变化及 Flash Attention 优化原理。
以一个具体的例子讲解 LLM 推理的流程。
Triton 实现 Softmax Attention 算子的基本思路。重点思考怎样不用存完整 attention matrix,仍然精确算出 softmax attention.
Git Fork 后如何同步上游仓库,同时保留自己的提交
浮点矩阵乘法的数值结果不仅取决于代数公式,还显著取决于求和树、分块方式和计算精度路径。
以向量加法为例,讲解 Triton Kernel、启动网格、块内索引、边界掩码、PyTorch 包装、正确性验证和性能测试的一般写法。
了解硬件架构特性,建立通用并行编程的基础,学习在大规模并行处理器上编写高性能的程序
全站检索
输入关键词开始搜索