AI Infra
从「拆解 Causal Language Model 的推理过程」开始,按专栏顺序阅读。
致虚极 守静笃
分类
专栏
从「拆解 Causal Language Model 的推理过程」开始,按专栏顺序阅读。
最近
以一个具体的例子讲解 LLM 推理的流程。
Triton 实现 Softmax Attention 算子的基本思路。重点思考怎样不用存完整 attention matrix,仍然精确算出 softmax attention.
Git Fork 后如何同步上游仓库,同时保留自己的提交
浮点矩阵乘法的数值结果不仅取决于代数公式,还显著取决于求和树、分块方式和计算精度路径。
以向量加法为例,讲解 Triton Kernel、启动网格、块内索引、边界掩码、PyTorch 包装、正确性验证和性能测试的一般写法。
了解硬件架构特性,建立通用并行编程的基础,学习在大规模并行处理器上编写高性能的程序
梳理 NVIDIA GPU 从固定图形流水线、CUDA 通用计算,到 Tensor Core、光线追踪及机架级 AI 系统的演进历程,深入分析各代架构的关键突破、设计取舍与性能瓶颈,揭示其从“渲染像素”走向“生产智能”的技术脉络。
记录在 Codex 客户端中复用 ChatGPT 登录会话的配置流程,包括会话信息导出、格式转换和本地认证文件处理。
介绍扫频式频谱仪的显示电平与测量模型,并通过仿真观察扫频过程对信号频谱显示的影响。
分析 lwIP 的内存管理实现,梳理动态堆内存与固定大小内存池的初始化、分配、释放流程及相关核心函数。
全站检索
输入关键词开始搜索