归档

文章归档

共 9 篇文章

2026

编程

Triton Attention Kernel

Triton 实现 Softmax Attention 算子的基本思路。重点思考怎样不用存完整 attention matrix,仍然精确算出 softmax attention.

编程

Triton 编程模板

以向量加法为例,讲解 Triton Kernel、启动网格、块内索引、边界掩码、PyTorch 包装、正确性验证和性能测试的一般写法。

计算机系统

NVIDIA GPU 架构演进

梳理 NVIDIA GPU 从固定图形流水线、CUDA 通用计算,到 Tensor Core、光线追踪及机架级 AI 系统的演进历程,深入分析各代架构的关键突破、设计取舍与性能瓶颈,揭示其从“渲染像素”走向“生产智能”的技术脉络。