人工智能
Transformer Block 解析
将 Hugging Face 内部隐藏的 Qwen TransformerBlock 拆成可阅读、可测试、未来可替换成 Triton/CUDA Kernel 的实现
标签
共 1 篇文章
将 Hugging Face 内部隐藏的 Qwen TransformerBlock 拆成可阅读、可测试、未来可替换成 Triton/CUDA Kernel 的实现
Triton 实现 Softmax Attention 算子的基本思路。重点思考怎样不用存完整 attention matrix,仍然精确算出 softmax attention.
全站检索
输入关键词开始搜索