第08讲:为什么 Attention 算力没少算,FlashAttention 却能快 3 倍?——从 Decoder Block 算子图、RoPE 复数旋转到显存四账本的第一性原理

🏛️ 第08讲:为什么 Attention 算力没少算,FlashAttention 却能快 3 倍?——从 Decoder Block 算子图、RoPE 复数旋转到显存四账本的第一性原理 主讲人:👓 Ringi(大厂 AI Infrastructure 工程师) 所属模块:Module 00: 性能工程与系统前置 篇章范式:📐 模型架构、算法与显存建模篇(Model Architecture & Memory Ledger Paradigm) 核心导读:你手里有一张 80GB 显存的 A100,输入 4096 长度的 Prompt,做一次 Attention 矩阵乘法只需要 0.05 秒;但一旦上下文拉长到 32K,显存瞬间像决堤的海啸一样暴涨 64 倍直接 OOM 炸机!更奇怪的是:后来出现的 FlashAttention 在数学上一次浮点运算都没少算(FLOPs 完全相同),为什么端到端速度却能暴涨整整 3~5 倍? Attention 真正昂贵的,到底是算力,还是慢速 HBM 显存的数据搬运? 学习 Transformer 的终极目的,绝不是死记硬背公式,而是建立起清晰的数据流动直觉(Tensor Flow)、算力与显存账本(Arithmetic & Memory Ledger) 与 底层硬件执行心智模型(Hardware Execution Mapping)。从前向 GEMM 矩阵乘法到反向梯度回传,从 $O(S^2)$ 的 Attention 显存海啸到 FlashAttention 的片上 SRAM 算子融合,从 MHA 到 GQA 的 KV Cache 显存瘦身,从绝对位置编码到 RoPE 的 2D 复数旋转魔术——每一个看似精妙的算法改进,背后都深刻交织着计算机体系结构的算力受限(Compute-Bound)与带宽受限(Memory-Bound)的物理博弈! 本讲我们将彻底告别死板的数学堆砌,用极客大白话与手把手推导,拆透 Transformer 的每一颗齿轮与每一个张量 Shape,带你亲手白板手算出 7B/70B 模型的全部参数与显存四账本! ...

September 01, 2026 · 46 min · 22792 words · Ringi Lee

AI Infra 大话西游实战之Transformer小白学习笔记(一)

🚀 AI Infra 大话西游实战之Transformer小白学习笔记(一) Google 大神 × 👓 Ringi 导学版(公式全兼容 / 小白友好 / AI Infra 实战贯通) 📌 导读寄语: 学习 Transformer 不是为了死记硬背公式,而是要建立清晰的数据流动直觉与硬件执行心智模型。 本笔记以 Google 大神的第一性原理视角,结合极客导师 Ringi 的手办级 3D 架构工坊插图,把每个公式、每个张量形状(Shape)以及后续在 CUDA / 分布式训练 / vLLM 推理中的对应关系彻底讲透! ...

August 21, 2026 · 21 min · 10189 words · Ringi Lee

深度解析大语言模型 LLM 原理

说明:原文作者royceshao,发布于公众号腾讯技术工程,本文为 Ringi Lee 归纳整理。 ...

May 08, 2026 · 44 min · 21857 words · Ringi Lee

FlashAttention:具有 IO 感知的快速且内存高效的精确注意力研究

引言 Transformer 架构已经成为自然语言处理、计算机视觉等领域的基础模型。然而,其核心组件——自注意力机制(Self-Attention)的时间和空间复杂度都是 \(O(N^2)\),其中 \(N\) 是序列长度。这种二次方复杂度严重限制了模型处理长序列的能力。 ...

January 26, 2026 · 5 min · 2400 words · Ringi Lee