第08讲:为什么 Attention 算力没少算,FlashAttention 却能快 3 倍?——从 Decoder Block 算子图、RoPE 复数旋转到显存四账本的第一性原理

🏛️ 第08讲:为什么 Attention 算力没少算,FlashAttention 却能快 3 倍?——从 Decoder Block 算子图、RoPE 复数旋转到显存四账本的第一性原理 主讲人:👓 Ringi(大厂 AI Infrastructure 工程师) 所属模块:Module 00: 性能工程与系统前置 篇章范式:📐 模型架构、算法与显存建模篇(Model Architecture & Memory Ledger Paradigm) 核心导读:你手里有一张 80GB 显存的 A100,输入 4096 长度的 Prompt,做一次 Attention 矩阵乘法只需要 0.05 秒;但一旦上下文拉长到 32K,显存瞬间像决堤的海啸一样暴涨 64 倍直接 OOM 炸机!更奇怪的是:后来出现的 FlashAttention 在数学上一次浮点运算都没少算(FLOPs 完全相同),为什么端到端速度却能暴涨整整 3~5 倍? Attention 真正昂贵的,到底是算力,还是慢速 HBM 显存的数据搬运? 学习 Transformer 的终极目的,绝不是死记硬背公式,而是建立起清晰的数据流动直觉(Tensor Flow)、算力与显存账本(Arithmetic & Memory Ledger) 与 底层硬件执行心智模型(Hardware Execution Mapping)。从前向 GEMM 矩阵乘法到反向梯度回传,从 $O(S^2)$ 的 Attention 显存海啸到 FlashAttention 的片上 SRAM 算子融合,从 MHA 到 GQA 的 KV Cache 显存瘦身,从绝对位置编码到 RoPE 的 2D 复数旋转魔术——每一个看似精妙的算法改进,背后都深刻交织着计算机体系结构的算力受限(Compute-Bound)与带宽受限(Memory-Bound)的物理博弈! 本讲我们将彻底告别死板的数学堆砌,用极客大白话与手把手推导,拆透 Transformer 的每一颗齿轮与每一个张量 Shape,带你亲手白板手算出 7B/70B 模型的全部参数与显存四账本! ...

September 01, 2026 · 46 min · 22792 words · Ringi Lee