第03讲:计算机体系结构前置——CPU 存储层次、Cache Line 与 NUMA 架构
🏛️ 第03讲:计算机体系结构前置——CPU 存储层次、Cache Line 与 NUMA 架构 主讲人:👓 Ringi(大厂 AI Infrastructure 工程师) 所属模块:Module 00: 性能工程与系统前置 篇章范式:🏛️ 性能工程与系统前置篇(Performance Engineering & System Baseline) 核心导读:在大模型分布式训练与高并发推理中,GPU 算力利用率(MFU)低下往往不是因为 GPU 算子写得不够好,而是因为主机 CPU 端与数据流水线发生了严重阻塞(CPU Bubble)!从 CPU 存储金字塔(L1/L2/L3/DRAM)、64 字节 Cache Line、MESI 缓存一致性与伪共享风暴,到内存自然对齐、NUMA 跨 Socket 拓扑绑定以及 Pinned Memory 锁页 DMA 传输,本讲带你用大厂工程师的第一性原理彻底击穿 CPU 与内存架构,消灭数据搬运瓶颈。 ...