第12讲:GPU-Util 100% 算力却只有 15%?——SM 执行、Warp 调度、Tensor Core 与 Roofline 模型的第一性原理
🏛️ 第12讲:GPU-Util 100% 算力却只有 15%?——SM 执行、Warp 调度、Tensor Core 与 Roofline 模型的第一性原理 主讲人:👓 Ringi(大厂 AI Infrastructure 工程师) 所属模块:Module 01: GPU 硬件架构、数据搬运、集群通信与 Overlap 篇章范式:📐 硬件体系与性能建模篇(Hardware Architecture & Performance Modeling Paradigm) 核心导读: 刚进大厂做性能工程时,很多初学者看到终端里 nvidia-smi 实时跳动的 GPU-Util: 100%,就长舒一口气以为硬件算力已经被榨干了。然而,只要掏出 Nsight Compute(NCU)或 PyTorch Profiler 仔细一测,你往往会被残酷的技术现实泼一盆冷水——Tensor Core 的实际活动利用率(Tensor Core Active)可能连 15% 都不到! 为什么明明一张价值数十万的旗舰计算卡显卡风扇狂转、监控利用率拉满,真正干核心矩阵计算的算力单元却大部分时间在“带薪摸鱼”? GPU 硬件到底是以什么粒度在调度代码?流式多处理器(SM)内部除了算力,到底还在忙什么?数据在 Register、Shared Memory、L2 Cache、HBM 之间穿梭时,究竟付出了怎样令人绝望的时延代价? 本讲我们将彻底撕开 GPU 硬件的物理黑盒,从硅片微架构第一性原理层层拆解 SM、Warp 调度器、Tensor Core 与存储金字塔的协同分工,并掌握大厂性能工程的终极试金石——Roofline 性能模型! ...