第10讲:AI Infra 性能工程方法论与三账本——FLOPs、显存与通信

🏛️ 第10讲:AI Infra 性能工程方法论与三账本——FLOPs、显存与通信 主讲人:👓 Ringi(大厂 AI Infrastructure 工程师) 所属模块:Module 00: 性能工程与系统前置 篇章范式:🏛️ 性能工程与系统前置篇(Performance Engineering & System Baseline) 核心导读:一个顶级的 AI Infra 工程师与普通算法调包侠之间,最根本的分水岭是什么?不是看谁能背出更多的 PyTorch API,而是看谁拥有**“在写下第一行代码前,就能在草稿纸上精确算清整个系统算力、显存与网络通信物理账本”的硬核内功**! 很多初入大厂的同学,面对一个全新的大模型训练或推理任务时,往往两眼一抹黑:不知道该申请 8 张卡还是 64 张卡、不知道 Batch Size 设多大才不会 OOM、不知道 nvidia-smi 里的 GPU-Util 99% 背后其实隐藏着极其严重的内存等待、更不知道集群训练速度慢究竟是卡在 Tensor Core 算力不足、显存带宽受限(Memory-Bound)还是被跨机 AllReduce 网络活活拖垮。 性能工程的本质就是“算账”。本讲作为 Module 00 的终极集大成篇,我们将彻底告别盲目试错,用极客大白话、生活直觉比喻、手把手极简数字算盘与 Roofline 物理模型,带你手撕大模型 算力账本($2P/6P/8P$)、显存四账本与跨卡通信账本,彻底掌握千卡集群资源规划的最高心法! ...

September 03, 2026 · 32 min · 15670 words · Ringi Lee

第12讲:GPU-Util 100% 算力却只有 15%?——SM 执行、Warp 调度、Tensor Core 与 Roofline 模型的第一性原理

🏛️ 第12讲:GPU-Util 100% 算力却只有 15%?——SM 执行、Warp 调度、Tensor Core 与 Roofline 模型的第一性原理 主讲人:👓 Ringi(大厂 AI Infrastructure 工程师) 所属模块:Module 01: GPU 硬件架构、数据搬运、集群通信与 Overlap 篇章范式:📐 硬件体系与性能建模篇(Hardware Architecture & Performance Modeling Paradigm) 核心导读: 刚进大厂做性能工程时,很多初学者看到终端里 nvidia-smi 实时跳动的 GPU-Util: 100%,就长舒一口气以为硬件算力已经被榨干了。然而,只要掏出 Nsight Compute(NCU)或 PyTorch Profiler 仔细一测,你往往会被残酷的技术现实泼一盆冷水——Tensor Core 的实际活动利用率(Tensor Core Active)可能连 15% 都不到! 为什么明明一张价值数十万的旗舰计算卡显卡风扇狂转、监控利用率拉满,真正干核心矩阵计算的算力单元却大部分时间在“带薪摸鱼”? GPU 硬件到底是以什么粒度在调度代码?流式多处理器(SM)内部除了算力,到底还在忙什么?数据在 Register、Shared Memory、L2 Cache、HBM 之间穿梭时,究竟付出了怎样令人绝望的时延代价? 本讲我们将彻底撕开 GPU 硬件的物理黑盒,从硅片微架构第一性原理层层拆解 SM、Warp 调度器、Tensor Core 与存储金字塔的协同分工,并掌握大厂性能工程的终极试金石——Roofline 性能模型! ...

September 03, 2026 · 62 min · 30712 words · Ringi Lee