第11讲:GPU 利用率 99% 的卡,为什么训练还是跑不快?——从 Kineto 底层探针、Trace 时间线四重病灶到 PyTorch Profiler 性能体检实战
🏛️ 第11讲:GPU 利用率 99% 的卡,为什么训练还是跑不快?——从 Kineto 底层探针、Trace 时间线四重病灶到 PyTorch Profiler 性能体检实战 主讲人:👓 Ringi(大厂 AI Infrastructure 工程师) 所属模块:Module 00: 性能工程与系统前置 篇章范式:🏛️ 性能工程与系统前置篇(Performance Engineering & System Baseline) 核心导读:在 AI Infra 性能工程中,最容易让初学者陷入绝望的怪象莫过于:nvidia-smi 里的 GPU-Util 明明已经彪到了 99%~100%,但模型的单步训练耗时依然慢如蜗牛,吞吐量连理论上限的 30% 都达不到! 很多工程师遇到性能瓶颈时,第一反应往往是凭经验瞎猜:“是不是 Attention 矩阵乘法太慢了?要不要手写个 Triton 融合算子?”——结果吭哧吭哧死磕了两周,端到端吞吐仅仅提升了 2%,最后用 Profiler 拍出一张时间线 X 光片才发现:整整 85% 的时间全在被 Python 端单进程数据加载(DataLoader)阻塞,GPU 核心绝大部分时间其实在发呆等数据! 调优千万条,Profiling 第一条! 性能优化的本质,往往不是“让 GPU 算得更快”,而是“让 GPU 少等”。PyTorch Profiler 就是我们手中的工业级全身 CT 机。本讲我们将彻底告别盲目摸黑调优,从 Kineto / CUPTI 硬件时间戳探针的第一性原理出发,带你掌握四阶 Schedule 采样周期、Chrome Trace / Perfetto 时间线四大典型病灶排障、TensorBoard 性能看板,亲手完成一次工业级大模型训练系统的深度性能体检! ...