第10讲:AI Infra 性能工程方法论与三账本——FLOPs、显存与通信
🏛️ 第10讲:AI Infra 性能工程方法论与三账本——FLOPs、显存与通信 主讲人:👓 Ringi(大厂 AI Infrastructure 工程师) 所属模块:Module 00: 性能工程与系统前置 篇章范式:🏛️ 性能工程与系统前置篇(Performance Engineering & System Baseline) 核心导读:一个顶级的 AI Infra 工程师与普通算法调包侠之间,最根本的分水岭是什么?不是看谁能背出更多的 PyTorch API,而是看谁拥有**“在写下第一行代码前,就能在草稿纸上精确算清整个系统算力、显存与网络通信物理账本”的硬核内功**! 很多初入大厂的同学,面对一个全新的大模型训练或推理任务时,往往两眼一抹黑:不知道该申请 8 张卡还是 64 张卡、不知道 Batch Size 设多大才不会 OOM、不知道 nvidia-smi 里的 GPU-Util 99% 背后其实隐藏着极其严重的内存等待、更不知道集群训练速度慢究竟是卡在 Tensor Core 算力不足、显存带宽受限(Memory-Bound)还是被跨机 AllReduce 网络活活拖垮。 性能工程的本质就是“算账”。本讲作为 Module 00 的终极集大成篇,我们将彻底告别盲目试错,用极客大白话、生活直觉比喻、手把手极简数字算盘与 Roofline 物理模型,带你手撕大模型 算力账本($2P/6P/8P$)、显存四账本与跨卡通信账本,彻底掌握千卡集群资源规划的最高心法! ...