DC娱乐网

AI 性能工程-学习 GPU 性能工程与生产级推理的精选资源列表地址:githu

AI 性能工程-学习 GPU 性能工程与生产级推理的精选资源列表地址:github.com/wafer-ai/gpu-perf-engineering-resources

wafer ai公司整理的资源列表,列表的组织顺序是:从单次推理请求开始,依次进入单块 GPU、优化后的内核、推理引擎和分布式系统。

核心列表采用原始论文、官方规范与文档、作者项目仓库,以及直接的工程实现工作。该仓库提供了一条从单次模型请求逐步扩展到大规模生产推理的学习路线,主要分为六层:GPU 基础:CUDA 执行模型、线程与内存层次、编译流程、PTX 和机器码。内核优化:矩阵转置、归约、矩阵乘法、Tensor Core、低精度计算及 FlashAttention。编程与分析工具:Triton、CUTLASS、CuTe、CUDA Tile,以及性能分析、基准测试和正确性检查。推理引擎:连续批处理、KV Cache、量化、推测解码、结构化生成和长上下文推理。分布式推理:模型并行、集合通信、MoE、Prefill/Decode 分离、生产调度及服务基准。当前硬件:NVIDIA、AMD、Google TPU 和 AWS Trainium 的架构与优化资料。