# MUSA Opertator World **Repository Path**: mthreadsacademy/MUSA-Opertator-World ## Basic Information - **Project Name**: MUSA Opertator World - **Description**: 国内首个基于MUSA架构系统讲解大模型算子开发的实战课程,从大模型推理全景到算子优化,12课时完整实践路径 - **Primary Language**: Unknown - **License**: Not specified - **Default Branch**: master - **Homepage**: None - **GVP Project**: No ## Statistics - **Stars**: 1 - **Forks**: 0 - **Created**: 2026-05-12 - **Last Updated**: 2026-08-19 ## Categories & Tags **Categories**: Uncategorized **Tags**: None ## README # 计算工程系列:算子优化 本仓库用于存放I计算工程系列:算子优化》课程讲义 PPT。当前内容为 45 分钟版讲义,按章节目录组织,文件命名统一为 `课时X.Y-主题.pptx`。 课程围绕大模型推理中的核心算子展开,学习路径为: ```text 大模型推理全景 -> 算子世界观 -> GEMM 优化 -> Softmax / FlashAttention -> Triton -> TileLang -> 端到端算子优化 ``` ## 课程目录 | 章节 | 主题 | 课时数 | 讲义目录 | | --- | --- | ---: | --- | | Chapter 1 | 大模型推理全景与算子映射 | 4 | [chapter1](./chapter1/README.md) | | Chapter 2 | 算子的世界观:计算、存储与通信 | 4 | [chapter2](./chapter2/README.md) | | Chapter 3 | GEMM 优化实战 | 3 | [chapter3](./chapter3/README.md) | | Chapter 4 | Softmax + FlashAttention | 2 | [chapter4](./chapter4/README.md) | | Chapter 5 | Triton 快速入门 | 4 | [chapter5](./chapter5/README.md) | | Chapter 6 | TileLang 快速入门 | 1 | [chapter6](./chapter6/README.md) | | Chapter 7 | 综合实战:大模型推理端到端算子优化 | 2 | [chapter7](./chapter7/README.md) | | **合计** | | **20** | | ## 讲义清单 ### Chapter 1:大模型推理全景与算子映射 - [课时1.1-大模型推理全流程.pptx](<./chapter1/课时1.1-大模型推理全流程.pptx>) - [课时1.2-LLaMA架构核心解析.pptx](<./chapter1/课时1.2-LLaMA架构核心解析.pptx>) - [课时1.3-前沿架构启示.pptx](<./chapter1/课时1.3-前沿架构启示.pptx>) - [课时1.4-算子调用链实训.pptx](<./chapter1/课时1.4-算子调用链实训.pptx>) ### Chapter 2:算子的世界观:计算、存储与通信 - [课时2.1-算子的本质与分类.pptx](<./chapter2/课时2.1-算子的本质与分类.pptx>) - [课时2.2-存储层次与Tile.pptx](<./chapter2/课时2.2-存储层次与Tile.pptx>) - [课时2.3-性能分析工具入门.pptx](<./chapter2/课时2.3-性能分析工具入门.pptx>) - [课时2.4-LLaMA性能分析实训.pptx](<./chapter2/课时2.4-LLaMA性能分析实训.pptx>) ### Chapter 3:GEMM 优化实战 - [课时3.1-GEMM原理与PyTorch实现.pptx](<./chapter3/课时3.1-GEMM原理与PyTorch实现.pptx>) - [课时3.2-MUSA-GEMM优化.pptx](<./chapter3/课时3.2-MUSA-GEMM优化.pptx>) - [课时3.3-Auto-Tuning与性能对比.pptx](<./chapter3/课时3.3-Auto-Tuning与性能对比.pptx>) ### Chapter 4:Softmax + FlashAttention - [课时4.1-Softmax优化.pptx](<./chapter4/课时4.1-Softmax优化.pptx>) - [课时4.2-FlashAttention原理与实践.pptx](<./chapter4/课时4.2-FlashAttention原理与实践.pptx>) ### Chapter 5:Triton 快速入门 - [课时5.1-Triton技术定位与核心优势.pptx](<./chapter5/课时5.1-Triton技术定位与核心优势.pptx>) - [课时5.2-环境配置与第一个Triton内核.pptx](<./chapter5/课时5.2-环境配置与第一个Triton内核.pptx>) - [课时5.3-分块计算与矩阵乘法实现.pptx](<./chapter5/课时5.3-分块计算与矩阵乘法实现.pptx>) - [课时5.4-自动调优机制与性能对比.pptx](<./chapter5/课时5.4-自动调优机制与性能对比.pptx>) ### Chapter 6:TileLang 快速入门 - [课时6.1-TileLang核心原语与融合算子实现.pptx](<./chapter6/课时6.1-TileLang核心原语与融合算子实现.pptx>) ### Chapter 7:综合实战:大模型推理端到端算子优化 - [课时7.1-场景分析与瓶颈定位.pptx](<./chapter7/课时7.1-场景分析与瓶颈定位.pptx>) - [课时7.2-端到端优化与总结.pptx](<./chapter7/课时7.2-端到端优化与总结.pptx>) ## 使用建议 1. 先学习 Chapter 1 和 Chapter 2,建立大模型推理链路、算子分类和性能分析基础。 2. 再学习 Chapter 3 和 Chapter 4,进入 GEMM、Softmax、FlashAttention 等核心算子优化。 3. 继续学习 Chapter 5 和 Chapter 6,理解 Triton、TileLang 等算子开发工具的表达方式和适用边界。 4. 最后学习 Chapter 7,将单点算子优化方法放回端到端推理子图中验证整体收益。