斯坦福大学 CS336 Lecture 06 Kernel Optimization and Application of the Triton Framework
1.Review of GPUs
每个 Thread 独享一组 Register每个 Block 占有一块 shared_memory ( shared_memory 位于 SM 内部,但即使一个 SM 上被分配了多个 Block,这些 Block 之间也不能共享 shared_memory,所以一个 SM 内的多个 Block 之间的通信也…
2026/8/16 23:22:25