Nsight Compute 软件Source模块提供了精确到源代码行号的metrics参数,用于辅助性能调优,本篇基于访问共享内存的矩阵转置核函数的实现,记录一下对常用metrics含义的理解。
Metrics含义
Memory L1 Transcations Global:实际全局内存加载至L1缓存的内存交换次数,粒度128bytes
Memory L2 Transactions Global:实际全局内存加载至L2缓存的内存交换次数,粒度32bytes,该参数的值应该是Memory L1 Transcations Global 的4倍
Memory Ideal L2 Transactions Global:理论需要从全局内存加载至L2缓存的内存交换次数,当数值比Memory L2 Transactions Global小时,说明当前全局内存访问模式有效率问题
Memory L1 Transactions Shared:L1缓存与共享内存的数据交换次数,粒度32bytes
Memory Ideal L1 Transactions Shared:理论需要的L1缓存与共享内存的数据交换次数,当数值比Memory L1 Transactions Shared小时,说明存在Bank Conflict
代码实现
核函数执行配置
dim3 block(32, 32, 1);
dim3 grid(32, 32, 1);
无Bank Conflict的核函数,将共享内存设置为32 * 33,避免从共享内存写入全局内存时发生冲突,实现如下:
__global__ void kSMMatrixT(float* d_src,

本文通过矩阵转置核函数实例,介绍了Nsight Compute软件Source模块的metrics参数及其在GPU性能优化中的应用,特别是针对共享内存访问模式的有效性评估。

3411

被折叠的 条评论
为什么被折叠?



