Luo, Weile; Fan, Ruibo; Li, Zeyu; Du, Dayou; Wang, Qiang; Chu, Xiaowen (2024). “Benchmarking and Dissecting the Nvidia Hopper GPU Architecture”. arXiv:2402.13499v1 [cs.AR].
Sun, Wei; Li, Ang; Geng, Tong; Stuijk, Sander; Corporaal, Henk (2023). 《Dissecting Tensor Cores via Microbenchmarks: Latency, Throughput and Numeric Behaviors》. 《IEEE Transactions on Parallel and Distributed Systems》34. 246–261쪽. arXiv:2206.02874. doi:10.1109/tpds.2022.3217824. S2CID249431357.
Raihan, Md Aamir; Goli, Negar; Aamodt, Tor (2018). “Modeling Deep Learning Accelerator Enabled GPUs”. arXiv:1811.08309 [cs.MS].
Jia, Zhe; Maggioni, Marco; Smith, Jeffrey; Daniele Paolo Scarpazza (2019). “Dissecting the NVidia Turing T4 GPU via Microbenchmarking”. arXiv:1903.07486 [cs.DC].
Jia, Zhe; Maggioni, Marco; Staiger, Benjamin; Scarpazza, Daniele P. (2018). “Dissecting the NVIDIA Volta GPU Architecture via Microbenchmarking”. arXiv:1804.06826 [cs.DC].
Jia, Zhe; Maggioni, Marco; Smith, Jeffrey; Daniele Paolo Scarpazza (2019). “Dissecting the NVidia Turing T4 GPU via Microbenchmarking”. arXiv:1903.07486 [cs.DC].
참고: Jia, Zhe; Maggioni, Marco; Smith, Jeffrey; Daniele Paolo Scarpazza (2019). “Dissecting the NVidia Turing T4 GPU via Microbenchmarking”. arXiv:1903.07486 [cs.DC].에서는 SM 파티션당 2 KiB L0 명령어 캐시와 SM당 16 KiB L1 명령어 캐시라고 주장하며 이와 불일치함