首页 / 资料库 / 文献详情

CUDA-NP: Realizing Nested Thread-Level Parallelism in GPGPU Applications

Yang Yun YiChao Li周辉阳

2015Acta Scientiarum Naturalium Universitatis SunyatseniComputer Science被引 1

出版方页面 →

摘要

平行程序与不同线级的并行(TLP ) 由代码节的系列组成。作为结果,在一个平行程序的一个线程例如在 CUDA 程序的一个 GPU 内核,仍然包含顺序的代码和平行的环,是相当普通的。为了利用如此的平行,循环,最近的开普勒·恩威迪亚体系结构介绍动态并行,它允许一个 GPU 线程开始另一个 GPU 内核,从而减少从一个中央处理器运行内核的开销。与动态并行,然而,一个父母线程能仅仅通过全球存储器与它的孩子线程交流,运行 GPU 内核的开销甚至在 GPU 以内是重要的。在这份报纸,我们首先学习包含这些基准没有的平行的环,和热点的一套 GPGPU 基准一个很高的环计数或 TLP 的高度。因而,用动态并行利用如此的平行的环的好处也被限制抵消它的开销。我们然后介绍我们的建议答案在 CUDA 利用嵌套的并行,叫作 CUDA-NP。与 CUDA-NP,当一个 GPU 程序开始时,我们开始启用线程的一个高数字,并且使用控制流动为不同代码节激活线程的不同数字。我们用一条基于指令的编译器途径实现我们的建议 CUDA-NP 框架。为一个 GPU 核,一个应用程序开发者仅仅需要为可并行化的代码节增加象 OpenMP 一样编译指示。然后,我们的 CUDA-NP 编译器自动地产生优化 GPU 内核。它支持减小和扫描原语,探索不同方法散布平行的环重复进线程,并且高效地管理在薄片上资源。我们的实验证明为一套 GPGPU 基准,它已经被优化了并且包含嵌套的并行,我们的建议 CUDA-NP 框架进一步平均到多达 6.69 次和 2.01 次改进表演。

引用本文(GB/T 7714)

Yang Yun Yi, Chao Li, 周辉阳. CUDA-NP: Realizing Nested Thread-Level Parallelism in GPGPU Applications[J]. Acta Scientiarum Naturalium Universitatis Sunyatseni, 2015.

引文网络

参考文献与被引分析加载中…

本站仅收录题录与摘要供学习参考,全文版权归属出版方;如有侵权请联系我们删除。