基于算法稀疏性的卷积神经网络加速方法研究
所属分类:技术论文
上传者:wwei
文档大小:3479 K
标签: 寒武纪MLU 稀疏矩阵向量乘法 AdaSpConv
所需积分:0分积分不够怎么办?
文档介绍:尽管CNN经剪枝及ReLU激活后具有显著稀疏性可提升推理效率,但稀疏分布不规则易导致负载不均衡。此外,卷积与池化串行执行造成的访存带宽浪费限制了性能。为解决以上问题,提出一种稀疏CNN加速算法和卷积池化融合方法,并在寒武纪MLU上进行了验证。首先,设计基于CSR格式的自适应SpMV算法AdaSpConv,通过动态任务分配有效解决核心间负载均衡问题;其次,提出CSR-CP存储格式实现卷积与池化的算子融合,减少数据搬运并显著降低访存延迟。实验结果表明,在MLU370-S4平台上,AdaSpConv峰值性能达0.828 GFLOP/s,有效访存带宽达3.39 GB/s,性能显著优于Scalar、Vector及Adaptive算法;基于CSR-CP存储格式,VGG-16和ResNet-50的卷积运算较传统方法分别加速2.87倍和1.99倍。
现在下载
VIP会员,AET专家下载不扣分;重复下载不扣分,本人上传资源不扣分。