摘要:提出一种基于矩阵转换的高效卷积计算优化方法MCFA。根据输出矩阵的宽度和卷积核大小对输入矩阵进行分块,通过im2col方法转换输入矩阵子块和核函数矩阵,利用计算统一设备架构中封装的矩阵-矩阵乘法加速库提升卷积计算的速度。在此基础上,将输出子块按序排列,最终得到完整的输出矩阵。实验结果证明,该方法相比im2col方法能节省61.25 %的计算空间,相比MEC方法能提高20.57 %的计算速度,且在分块情况下可以缓解大输入矩阵引起的缓存压力,提高缓存利用率。
注:因版权方要求,不能公开全文,如需全文,请咨询杂志社