《电子技术应用》
您所在的位置:首页 > 模拟设计 > 设计应用 > 面向ARM架构的Ewald算法性能优化研究
面向ARM架构的Ewald算法性能优化研究
电子技术应用
萨智化1,高萍1,2,段晓辉1,2,刘卫国1,2
1.山东大学 软件学院; 2.国家超级计算无锡中心
摘要: 长程静电相互作用的高效求解是分子动力学(Molecular Dynamics, MD)模拟中的关键问题,特别是在带电体系中对计算性能影响显著。Ewald算法适用于中小规模体系与高精度场景。基于ARM架构,对Ewald算法进行了系统优化,包括线性化重构关键数据结构、倒易空间计算的手动向量化、向量化版本的三角函数、优化线程并行策略等方案。实验结果显示,在单核条件下,实现约2.65倍加速,并在不同精度设置及跨平台测试中保持良好性能提升。在多核条件下,相较原生OpenMP实现,优化版本表现出更优的扩展效率与整体性能,在8线程时可以达到86.2%的效率和4.57倍的加速。研究验证了Ewald算法在新型向量化架构上的优化潜力,为相关算法在相关处理器上的高效实现提供了参考。
中图分类号:TP391 文献标志码:A DOI: 10.16157/j.issn.0258-7998.257564
中文引用格式: 萨智化,高萍,段晓辉,等. 面向ARM架构的Ewald算法性能优化研究[J]. 电子技术应用,2026,52(8):1-7.
英文引用格式: Sa Zhihua,Gao Ping,Duan Xiaohui,et al. Performance optimization of the Ewald algorithm on ARM architectures[J]. Application of Electronic Technique,2026,52(8):1-7.
Performance optimization of the Ewald algorithm on ARM architectures
Sa Zhihua1,Gao Ping1,2,Duan Xiaohui1,2,Liu Weiguo1,2
1.School of Software, Shandong University;2.National Supercomputing Center in Wuxi
Abstract: Efficient evaluation of long-range electrostatic interactions is a critical issue in molecular dynamics (MD) simulations, particularly in charged systems where it significantly affects computational performance. The Ewald algorithm is well suited for small to medium-scale systems and high-accuracy scenarios. In this work, we systematically optimize the Ewald algorithm on ARM architectures, including linearized reconstruction of key data structures, manual vectorization of reciprocal-space calculations, vectorized trigonometric functions, and an optimized thread-parallel execution strategy. Experimental results demonstrate an acceleration of approximately 2.65× speedup under single-core conditions, with consistently strong performance across different precision settings and cross-platform tests. Under multi-core conditions, the optimized version shows superior scalability and overall performance compared with the native OpenMP implementation, achieving 86.2% efficiency and 4.57× speedup with 8 threads. This study verifies the optimization potential of the Ewald algorithm on emerging vector architectures and provides a useful reference for the efficient implementation of related algorithms on such processors.
Key words : molecular dynamics simulation;high performance computing;LAMMPS;Ewald;ARM

引言

分子动力学(Molecular Dynamics, MD)模拟是一种重要的计算研究方法,已广泛应用于物理、化学、生物学、生物工程、材料科学及医学等诸多领域,为理解复杂体系的微观机制提供了重要手段。根据最新统计数据,截至2023年,全球分子建模市场规模约为70.7亿美元,预计到2031年将增长至199亿美元[1],这一趋势充分表明分子模拟技术在科学研究与工业应用中的战略地位正在持续提升。

开源软件LAMMPS(Large-scale Atomic/Molecular Massively Parallel Simulator)以其高效的并行计算能力、灵活的力场扩展性与模块化架构[2],成为国际主流的MD模拟工具之一。LAMMPS支持多种短程和长程相互作用算法,尤其适用于复杂分子体系和离子溶液的高精度模拟。

在带电体系的MD计算中,库仑相互作用因其典型的长程特性成为主要的计算瓶颈。其精确求解直接影响体系的结构稳定性、动力学演化及能量分布,尤其在高离子强度或强极性体系中,长程静电作用的计算精度决定了模拟结果的可靠性。因此,发展高效且高精度的长程相互作用计算算法,一直是MD领域的重要研究方向[3]。

长程库仑相互作用是带电体系中的主要计算瓶颈,其精确求解直接影响体系结构和动力学演化。早期MD模拟常采用“截断法”[4],但容易产生显著误差。Ewald求和法及其基于FFT的改进方法,如PPPM[5-8],显著降低了计算复杂度,实现了大体系的高效模拟。近年来,结合机器学习的变种方法进一步提升了建模精度[9-11]。

尽管如此,面对各类新兴高效算法的涌现与挑战,Ewald求和方法凭借严格的数学形式及高精度求解能力,在中小规模MD模拟中仍被视为“标准方法”。特别是在生物大分子动力学、电解质界面结构与凝聚态体系等需要原子级精度的研究中,Ewald方法依然被广泛应用,并持续作为算法对比基准[12]。

目前,在短程相互作用方面,已有大量研究从算法和实现层面对性能进行了优化。Duan和Gao等人通过设计基于向量宽度的簇聚合方案,优化数据局部性与内存访问模式,将原本以原子为单位的计算重构为以向量宽度对齐的批量计算形式,同时设计了更优的多线程更新方案,显著提升了邻接表构建与受力计算的性能[13-15];Höhnerbach等人针对Tersoff势和AIREBO势提出了基于硬件抽象的向量化方案,分别实现了3~5倍和3~4倍的加速[16-17]。同时,在其他应用领域如矩阵计算中,也有研究专门利用向量化指令集进行优化。通过矩阵块划分、循环展开和数据对齐,将矩阵乘法、稀疏矩阵乘法以及线性代数核函数改造为向量宽度对齐的批量操作,显著提升了浮点运算吞吐率和缓存利用效率[18-19]。相比之下,针对长程静电作用的优化研究相对较少。现有方法多从算法层面降低复杂度,而针对Ewald倒易空间计算内核的细粒度向量化以及面向具体处理器的优化仍缺乏系统研究。随着ARM新一代向量化指令集出现,算术强度较高的实空间相互作用计算和倒易空间计算的优化潜力正在被激活[20]。


本文详细内容请下载:

https://www.chinaaet.com/resource/share/2000007201


作者信息:

萨智化1,高萍1,2,段晓辉1,2,刘卫国1,2

(1.山东大学 软件学院,山东 济南 250101;

2.国家超级计算无锡中心,江苏 无锡 214072)

2.jpg

此内容为AET网站原创,未经授权禁止转载。