《电子技术应用》
您所在的位置:首页 > 人工智能 > 设计应用 > 全国产异构架构的智能算力平台设计与实现
全国产异构架构的智能算力平台设计与实现
集成电路应用
刘尧堂
上海柏飞电子科技有限公司
摘要: 随着人工智能技术在国防与高端装备领域的深入应用,智能算力平台的自主安全成为关键。该研究基于全国产化器件,设计并实现了一款高带宽、高性能的异构架构智能算力平台,核心部件包括飞腾S5000C32处理器、天数智芯MRV100 GPU、中科腾龙TL62048 PCIe Switch及复旦微JFMVU9P FPGA。平台用FPGA实现了100G网络RDMA以及数据从FPGA到GPU的直接传输。实测表明,FPGA与GPU间数据传输带宽达98 Gbps,延时低至7.6 μs。该平台已在某设备中完成验证,具备良好的抗冲击、抗振动及环境适应性,为实现高安全等级智能计算系统提供了自主安全的技术路径。
中图分类号:TP302文献标识码:ADOI:10.19339/j.issn.1674-2583.2026.02.012
中文引用格式:刘尧堂. 全国产异构架构的智能算力平台设计与实现[J].集成电路应用,2026,43(2):65-70.
英文引用格式:Liu Yaotang. Design and implementation of a fully domestic heterogeneous intelligent computing platform[J].Application of IC,2026,43(2):65-70.
Design and implementation of a fully domestic heterogeneous intelligent computing platform
Liu Yaotang
Shanghai Prophet Electronic Technology Co., Ltd.
Abstract: With the deep integration of artificial intelligence technologies into national defense and high-end equipment sectors, the autonomous security of intelligent computing platforms has become critical. This paper presents the design and implementation of a high-bandwidth, high-performance heterogeneous intelligent computing platform based on domestically produced components. The core components include the Phytium S5000C-32 processor, Tianshu Zhixin MR-V100 GPU, Zhongke Tenglong TL62048 PCIe Switch, and Fudan Micro JFMVU9P FPGA. The platform utilizes the FPGA to implement 100G RDMA over Ethernet and direct data transfer from the FPGA to the GPU. Experimental results show that the data transfer bandwidth between the FPGA and GPU reaches 98 Gbps, with a latency as low as 7.6 μs. The platform has been validated in equipment, demonstrating excellent shock resistance, vibration resistance, and environmental adaptability, thereby providing an autonomous and safe technical path for high-security-level intelligent computing systems.
Key words : fully domestic; heterogeneous; intelligent computing platform; RDMA

引言

随着人工智能技术的快速发展,其在军工领域的应用需求呈现爆发式增长。雷达信号处理、目标识别、自动化控制等典型应用场景对算力平台的性能要求日益提高。与此同时,国际形势变化使得核心器件国产化成为国家战略需求,实现算力平台软硬件全国产化已成为特种设备发展的必然趋势。

然而,国产算力平台在国产化过程中面临诸多技术挑战:一是国产CPU、GPU、FPGA等核心器件性能与进口产品存在差距;二是异构器件间高速互联技术复杂,数据带宽和延迟难以满足实时处理需求;三是加固抗恶劣环境设计与高性能之间存在矛盾。如何在保证100%国产化的前提下,实现高数据带宽、高处理性能和可恶劣环境工作,成为亟待解决的关键技术问题。

国外在高性能算力平台方面技术较为成熟,异构计算平台已实现CPU+GPU+FPGA的深度集成[1],支持PCIe 4.0/5.0高速互联,内存带宽可达2 TB/s以上。但此类平台核心器件完全依赖进口,存在供应链安全风险,且无法满足特种行业领域加固抗恶劣环境要求。

国内国产化算力平台研究起步较晚,但发展迅速。飞腾、华为、龙芯等国产CPU已实现规模化应用;天数智芯、华为昇腾、寒武纪等国产GPU/NPU在AI算力方面取得突破;复旦微电、安路科技等国产FPGA在高速接口领域逐步成熟。然而,现有国产算力平台多采用CPU通过PCIe分别扩展万兆网卡和GPU方式。该方式进行数据传输时,CPU占用率高;数据到GPGPU时数据需经CPU中转,存在带宽瓶颈和延迟问题,难以满足特种行业领域高实时性要求。

针对上述问题,本文设计并实现了一款基于全国产异构架构的智能算力平台,主要创新工作如下:

(1)全国产异构架构设计:采用飞腾S5000C-32核CPU[2]、天数智芯MRV100 GPU[3]和复旦微JFMVU9P FPGA,实现核心器件100%国产化。

(2)FPGAGPU P2P直传技术:通过PCIe Switch实现FPGA与GPU间直接数据通路[4],数据不经过CPU内存中转,延迟降低34%以上,CPU负载降低60%以上。

(3)基于FPGA的100 G RDMA实现:在FPGA上实现RoCEv2协议栈[5],支持100 G网络下98 Gbps有效带宽,实现远程直接内存访问。

(4)加固抗恶劣环境设计:采用板贴内存、加固连接器、宽温器件等措施,满足车载、船舶等严苛环境使用要求。


本文详细内容请下载:

https://www.chinaaet.com/resource/share/2000007188


投稿邮箱:ICAPP@belling.com.cn


作者信息:

刘尧堂

(上海柏飞电子科技有限公司,上海200233)

2.jpg

此内容为AET网站原创,未经授权禁止转载。