面向边缘计算的YOLOv5s推理优化方法研究
集成电路应用
洪泽,高魏华
中国电子科技集团公司第五十八研究所
摘要: 由于边缘计算需求的激增,在资源受限的设备上实现高效的深度学习模型推理成为研究热点。该研究以瑞芯微RK3588芯片为实验平台,聚焦YOLOv5s模型的边缘端部署优化,通过模型量化、激活函数优化及精度分析等手段,解决边缘设备部署中的推理效率低、计算冗余和内存瓶颈等问题。实验结果表明,使用三个神经网络处理单元进行多线程调度推理,优化后的模型推理速度高达80帧/秒,为边缘端的模型部署提供了参考方案。
中图分类号:TP391.41文献标识码:ADOI:10.19339/j.issn.1674-2583.2026.04.010
中文引用格式:洪泽,高魏华. 面向边缘计算的YOLOv5s推理优化方法研究[J].集成电路应用,2026,43(4):55-59.
英文引用格式:Hong Ze,Gao Weihua. Research on inference optimization methods for YOLOv5s in edge computing[J].Application of IC,2026,43(4):55-59.
中文引用格式:洪泽,高魏华. 面向边缘计算的YOLOv5s推理优化方法研究[J].集成电路应用,2026,43(4):55-59.
英文引用格式:Hong Ze,Gao Weihua. Research on inference optimization methods for YOLOv5s in edge computing[J].Application of IC,2026,43(4):55-59.
Research on inference optimization methods for YOLOv5s in edge computing
Hong Ze,Gao Weihua
No.58 Research Institute,China Electronics Technology Group Corporation
Abstract: With the surging demand for edge computing, achieving efficient deep learning model inference on resource-constrained devices has become a research hotspot. Based on the Rockchip RK3588 chip as the experimental platform, this research focuses on the optimization of YOLOv5s model deployment on the edge end. Through model quantization, activation function optimization, and accuracy analysis, it addresses issues such as low inference efficiency, computational redundancy, and memory bottlenecks in edge deployment. The experiments show that with three Neural Processing Units (NPUs) for multi-threaded scheduling inference, the optimized model achieves an inference speed of up to 80 frames/s, providing a reference solution for model deployment on the edge end.
Key words : Key words:RK3588; YOLOv5s; edge deployment; NPU
引言
近年来,随着物联网和人工智能技术的深度融合,边缘计算因其低延迟、高隐私性和带宽效率的优势,成为推动实时智能应用落地的关键技术。然而,边缘设备的资源受限特性(如有限的计算能力、内存容量和能耗约束)对深度学习模型的部署提出了严峻挑战。在保证模型精度的同时,又能实现高效推理成为了新的关注焦点[1-3]。随着深度学习的发展,卷积层计算密集性、激活函数复杂度及内存访问效率等问题依然是模型部署在边缘设备上的难题。卞紫阳等人(2023)基于RK3588部署了跨模态行人重识别算法[4],刘鹏等人(2024)基于RK3588完成了YOLOv8n模型的适配,性能达到70帧/秒左右[5]。陈志文等人(2024)基于Jetson Xavier NX完成了YOLOv5s的移植,但是帧识别率只有30帧/秒左右[6];孙杰等人(2023)基于Sophon SC5+芯片构架完成了YOLOv5s的移植[7]。
本文以轻量级目标检测的代表YOLOv5s模型为例,基于RK3588芯片平台,完成了面向YOLOv5s模型的端到端优化研究。通过模型量化、激活函数轻量化重构等方法,降低模型的内存占用及计算复杂度[8-11]。进一步地,设计了多线程任务调度机制,充分利用RK3588的三个NPU核心实现并行推理。实验结果表明,优化后的模型推理速度达到80帧/秒,中大型目标检测精度符合轻量级模型预期,为边缘端安防及交通领域提供了高效的解决方案。
本文详细内容请下载:
http://www.chinaaet.com/resource/share/2000007264
投稿邮箱:ICAPP@belling.com.cn
作者信息:
洪泽,高魏华
(中国电子科技集团公司第五十八研究所,江苏无锡214035)

此内容为AET网站原创,未经授权禁止转载。
