《电子技术应用》
您所在的位置:首页 > 通信与网络 > 业界动态 > 高通携手合作伙伴基于第六代骁龙8超级至尊版端侧落地MoE模型

高通携手合作伙伴基于第六代骁龙8超级至尊版端侧落地MoE模型

2026-09-23
来源:C114通信网
关键词: 高通 骁龙 MoE模型

9月23日消息,2026骁龙峰会期间,高通技术公司宣布携手阶跃、无量火与江波龙开展四方合作,基于第六代骁龙8超级至尊版移动平台,将阶跃StepEdge-Omni 30B-MoE(混合专家)模型面向端侧进行深度适配与推理优化,成功打造具备自主服务和个性化能力的端侧智能体助手。

第六代骁龙8超级至尊版移动平台搭载全新Qualcomm Oryon CPU、下一代Qualcomm Adreno GPU和重新设计的Qualcomm Hexagon NPU,并配备LPDDR6内存与高速存储通道,引领打造面向未来的智能体AI体验。

定制Qualcomm Oryon CPU峰值频率高达5GHz,并引入全新的可扩展缓存架构Qualcomm Oryon FlexCache,实现更加强大的智能体多任务处理和系统规划能力;Adreno GPU引入针对AI负载打造的Adreno Matrix Cores,并支持全新Adreno Neural Fusion特性,将AI和图形处理更加紧密结合;Hexagon NPU则面向智能体AI的Transformer工作负载引入全新的Element Accelerator,并将大容量共享内存扩容50%,实现端侧推理性能的进一步突破。

在此之上,无量火的自研Ember推理引擎与Ember Kernel端侧编排内核基于第六代骁龙8超级至尊版移动平台的强大AI性能基础和完整软件栈支持,以XCompute异构调度实现跨CPU/GPU/NPU的统一高性能编排,在不修改模型结构、不损失推理精度的前提下,使阶跃30B-MoE模型的运行内存需求相比行业常规方案降低超50%。

基于江波龙提供的端侧AI存储解决方案,模型权重可从端侧闪存高效加载,通过存储与计算协同减少大模型对运行内存的持续占用,进一步提升模型加载和运行效率,成功打造端侧智能体助手,实现从邮件理解到行程规划、日历同步、航班酒店推荐、行程分享到邮件草拟的全链路自主办公,全程本地完成,无需云端调用。

得益于NPU+GPU双引擎协同,模型预填充吞吐性能超过330Token/s,对比仅使用NPU的通用推理方案提升超过30%,解码吞吐性能超过28Token/s,并能保持持续稳定运行,且首个词元生成速率达到毫秒级,对比云端API调用快数倍至数十倍。

本次合作解决了大参数模型在端侧部署的关键行业痛点,让300亿参数量级模型具备在智能手机上规模部署的条件,将推动更加复杂的智能体AI体验落地智能手机,并利用端侧用户数据和平台能力实现更加个性化的智能体服务。

2.jpg

本站内容除特别声明的原创文章之外,转载内容只为传递更多信息,并不代表本网站赞同其观点。转载的所有的文章、图片、音/视频文件等资料的版权归版权所有权人所有。本站采用的非本站原创文章及图片等内容无法一一联系确认版权者。如涉及作品内容、版权和其它问题,请及时通过电子邮件或电话通知我们,以便迅速采取适当措施,避免给双方造成不必要的经济损失。联系电话:010-82306118;邮箱:aet@chinaaet.com。