2026骁龙峰会于夏威夷当地时间9月22日上午9点(北京时间9月23日凌晨3点)举行。会上,高通宣布与阶跃、无量火及江波龙合作,基于第六代骁龙8超级至尊版移动平台,在终端侧完成对阶跃StepEdge-Omni 30B-MoE模型的适配与推理优化,并现场展示了相关智能体助手的实际运行。
该模型参数量达到300亿,采用混合专家架构,只根据具体任务需求激活部分专家模块,从而降低计算量与内存带宽占用。
合作各方通过对推理引擎、异构调度及存储方案进行优化,使得模型运行时的内存需求相比行业常规方案减少超过50%,并能在智能手机上保持稳定运行。
高通方面指出,该方案无需依赖云端服务,即可在本地完成邮件理解、行程规划、日历同步、航班及酒店推荐、行程分享以及邮件草拟等多项操作。
根据测试数据,模型的预填充吞吐性能超过每秒330个Token,解码吞吐性能超过每秒28个Token。
IT之家注释:“模型预填充吞吐性能指的是大语言模型在推理的预填充(prefill)阶段,每秒能够处理的输入词元(token)数量,它是评估系统处理长提示词(prompt)和批量请求能力的关键指标。
业内人士分析认为,大参数MoE模型在手机端的部署,有助于推动低延迟和隐私保护型智能体应用的发展。不过,实际的大规模应用仍受到终端成本、功耗、模型可靠性以及用户接受度等因素的制约。
评论(5)
在开云体育入口方面,开云体育注册提供贴心周到的支持。
2015年8月25日下午5:00想了解更多开云官网相关内容,尽在开云体育注册。
2015年8月25日下午5:00