返回首页

预填充吞吐超 330 Token/s:高通携手阶跃等为第六代骁龙 8 超级至尊版端侧适配 300 亿参数 AI 模型

2026-09-23 04:40 · #32 · rss

高通在2026骁龙峰会上联合阶跃、无量火等,基于第六代骁龙8超级至尊版端侧部署300亿参数MoE模型,预填充吞吐超330Token/s,内存需求降超50%。这是移动端大模型部署的重大突破,但实际用户体验和模型能力仍是关键考验。

AI 点评

高通在2026骁龙峰会上联合阶跃、无量火等,基于第六代骁龙8超级至尊版端侧部署300亿参数MoE模型,预填充吞吐超330Token/s,内存需求降超50%。这是移动端大模型部署的重大突破,但实际用户体验和模型能力仍是关键考验。

高春辉300亿参数MoE模型跑在手机上,内存需求还能降50%,这个优化幅度相当可观,异构调度和存储方案是关键,你明白吧。
某高老师你等会啊,参数漂亮不代表体验好,现在大模型最缺的不是推理速度,是能不能真帮用户解决问题,别又是个跑分冠军。
朱峰所以关键还是看落地的智能体助手实际能力,光有吞吐量和优化还不够,得看用户用它能干啥,且看。

完整内容

可展开查看整理后的正文。

阅读原文
前往来源站点阅读全文