2026 年 9 月 22 日骁龙峰会期间,高通宣布联合阶跃、无量火与江波龙,基于第六代骁龙 8 超级至尊版移动平台,把阶跃的 StepEdge-Omni 30B-MoE 模型做端侧适配与推理优化,打造可在手机本地运行的智能体助手。MoE 架构只按任务需要激活部分专家模块,配合无量火的 Ember 推理引擎与 XCompute 异构调度,让一个 300 亿参数的模型在终端稳定跑起来。这件事对 Agent 赛道的意义,不在于又一款端侧模型发布,而在于它把「智能体助手」从必须连云,推进到了可以全程在设备本地完成。
把 300 亿参数「搬」进手机意味着什么
过去端侧能跑的大模型,参数规模普遍偏小,承担的多是翻译、摘要这类轻任务;真正能办事的智能体,往往要回云端调用大模型。高通这次演示的组合是:阶跃提供 30B-MoE 模型,无量火提供 Ember 推理引擎与端侧编排内核,江波龙提供端侧 AI 存储方案,三方在第六代骁龙 8 平台上协同优化。它的直接效果是,邮件理解、行程规划、日历同步、航班酒店推荐、邮件草拟这类智能体任务,可以在手机本地闭环完成,不再每次都把数据送上云端。对隐私敏感的场景,这不只是一点速度优势,而是把数据留在设备端这一前提本身。
值得强调的是,MoE 是关键。稠密模型每次推理都要激活全部参数,300 亿参数放在手机里几乎不可行;MoE 按任务只点亮相关专家,每次生成一个词元大约只激活约 30 亿参数,把实际计算负载和内存带宽需求压了下来。配合 NPU 与 GPU 双引擎协同,预填充吞吐超过 330 Token/s,首词元生成即达毫秒级,比云端 API 调用快数倍到数十倍。
内存砍掉一半多,才谈得上日常可用
光「能跑」不够,要「日常用」得起来,门槛在内存与功耗。合作方通过推理引擎、异构调度与存储方案的联合优化,使模型运行时的内存需求较行业常规方案降低超过 50%,在高端内存成本居高不下的当下,这一数字让大参数 MoE 在端侧的规模化部署从设想变成可演示的现实。对终端厂商而言,这意味着可以把一个像样的智能体助手,作为旗舰手机的卖点而非噱头;对模型厂商而言,则多了一条绕开云端推理成本与隐私质疑的落地路径。
端侧智能体助手能干什么
从现场演示看,这套端侧方案覆盖的是一组高频、低风险的个人效率任务:理解邮件、规划行程、同步日历、推荐航班与酒店、草拟回信。它们共同的特点是步骤清晰、容错空间大、失败后果轻——即便智能体理解偏了,用户也能快速发现并纠正。正因如此,这类任务适合先在端侧跑,而不是一上来就交给云端智能体去操作高敏感动作。它也顺带回答了「端侧智能体到底能帮什么忙」这个长期含糊的问题:先把个人效率场景吃透,再谈更复杂的跨应用操作。
为什么这件事对 Agent 赛道有信号意义
把视野拉到整个 Agent 赛道,端侧智能体代表了和云端智能体不同的取向。云端智能体的瓶颈是延迟、成本与隐私边界;端侧智能体的瓶颈是算力、内存与功耗。高通这套方案把前者的一部分压力转移到设备层,让「低时延、隐私保护、离线可用」成为端侧智能体的天然标签。它未必会替代云端智能体,但会逼着云端方案重新证明自己「为什么必须上云」。对于已经被云端 API 账单压得喘不过气的开发者,端侧跑一部分任务,本身就是一种成本结构的解放。
仍要冷静看的边界
也要客观看待:这是一次工程演示口径的发布,真实规模化仍取决于终端成本、功耗、模型可靠性与用户接受度。300 亿参数的 MoE 即便端侧可跑,也会吃掉可观的电量与内存,在主流价位机型上的体验如何,还需要真机验证。此外,端侧智能体目前覆盖的仍是个人效率场景,离「跨应用自主操作」仍有距离。对行业而言,这次发布的价值是打开了一扇门——证明大参数智能体助手可以离开云端;但门后的路能走多宽,还要看接下来一年终端与模型的协同进度。目前官方及行业暂未披露更多细节,后续将持续跟进迭代动态。