2026 年 9 月 22 日骁龙峰会期间,高通宣布联合阶跃、无量火与江波龙,基于第六代骁龙 8 超级至尊版移动平台,把阶跃的 StepEdge-Omni 30B-MoE 模型做端侧适配与推理优化,打造可在手机本地运行的智能体助手。MoE 架构只按任务需要激活部分专家模块,配合无量火的 Ember 推理引擎与 XCompute 异构调度,让一个 300 亿参数的模型在终端稳定跑起来。这件事对 Agent 赛道的意义,不在于又一款端侧模型发布,而在于它把「智能体助手」从必须连云,推进到了可以全程在设备本地完成。

把 300 亿参数「搬」进手机意味着什么

过去端侧能跑的大模型,参数规模普遍偏小,承担的多是翻译、摘要这类轻任务;真正能办事的智能体,往往要回云端调用大模型。高通这次演示的组合是:阶跃提供 30B-MoE 模型,无量火提供 Ember 推理引擎与端侧编排内核,江波龙提供端侧 AI 存储方案,三方在第六代骁龙 8 平台上协同优化。它的直接效果是,邮件理解、行程规划、日历同步、航班酒店推荐、邮件草拟这类智能体任务,可以在手机本地闭环完成,不再每次都把数据送上云端。对隐私敏感的场景,这不只是一点速度优势,而是把数据留在设备端这一前提本身。

把 300 亿参数的智能体,从云端搬到手机里 模型 阶跃 StepEdge Omni 30B-MoE 混合专家架构 引擎与调度 无量火 Ember XCompute 异构 跨 CPU/GPU/NPU 端侧存储 江波龙方案 权重闪存直载 算存协同 本地 智能体 助手 落地平台:第六代骁龙 8 超级至尊版(Oryon CPU 5GHz / Adreno GPU / Hexagon NPU) 端侧智能体助手覆盖:邮件理解、行程规划、日历同步、航班酒店推荐、邮件草拟 全程本地完成,无需调用云端 API
图 1|30B MoE 模型借助推理引擎与异构调度在手机本地运行,把智能体助手从云端拉到设备端

值得强调的是,MoE 是关键。稠密模型每次推理都要激活全部参数,300 亿参数放在手机里几乎不可行;MoE 按任务只点亮相关专家,每次生成一个词元大约只激活约 30 亿参数,把实际计算负载和内存带宽需求压了下来。配合 NPU 与 GPU 双引擎协同,预填充吞吐超过 330 Token/s,首词元生成即达毫秒级,比云端 API 调用快数倍到数十倍。

内存砍掉一半多,才谈得上日常可用

光「能跑」不够,要「日常用」得起来,门槛在内存与功耗。合作方通过推理引擎、异构调度与存储方案的联合优化,使模型运行时的内存需求较行业常规方案降低超过 50%,在高端内存成本居高不下的当下,这一数字让大参数 MoE 在端侧的规模化部署从设想变成可演示的现实。对终端厂商而言,这意味着可以把一个像样的智能体助手,作为旗舰手机的卖点而非噱头;对模型厂商而言,则多了一条绕开云端推理成本与隐私质疑的落地路径。

端侧智能体助手能干什么

从现场演示看,这套端侧方案覆盖的是一组高频、低风险的个人效率任务:理解邮件、规划行程、同步日历、推荐航班与酒店、草拟回信。它们共同的特点是步骤清晰、容错空间大、失败后果轻——即便智能体理解偏了,用户也能快速发现并纠正。正因如此,这类任务适合先在端侧跑,而不是一上来就交给云端智能体去操作高敏感动作。它也顺带回答了「端侧智能体到底能帮什么忙」这个长期含糊的问题:先把个人效率场景吃透,再谈更复杂的跨应用操作。

为什么这件事对 Agent 赛道有信号意义

把视野拉到整个 Agent 赛道,端侧智能体代表了和云端智能体不同的取向。云端智能体的瓶颈是延迟、成本与隐私边界;端侧智能体的瓶颈是算力、内存与功耗。高通这套方案把前者的一部分压力转移到设备层,让「低时延、隐私保护、离线可用」成为端侧智能体的天然标签。它未必会替代云端智能体,但会逼着云端方案重新证明自己「为什么必须上云」。对于已经被云端 API 账单压得喘不过气的开发者,端侧跑一部分任务,本身就是一种成本结构的解放。

几个硬指标,说明这不是「能跑」而是「能日常用」 内存 -50%+ 运行内存需求 较行业常规方案 大参数 MoE 可部署 330+ / 28+ Token/s 预填充 / 解码吞吐 首词元毫秒级 比云端 API 调用快数倍 数据来自高通与合作伙伴在 2026 骁龙峰会的演示与披露,属工程演示口径 端侧方案的真实规模化,仍取决于终端成本、功耗与模型可靠性
图 2|内存与吞吐指标让端侧智能体从「演示可跑」迈向「日常可用」,但规模落地仍看功耗与成本

仍要冷静看的边界

也要客观看待:这是一次工程演示口径的发布,真实规模化仍取决于终端成本、功耗、模型可靠性与用户接受度。300 亿参数的 MoE 即便端侧可跑,也会吃掉可观的电量与内存,在主流价位机型上的体验如何,还需要真机验证。此外,端侧智能体目前覆盖的仍是个人效率场景,离「跨应用自主操作」仍有距离。对行业而言,这次发布的价值是打开了一扇门——证明大参数智能体助手可以离开云端;但门后的路能走多宽,还要看接下来一年终端与模型的协同进度。目前官方及行业暂未披露更多细节,后续将持续跟进迭代动态。