把一年的主线押在智能体上
9 月 17 日,第十一届华为全联接大会在上海开幕。华为副董事长、轮值董事长汪涛的主题演讲题为「智启新未来,打造智能世界的硅基黑土地」,围绕 AI 基础设施展开,给出七大战略方向。
演讲里的三组刻度比战略表述更能说明它想解决什么问题:模型参数规模已经从千亿级走到十万亿级,目标是 2030 年超过一百万亿;智能体任务完成时长从「月级」压缩到「分钟级」,而连续工作时长从小时级走向以月为单位;全国日均推理 Token 消耗在 500 万亿左右,2030 年的预期是百万万亿级。
三组刻度指向同一个判断:负载的性质变了。参数规模决定的是训练侧的压力,而智能体的连续工作时长与推理 Token 量决定的是推理侧的形态——请求更碎、状态更长、单位时间内的并发更多。这三点恰好都是传统服务器架构不擅长的。
四处为智能体调的参数
真正落到工程上的东西,集中在超节点与集群这一层。翻完整场发布,与智能体负载直接相关的调整有四处。
其一是沙箱。鲲鹏超节点基于灵衢全光组网,最大支持 4096 节点,形成 256TB 的统一内存池。官方给出的对照是:在 Agent 沙箱场景下,十万级别沙箱的启动相比传统服务器方案提升 30 倍,沙箱密度还可以再提升 25%。
这一条对应的负载特征很具体。智能体的每一次工具调用通常需要隔离环境,如果每个任务都要新建沙箱,沙箱的启动速度就成了整个流程的节拍器。把沙箱从「按需创建」改成「常备待命」,省下的是用户感知不到的等待,却是成本曲线上的主要项。
其二是向量检索。官方称在百亿千维的复杂向量检索场景下,检索效率相比传统服务器实现倍增。这一条对应的是长任务里的记忆调用——智能体每走一步都要回查历史与知识库,检索的延迟会在几十上百步里被反复放大。
其三是缓存与记忆存储。华为推出了基于灵衢 UnifiedBus 的 AI 记忆存储 OceanStor M900,定位是 L3.5 层的 PB 级 KV 缓存集群,用于承载 Agent 与长序列所需的多层次 KV Cache。官方还提到它采用混合介质加优化的保留算法,把 SSD 读写寿命提升 16 倍。这条对应的是长上下文场景下缓存反复落盘对存储寿命的消耗——这是长任务才暴露出来的成本,短请求看不出来。
其四是互联。基于灵衢 UnifiedBus,昇腾超节点、鲲鹏超节点与 KV 缓存集群之间可以平等互联,多协议统一成一种,减少协议转换开销。通过二层 CLOS 四平面组网,最大集群规模可达 51.2 万卡,结合多轨道拓扑可支持百万卡规模的超节点集群。
为什么是「超节点」这个词
要理解这些数字,得先说清超节点是什么。
简单讲,超节点就是把多个计算节点用高带宽互联紧连起来,具备跨物理节点的统一内存编址能力,逻辑上像一台计算机。它要解决的是一个具体问题:十万卡规模的集群里,节点间通信会吃掉训练时间的 40% 以上,模型浮点算力利用率被严重制约。华为马尔可夫实验室的仿真给出的对照是:由 4K 超节点组成的十万卡集群,相比由 8 卡服务器组成的十万卡集群,浮点算力利用率提升 2.75 倍。
芯片侧这次发布的是采用近封装光学技术的昇腾 960 超节点:单个超节点 4096 卡,最大提供 8E FP8 的算力与 1PB 的 HBM 容量;用 5500 个近封装光学模块替代原本需要的 4.8 万颗 800G 光模块,降低超过 550 千瓦功耗,系统无故障运行时间提升一倍,可用度达到 99.8%。按现场说法,960DT 的进度比原计划提前三个季度,2027 年一季度就绪。
生态侧的数字同样被摆了出来:鲲鹏全球开发者超过 416 万,合作伙伴超过 7200 家,支持 560 多个全球开源项目;CANN 进入常态化开源社区运营,外部开发者占比达到 61%,社区月活开发者突破 5200 名;昇腾覆盖 90 多个主流三方社区。
同一场大会上的另一条线
除了算力底座,这场大会还发布了一条更靠近应用侧的产品线:华为计算联合 openJiuwen 社区推出基于九问的一体机开源 Agent 加速平台与解决方案,内置 SystemAgent,并宣称实现小时级的企业端到端私有化部署。
公开信息里提到的能力包括:平台全面开源,开放 Plugin、Skill、MCP、Channel、RAG、Database、Agent 等接入方式;具备原生多租户安全与独立沙箱隔离;官方称任务执行效率提升 50%。平台依托 JiuwenAgentOS 构建,定位是让伙伴基于它打造行业智能体一体机。
把这条线放在算力侧旁边看,逻辑就比较完整了:下面提供沙箱、缓存与检索的硬件基础,上面提供一个开箱的开源运行时,中间那一层留给伙伴做行业化。这是一种分工设计,而不是把整件事收在自己手里。
哪些是自述,哪些还需要验证
这批数字的口径需要分清楚。
「沙箱启动提升 30 倍」「检索效率倍增」「SSD 寿命提升 16 倍」「任务执行效率提升 50%」都是厂商在现场给出的对照值,对照基线是传统服务器方案,具体的测试条件、数据集与复现方法没有同步公开。30 倍这类倍数在有明确基线时很有说服力,在没有基线定义时只能当作方向。
「占空比」「智能体以月为单位执行任务」这类目标性表述,衡量方式尚未定义。连续工作一个月意味着系统要能跨越模型版本更新、依赖变更与数据漂移,这些场景目前缺少公认的评测方法。
另有一条需要标注来源的消息:多家外媒报道称,DeepSeek 计划采购至少 16 万颗昇腾 950DT 芯片,用于内蒙古新建的数据中心,以推理场景为主,芯片预计四季度出货。这条属于媒体报道,尚未获得官方确认,与本次大会发布无直接关联。
对做企业智能体的人意味着什么
这场发布里最实用的信息不是集群规模,而是它选择优化的三个点:沙箱启动、向量检索、长序列缓存。
这三点恰好是可以直接拿来检查自己系统的清单。沙箱是不是每个任务都新建、启动耗时占整个任务的比例是多少;检索是在每步调用还是批量预取;长任务的缓存策略有没有考虑持久化带来的存储寿命成本。这三个问题都跟模型选型无关,属于纯工程账,而且都可以在自己的环境里量化。
另一个值得留意的是交付形态。当硬件厂商把运行时一并开源、把行业化留给伙伴时,企业采购的比价对象就不再只是算力,而是「一套能跑起来的组合」。这对集成商是机会,对只看单卡价格的采购方是一个需要重新建模的口径变化。
目前官方及行业暂未披露更多细节,后续将持续跟进迭代动态。