算力竞赛的另一条战线

当行业的目光集中在数据中心里成千上万张 GPU 组成的超大集群时,日本神奈川的 fabless 芯片公司 EdgeCortix 在 9 月 24 日发布了面向另一端的答案:可扩展 AI 芯粒平台 RAIDEN,定位是 Physical AI——机器人、航天防务设备、工业边缘服务器这类部署在数据中心之外、靠近传感器与机械本体的智能系统。

公司给出的出发点是一个系统问题:要让机器完成感知、推理与行动,光堆 AI 加速器不够——算力、内存容量、内存带宽、互联带宽与软件栈必须同步扩展,而且随着模型与应用负载的演进持续扩展。在功耗、体积与散热都受硬约束的边缘环境里,这组矛盾比数据中心更尖锐。

一套架构,三档配置

RAIDEN 的做法是芯粒化:单芯粒 X1、双芯粒 X2 与旗舰四芯粒 X4 三档配置,全部基于同一代 DNA-X 加速器架构与 MERA 软件栈。X4 旗舰方案的主要指标为:FP4 AI 算力至 3.36 PFLOPS,内存至 256GB,内存带宽 548GB/s,芯粒间带宽 1.54TB/s,芯片间扩展互联至 6.4Tb/s,并支持按部署场景配置功耗档位。

这种「一个架构走到底」的路线,卖点在于软件投资的连续性:客户从单芯粒起步,负载涨了换双芯粒或四芯粒,不用更换软件环境、不必为不同性能档位维护多套工具链。X1 与 X2 的详细规格与部署定位将在后续阶段公布。

芯粒不是新词,难点在边缘侧的组合方式

芯粒设计近年在数据中心算力产品中已成主流思路:把大芯片拆成小颗粒以提升良率、按需混搭计算与缓存单元。RAIDEN 的差异不在「用不用芯粒」,而在扩展的维度——它把内存容量、内存带宽与互联带宽设计成随芯粒数量同步增长的整体,而不是只堆计算部分。对需要长上下文、多模态并发的边缘负载来说,内存墙往往比算力墙先到,只扩算力的方案很快会卡在搬运数据的路上。

边缘场景的另一层约束是软件与工具链的长期可用性。航天与工业设备的生命周期以年计,同一架构与软件栈覆盖三档配置,意味着客户可以在不迁移软件的前提下跨越性能档位;对设备全生命周期成本而言,这一点的影响可能大于峰值性能的差距。

RAIDEN:一个架构,从单芯粒扩展到四芯粒X1X2X4 旗舰(四芯粒紧耦合)X4 口径:FP4 算力至 3.36 PFLOPS · 内存至 256GB · 芯粒间带宽 1.54TB/s · 芯片间扩展 6.4Tb/s全部配置共用 DNA-X 加速器架构与 MERA 软件栈(厂商口径,独立基准暂缺)
RAIDEN 芯粒平台:单芯粒到四芯粒共用同一架构与软件栈

设计中标先行,量产节奏待披露

与很多先发布后找客户的芯片不同,EdgeCortix 宣称 RAIDEN 进入市场时已锁定客户设计中标(design wins),横跨航天防务系统、机器人平台与高性能边缘 AI 服务器三类场景。公司强调这些负载的共同点是模型越来越大、并发任务越来越多、实时约束越来越紧,而系统功耗上限不能松。

路线解读:错位竞争与芯粒赌注

把 RAIDEN 放进行业坐标系,它选择的是与数据中心旗舰错位的赛道:不比拼超大集群的峰值算力,而在能效比、内存容量与互联的平衡上做文章,这与其此前 SAKURA 系列边缘加速卡积累的能效叙事一脉相承。芯粒路线的弹性在于按需扩展,同时也把良率压力拆分到小颗粒芯片上,是近年从数据中心向边缘蔓延的设计趋势。

冷静看:口径与落地之间的距离

需要标注的是,上述指标全部为厂商口径,尚无独立基准测试交叉验证;3.36 PFLOPS 是 FP4 精度的峰值算力,与数据中心旗舰常用的更高精度口径不可直接对比;量产时间表、代工与封装伙伴、定价目前均未披露,官方及行业暂未透露更多细节,后续将持续跟进迭代动态。Physical AI 市场本身仍处早期,机器人与防务客户的订单节奏将决定这条路线的成色。