2026年7月28日,量子位报道蚂蚁 inclusionAI 团队开源 LLaDA2.2——一款千亿参数 MoE 扩散语言模型,原生支持 128K 上下文,被称为全球首个大规模 Agentic 扩散模型,首次让扩散架构进入智能体长程任务。它把 Levenshtein 编辑、面向环境反馈的强化学习、长上下文工程架构整合进同一套扩散 Agent 系统,具备并行生成、过程中自我增删与动态修正的能力。这意味着 Agent 的「大脑」不再只有自回归一条路。
一、自回归为何长期垄断 Agent 赛道
这些年叫得上名字的 Agent,从 ChatGPT 到 Claude,底层清一色因果自回归 LLM,逐 Token 生成。多轮对话、工具调用、环境反馈处理,本就天然要求序列因果性——一个 Token 一个 Token 蹦,逻辑链才不易断。行业默认 Agent 大脑只能如此,慢是慢了点,但够稳。扩散模型能并行处理一个 block 里的多个位置,速度占优,代价是 Token 之间缺乏严格序列条件约束,普通文本生成里顶多影响可读性,放在 Agent 场景却是硬伤。
二、Agent 场景对扩散模型是「正确性地狱」
Agent 的输出是要被真实执行的:再小的 bug 也会影响整条流程,一步错步步错,错误会在后续交互里被固化成硬约束,最终目标漂移。所以扩散模型想在复杂 Agent 环境里追平自回归,必须迈过序列严谨性这一关。LLaDA2.2 的解法是把 Levenshtein 编辑(对文本做增删改)、面向环境反馈的强化学习、长上下文工程架构拧进同一套系统——模型不只并行生成,还能在生成过程里自我增删、动态修正,等价于「边行动边纠错」。128K 原生上下文则让它在长程任务里保持上下文不丢。
三、三代递进:从生成工具到行动架构
LLaDA 的演进有迹可循:2.0 解决规模化,证明扩散模型能结合 MoE 真正落地工程;2.1 做到边写边改;到 2.2 完成「智能体觉醒」,半年三代依次把扩散架构从生成工具推进到行动架构。这条路径说明,扩散模型并非只能停留在小参数实验,也能与主流 Agent 工作流接轨。它首次把扩散架构的并行优势,带进了过去由自回归独霸的执行型任务。
四、客观看:路线之争的价值与局限
价值在于给行业多一种架构选择:并行生成有望在推理速度、单位算力产出上打开优化空间,也倒逼自回归路线正视「慢」的代价。局限同样真实——长程规划的连贯性、与现有自回归工具链及评测体系的兼容性、扩散模型在强约束工具调用下的稳定性,都还需大规模生产验证。LLaDA2.2 未必马上取代自回归,但它证明 Agent 大脑不必是单选题。当架构开始多元,Agent 的性价比与可靠性才有持续下探的空间,行业也少一个被单一范式锁死的风险。