背景:从「万能框架」到「分工时代」
2024–2025 年,开源 Agent 框架的竞争叙事是「大一统」:每个项目都想成为通用编排层,发布说明里堆满彼此重叠的功能清单。但 2026 年 9 月的信号显示,这条赛道已经进入一个更成熟的阶段——据 AI Agent Insights 2026 年 9 月 8 日的行业综述,主要开源框架的发布动态表明它们「不再竞逐成为万能框架,而是竞逐成为某一项工作的合适框架」。
这个转变的直接证据来自五个项目近三个月的官方发布记录:Pydantic 在 6 月 23 日发布 Pydantic AI v2 稳定版,把智能体的指令、工具、钩子和设置收拢进一个名为「capability」的单一原语;LangGraph 在 8 月的变更日志里连续推出节点缓存、延迟节点、模型前后钩子等内容块流式 API;LlamaIndex 把 Workflows 1.0 独立成轻量的事件驱动框架,同时覆盖 Python 和 TypeScript;AWS 支持的 Strands Agents 稳定运行在 1.x 版本线上;Gatsby 团队打造的 Mastra 则以 Apache 2.0 协议稳固了全栈 TypeScript 的阵地。
分工化的本质不是功能收缩,而是抽象层级分化:五个框架分别押注了「类型契约」「持久图执行」「事件流」「云平台集成」「端到端产品栈」五种不同的约束锚点。选型问题的重心因此从「哪个框架更好」变成「我的约束和哪个锚点对齐」。
值得注意的是,clawpk.net 此前的教程已覆盖 LlamaIndex Workflows 的实操用法(见教程 160),本文聚焦的是框架格局层面的技术解构与横向对比,两者互补而不重复。
Pydantic AI v2:类型安全的「能力」原语
Pydantic AI v2 的核心设计决策是把「capability(能力)」变成一个可组合的单一原语:一个 capability 打包了智能体的指令(instructions)、工具(tools)、钩子(hooks)和设置(settings),围绕一个小的可移植内核运作。这意味着你可以把「一个会做数据校验的抽取智能体」定义成一个 capability 资产,然后把它放进应用栈的任意一层——CLI、API 服务或后台任务——而不必重写胶水代码。
两个值得注意的工程事实:
- 兼容承诺:Pydantic 团队明确保留 v1 支持,存量安装继续工作,新开发则建议从 v2 起步。这对生产环境友好,也和 LangChain 家族「不打破兼容直到 2.0」的承诺形成呼应。
- 发布节奏:仅 9 月上旬就有 v2.38.0、v2.39.0(9 月 3 日)和 v2.40.0(9 月 4 日)三个版本落地,新增后台价格更新、OpenAI Codex provider 和直接图像生成 API 等能力。
代价与收益同样清晰。第三方对比给出两个量化锚点:在 90 天基准测试中,Pydantic AI 的类型系统捕获了 23 个 LangChain 未发现的 bug;但其生态规模约为 LangChain 的十五分之一。对于以 Python 为主、正确性优先于生态广度的小团队,这笔交换是划算的;反之则需要权衡集成成本。
LangGraph 1.x:有状态长工作流的运行时
LangGraph 1.0 于 2025 年 10 月 22 日正式 GA,官方定位早已从「LangChain 的图模式」修正为「独立的低层编排运行时」——文档明确说明使用它不需要 LangChain。其卖点集中在持久化执行(故障后恢复)、状态持久化、流式输出和人在回路(HITL)API 上。
2026 年 8 月的变更日志进一步把它的「工作流原语」属性做实,四项更新对小团队尤其有操作意义:
| 原语 | 解决的问题 | 典型场景 |
|---|---|---|
| 节点缓存(node caching) | 重跑时跳过已完成的昂贵计算 | 调试长流程、模型调用成本控制 |
| 延迟节点(deferred nodes) | 把并行工作汇入屏障后再触发下游 | 多源信息聚合后再进入审校环节 |
| 模型前后钩子 | 在模型边界做上下文裁剪、护栏与 PII 脱敏 | 合规敏感的客服与数据管道 |
| 内容块流式 API(StreamPart) | 统一的流式输出接口 | 前端实时展示 Agent 执行进度 |
Q2 2026 周期还补充了每节点超时、类型化错误处理器(可路由到恢复节点)和只存增量的 DeltaChannel。用官方的框架表述:如果你的团队能为工作流命名出节点(intake、research、draft、review、publish)、描述边、选定 checkpointer,LangGraph 就免费赠送持久化执行、时间旅行调试和崩溃恢复。
生态数据方面,2026 年 7 月 LangGraph GitHub 星标约 3.72 万,npm 周下载约 234 万次,与 langchain 包的 262 万已接近持平——这印证了一个事实:如今安装 LangChain 的智能体大多就跑在 LangGraph 运行时上,两者的边界正在模糊。
LlamaIndex Workflows:事件驱动的轻量编排层
LlamaIndex 的架构转变在于把编排从单体框架中拆出来:Python 侧独立为 llama-index-workflows 包,TypeScript 侧为 @llamaindex/workflow-core。Workflows 1.0 是一套异步优先(async-first)、事件驱动的多步编排方案,官方将其定位为「构建在数据之上的 LLM 智能体」的轻量选择。
它的抽象模型与 Pydantic AI、LangGraph 都不同:每个步骤(step)是一个 Python 异步函数,通过发射和监听类型化事件来衔接——StartEvent 进入,@step 处理,StopEvent 结束,中间事件类型决定下游哪个步骤被触发。这带来两个工程性质变:
- 声明式编排:改事件连线即可改流程,步骤之间互不嵌套,增删互不影响;
- 天然可观测:事件流本身就是执行日志,可用 OpenTelemetry 等追踪工具捕获,故障可以隔离在单步。
适用判断也很直白:需要复杂分支、回滚和完整审计轨迹的场景,LangGraph 的状态图更合适;而「检索、总结、校验、生成」这类数据密集、步骤清晰的管道,Workflows 的抽象负担明显更低。共享状态用每次运行隔离的 Context 对象管理,并发跑多个流程不会串数据。
需要提示的一个版本口径问题:关于 Workflows 1.0 的 GA 时间,不同来源分别给出 2026 年 6 月(多数来源与 clawpk.net 教程口径一致)与更早时间的记载,本文以官方发布公告与站点教程统一的 2026 年 6 月为准;截至 2026 年 7 月,Python 包版本约 2.22.x,而旗舰 llama-index 包仍停留在 0.14.x 且缺少 LangChain 那样的正式稳定性承诺——这是评估其生产成熟度时需要计入的因素。
Strands 与 Mastra:AWS 系与 TypeScript 系两条 lane
Strands Agents 是 AWS 支持的开源 SDK,定位为「模型驱动的智能体」:开发者定义模型、工具和提示词,SDK 负责跑智能体循环,内置上下文管理、护栏和执行限制。Apache 2.0 协议,可运行在 AWS、其他云或本地环境。它的差异化不在算法而在平台贴合度:官方案例库收录了 Smartsheet、Eightcap、Jit 和 Zafran 的生产用例,覆盖安全运营中心(SOC)与语音智能体场景。对已在 AWS Bedrock 上的团队,这是一个可以在一个季度内完成试点落地的选项。
Mastra 由 Gatsby 团队打造,TypeScript 优先,核心代码 Apache 2.0。它的卖点是「一个依赖替代一张清单」:工作流编排、Studio 开发环境、持久化智能体记忆的 Memory Gateway、40+ 模型供应商的统一路由,全部收在一个包里。Langfuse 2026 年 7 月的对比还提到它支持挂起-恢复(suspend-and-resume)实现人在回路步骤,并提供了与 React、Next.js 和 Node 的集成。对于以 Next.js 交付产品的 TypeScript 团队,Mastra 替代的是「工作流库 + 记忆库 + 可观测库」的三件套组装。
Strands 和 Mastra 都把赌注押在团队既有栈的惯性上:一个绑定 AWS 基础设施,一个绑定 TypeScript 全栈生态。它们不做通用性竞争,而是把「迁移成本最小化」做成核心竞争力。
横向对比:五个框架的选型决策表
| 维度 | Pydantic AI v2 | LangGraph 1.x | LlamaIndex Workflows | Strands Agents | Mastra |
|---|---|---|---|---|---|
| 核心抽象 | capability 原语 | 有状态图 + 节点 | 类型化事件 + step | 模型驱动循环 | 工作流 + Memory Gateway |
| 语言/栈 | Python | Python / JS | Python / TypeScript | Python(AWS 系) | TypeScript 全栈 |
| 持久化执行 | 依赖自建 | ✅ checkpointer + 崩溃恢复 | 事件日志可重放 | ✅ 平台内置 | ✅ suspend/resume |
| 人在回路 | 钩子实现 | ✅ 一等公民 API | 事件门控实现 | 护栏 + 执行限制 | ✅ 挂起-恢复 |
| 类型安全 | ✅ Pydantic 校验 | 类型化错误处理 | ✅ 类型化事件 | 一般 | TS 类型系统 |
| 生态锚点 | Pydantic 生态 | LangChain / LangSmith | RAG / 数据连接器 | AWS Bedrock | React / Next.js |
| 适合谁 | 正确性优先的 Python 小团队 | 长流程、可恢复、要审计 | 数据管道与轻量多步 Agent | AWS 原生企业 | Next.js 产品团队 |
一个 9 月初场景化总结:需要类型契约的独立 Python 开发者选 Pydantic AI v2;需要持久化长工作流与崩溃恢复的团队选 LangGraph;以事件和步骤思考的创作者选 LlamaIndex Workflows;AWS Bedrock 上的 SMB 选 Strands Agents;交付 Next.js 产品的 TypeScript 团队选 Mastra。
共同趋势:协议层收敛与文件化指令
分工化能成立,前提是框架层之下存在稳定的公共层。两个趋势值得单独立节:
- 协议收敛:MCP(工具连接)与 A2A(智能体互联)正在所有框架之下收敛为公共协议层。这意味着换框架的锁定成本持续下降——工具集和技能定义可以跨框架迁移,框架选择不再是「一次定终身」。clawpk.net 此前对 A2A 协议的深度解构(R-TECH-06)讨论了这一层的原理与进展。
- 指令文件化:把持久化指令写成文件(AGENTS.md、skills/ 目录、图或工作流定义文件)正在成为跨框架的通用实践。未来灵活性来自协议和版本化文件,而不是框架本身的选择。
对实践者的操作建议因此变得朴素:选一个与既有约束匹配的栈,把持久化指令落成文件,然后拿一个真实任务跑一周——用一周的真实负载替代一周的基准测评。
局限与风险
- 版本口径混乱:LlamaIndex Workflows 1.0 的发布时间在不同来源间存在出入;其旗舰包 0.14.x 的版本号与缺少正式稳定性承诺,提醒团队在关键链路做兼容性预案。
- 分工是趋势不是终局:框架边界仍会漂移。LangGraph 与 LangChain 的运行时合一、LlamaIndex 从 RAG 库转向「数据之上的智能体」,都说明项目定位会随市场反馈调整。
- 基准方法学缺位:框架层的横向对比大多停留在功能清单与开发者体验评分(如 Speakeasy 给 Pydantic AI 的 8/10 DX 分),缺少受控的性能与可靠性基准——这与本栏目 R-BENCH 系列讨论的评测可信度问题同源。
- 多框架并存的运维成本:企业若因团队不同而引入多个框架,观测、鉴权、成本核算等平台能力需要按框架分别适配,中台化投入不可省略。