技术解构 2026-09-17 24 分钟阅读 进阶

开源 Agent 框架「分工化」格局解构

Pydantic AI v2、LangGraph 1.x、LlamaIndex Workflows、Strands 与 Mastra — 从「全能竞争」到「各守一域」的五条技术路线

摘要

2026 年的开源 Agent 框架赛道出现了一个结构性转变:没有一个项目还在声称要赢得所有工作负载,取而代之的是各自锁定一个明确的生态位——类型安全的 Python 循环、有状态图运行时、事件驱动的轻量编排、AWS 原生 SDK 与全栈 TypeScript。本文基于各项目 2026 年 6–9 月的发布日志与官方文档,拆解五个框架的技术设计、适用边界与选型逻辑,并指出框架层之下的协议层(MCP、A2A)收敛才是这种「分工化」得以成立的基础设施前提。

背景:从「万能框架」到「分工时代」

2024–2025 年,开源 Agent 框架的竞争叙事是「大一统」:每个项目都想成为通用编排层,发布说明里堆满彼此重叠的功能清单。但 2026 年 9 月的信号显示,这条赛道已经进入一个更成熟的阶段——据 AI Agent Insights 2026 年 9 月 8 日的行业综述,主要开源框架的发布动态表明它们「不再竞逐成为万能框架,而是竞逐成为某一项工作的合适框架」。

这个转变的直接证据来自五个项目近三个月的官方发布记录:Pydantic 在 6 月 23 日发布 Pydantic AI v2 稳定版,把智能体的指令、工具、钩子和设置收拢进一个名为「capability」的单一原语;LangGraph 在 8 月的变更日志里连续推出节点缓存、延迟节点、模型前后钩子等内容块流式 API;LlamaIndex 把 Workflows 1.0 独立成轻量的事件驱动框架,同时覆盖 Python 和 TypeScript;AWS 支持的 Strands Agents 稳定运行在 1.x 版本线上;Gatsby 团队打造的 Mastra 则以 Apache 2.0 协议稳固了全栈 TypeScript 的阵地。

🏗️ 结构性观察

分工化的本质不是功能收缩,而是抽象层级分化:五个框架分别押注了「类型契约」「持久图执行」「事件流」「云平台集成」「端到端产品栈」五种不同的约束锚点。选型问题的重心因此从「哪个框架更好」变成「我的约束和哪个锚点对齐」。

值得注意的是,clawpk.net 此前的教程已覆盖 LlamaIndex Workflows 的实操用法(见教程 160),本文聚焦的是框架格局层面的技术解构与横向对比,两者互补而不重复。

Pydantic AI v2:类型安全的「能力」原语

Pydantic AI v2 的核心设计决策是把「capability(能力)」变成一个可组合的单一原语:一个 capability 打包了智能体的指令(instructions)、工具(tools)、钩子(hooks)和设置(settings),围绕一个小的可移植内核运作。这意味着你可以把「一个会做数据校验的抽取智能体」定义成一个 capability 资产,然后把它放进应用栈的任意一层——CLI、API 服务或后台任务——而不必重写胶水代码。

两个值得注意的工程事实:

代价与收益同样清晰。第三方对比给出两个量化锚点:在 90 天基准测试中,Pydantic AI 的类型系统捕获了 23 个 LangChain 未发现的 bug;但其生态规模约为 LangChain 的十五分之一。对于以 Python 为主、正确性优先于生态广度的小团队,这笔交换是划算的;反之则需要权衡集成成本。

LangGraph 1.x:有状态长工作流的运行时

LangGraph 1.0 于 2025 年 10 月 22 日正式 GA,官方定位早已从「LangChain 的图模式」修正为「独立的低层编排运行时」——文档明确说明使用它不需要 LangChain。其卖点集中在持久化执行(故障后恢复)、状态持久化、流式输出和人在回路(HITL)API 上。

2026 年 8 月的变更日志进一步把它的「工作流原语」属性做实,四项更新对小团队尤其有操作意义:

原语 解决的问题 典型场景
节点缓存(node caching) 重跑时跳过已完成的昂贵计算 调试长流程、模型调用成本控制
延迟节点(deferred nodes) 把并行工作汇入屏障后再触发下游 多源信息聚合后再进入审校环节
模型前后钩子 在模型边界做上下文裁剪、护栏与 PII 脱敏 合规敏感的客服与数据管道
内容块流式 API(StreamPart) 统一的流式输出接口 前端实时展示 Agent 执行进度

Q2 2026 周期还补充了每节点超时、类型化错误处理器(可路由到恢复节点)和只存增量的 DeltaChannel。用官方的框架表述:如果你的团队能为工作流命名出节点(intake、research、draft、review、publish)、描述边、选定 checkpointer,LangGraph 就免费赠送持久化执行、时间旅行调试和崩溃恢复。

生态数据方面,2026 年 7 月 LangGraph GitHub 星标约 3.72 万,npm 周下载约 234 万次,与 langchain 包的 262 万已接近持平——这印证了一个事实:如今安装 LangChain 的智能体大多就跑在 LangGraph 运行时上,两者的边界正在模糊。

LlamaIndex Workflows:事件驱动的轻量编排层

LlamaIndex 的架构转变在于把编排从单体框架中拆出来:Python 侧独立为 llama-index-workflows 包,TypeScript 侧为 @llamaindex/workflow-core。Workflows 1.0 是一套异步优先(async-first)、事件驱动的多步编排方案,官方将其定位为「构建在数据之上的 LLM 智能体」的轻量选择。

它的抽象模型与 Pydantic AI、LangGraph 都不同:每个步骤(step)是一个 Python 异步函数,通过发射和监听类型化事件来衔接——StartEvent 进入,@step 处理,StopEvent 结束,中间事件类型决定下游哪个步骤被触发。这带来两个工程性质变:

适用判断也很直白:需要复杂分支、回滚和完整审计轨迹的场景,LangGraph 的状态图更合适;而「检索、总结、校验、生成」这类数据密集、步骤清晰的管道,Workflows 的抽象负担明显更低。共享状态用每次运行隔离的 Context 对象管理,并发跑多个流程不会串数据。

需要提示的一个版本口径问题:关于 Workflows 1.0 的 GA 时间,不同来源分别给出 2026 年 6 月(多数来源与 clawpk.net 教程口径一致)与更早时间的记载,本文以官方发布公告与站点教程统一的 2026 年 6 月为准;截至 2026 年 7 月,Python 包版本约 2.22.x,而旗舰 llama-index 包仍停留在 0.14.x 且缺少 LangChain 那样的正式稳定性承诺——这是评估其生产成熟度时需要计入的因素。

Strands 与 Mastra:AWS 系与 TypeScript 系两条 lane

Strands Agents 是 AWS 支持的开源 SDK,定位为「模型驱动的智能体」:开发者定义模型、工具和提示词,SDK 负责跑智能体循环,内置上下文管理、护栏和执行限制。Apache 2.0 协议,可运行在 AWS、其他云或本地环境。它的差异化不在算法而在平台贴合度:官方案例库收录了 Smartsheet、Eightcap、Jit 和 Zafran 的生产用例,覆盖安全运营中心(SOC)与语音智能体场景。对已在 AWS Bedrock 上的团队,这是一个可以在一个季度内完成试点落地的选项。

Mastra 由 Gatsby 团队打造,TypeScript 优先,核心代码 Apache 2.0。它的卖点是「一个依赖替代一张清单」:工作流编排、Studio 开发环境、持久化智能体记忆的 Memory Gateway、40+ 模型供应商的统一路由,全部收在一个包里。Langfuse 2026 年 7 月的对比还提到它支持挂起-恢复(suspend-and-resume)实现人在回路步骤,并提供了与 React、Next.js 和 Node 的集成。对于以 Next.js 交付产品的 TypeScript 团队,Mastra 替代的是「工作流库 + 记忆库 + 可观测库」的三件套组装。

💡 两条 lane 的共同点

Strands 和 Mastra 都把赌注押在团队既有栈的惯性上:一个绑定 AWS 基础设施,一个绑定 TypeScript 全栈生态。它们不做通用性竞争,而是把「迁移成本最小化」做成核心竞争力。

横向对比:五个框架的选型决策表

维度 Pydantic AI v2 LangGraph 1.x LlamaIndex Workflows Strands Agents Mastra
核心抽象 capability 原语 有状态图 + 节点 类型化事件 + step 模型驱动循环 工作流 + Memory Gateway
语言/栈 Python Python / JS Python / TypeScript Python(AWS 系) TypeScript 全栈
持久化执行 依赖自建 ✅ checkpointer + 崩溃恢复 事件日志可重放 ✅ 平台内置 ✅ suspend/resume
人在回路 钩子实现 ✅ 一等公民 API 事件门控实现 护栏 + 执行限制 ✅ 挂起-恢复
类型安全 ✅ Pydantic 校验 类型化错误处理 ✅ 类型化事件 一般 TS 类型系统
生态锚点 Pydantic 生态 LangChain / LangSmith RAG / 数据连接器 AWS Bedrock React / Next.js
适合谁 正确性优先的 Python 小团队 长流程、可恢复、要审计 数据管道与轻量多步 Agent AWS 原生企业 Next.js 产品团队

一个 9 月初场景化总结:需要类型契约的独立 Python 开发者选 Pydantic AI v2;需要持久化长工作流与崩溃恢复的团队选 LangGraph;以事件和步骤思考的创作者选 LlamaIndex Workflows;AWS Bedrock 上的 SMB 选 Strands Agents;交付 Next.js 产品的 TypeScript 团队选 Mastra。

共同趋势:协议层收敛与文件化指令

分工化能成立,前提是框架层之下存在稳定的公共层。两个趋势值得单独立节:

对实践者的操作建议因此变得朴素:选一个与既有约束匹配的栈,把持久化指令落成文件,然后拿一个真实任务跑一周——用一周的真实负载替代一周的基准测评。

局限与风险

核心发现

参考来源

  1. AI Agent Insights — AI Agents Trends: Open-Source Agent Stacks Are Settling Into Clear Roles for SMBs and Creators(2026.09.08)
  2. Pydantic 官方博客 — Pydantic AI v2: capable agentic loops(2026.06.23)及 GitHub Releases v2.38–v2.40(2026.09.03–04)
  3. LangGraph 官方文档与变更日志 — 1.0 GA(2025.10.22)与 2026 年 8 月节点缓存/延迟节点/流式 API 更新
  4. LlamaIndex 官方文档 — Workflows 1.0 事件驱动架构与 llama-index-workflows 独立包说明
  5. Strands Agents 项目站点(AWS 开源 SDK)及 Mastra 官方文档(Apache 2.0、40+ 模型路由)
  6. RECATOOLS / Tech Duel — LangChain vs LlamaIndex vs LangGraph 2026 横向对比(版本与下载数据,2026.07)