技术解构 2026-09-30 22 分钟阅读 进阶

AWS Strands Harness 架构解构:把「原型态智能体」装箱成跨云标准件

从本地原型到任意云的迁移断层 — 一行代码的通用 harness、六基准 28% 成本账与 Terminal-Bench 2.1 的同模对决

摘要

2026 年 9 月下旬,AWS 开源了 Strands Harness:一个打包成「开箱默认值」的通用智能体外壳,定位解决开发者用 Claude Code、Codex 在本地顺畅做原型、迁到云端却处处碰壁的「迁移断层」。本文基于 AWS 官方口径与多家媒体交叉信息,拆解其架构分层、跨云部署面、六基准平均成本账与 Terminal-Bench 2.1 同模型五 harness 对决数据,并对所有自报数字给出正确的读法。

迁移断层:harness 为什么成了新瓶颈

AWS 在官方博客中描述的痛点非常具体:许多开发者已经习惯用 Claude Code、Codex 这类成熟工具在本地机器上「开箱即用」地搭智能体原型,因为它们在自己机器上跑得很顺;但当要把原型迁到可扩展的云端环境时,就会遇到各种问题——要么自己重写 agent 循环,要么绑定到单一云的托管平台。

Strands Harness 的回答是提供一个完整、即用型的通用智能体:本地能跑,任意云也能跑,而且默认配置就是 AWS 团队认为「生产可用」的那一套。这与 2026 年以来行业从「模型竞争」转向「运行层竞争」的大趋势一致——Harness 决定智能体能否从 demo 走向生产。

🔑 一句话定位

Strands Agents SDK 提供积木(模型驱动的 agent 循环、工具、记忆等构件),Strands Harness 把这些积木装配成一台成品:create_harness() 一行代码返回一个带 shell、文件、搜索、记忆与子任务委派能力的通用 agent——它不是编码 agent,而是通用任务 agent。

架构拆解:SDK 之上的「开箱默认值」

Strands Harness 构建于 Strands Harness SDK 之上(AWS 开源的多智能体模式管理框架),以 Apache 2.0 协议发布,同时提供 Python 与 TypeScript 两个版本。开箱即用的能力清单如下:

能力域 默认组件 设计取舍
基础工具 读取、写入、编辑文件;shell 执行;网络搜索 依赖底层模型既有工具知识,而非为每类任务定制工具
模型接入 Amazon Bedrock、Anthropic、OpenAI、Google、本地 Ollama、LiteLLM 模型层完全开放,不绑定单一厂商
上下文管理 工具结果卸载至独立文件;重复请求部分缓存 缩短处理时间、降低 token 消耗(详见下文三条规则)
长期记忆 跨运行保持记忆,可通过会话 ID 恢复历史对话 面向长周期任务与会话延续
子任务委派 内置辅助智能体 + 自动化清单追踪多步工作 开放式子任务可委派并跟踪进度
扩展机制 Agent Skills 上传;集成 MCP 服务器等外部工具 与 2026 年主流扩展生态对齐

这里最值得咀嚼的是「依赖模型既有工具知识」这一条:AWS 明确表示不要求开发者为每项任务设计定制工具,而是押注前沿模型本身已经掌握如何使用 shell、文件与搜索。这是一种把复杂度从框架侧转移给模型侧的赌注——模型越强,harness 需要补的课越少。

跨云部署面:任意云与本地 Ollama

Strands Harness 的部署主张是「一次构建,随处运行」:

配套发布的还有 Strands CLI:AWS 团队自己就是用它开发出来的——用户选择底层模型、添加提示词与工具,就能以自然语言原型化一个智能体,再用 /export 命令把底层 harness 代码导出为 Python 或 TypeScript 文件继续定制。安装方式为 pip install strands-harness 或 npm install @strands-agents/harness。

成本账本:28% 与 77% 是两个口径

AWS 公布的基准数字需要分清两个口径,媒体传播中二者经常被混为一谈:

口径 数字 含义
六基准平均成本节省 28% ALFWorld、ContextBench、GAIA、WebShop、τ²-bench、Terminal-Bench 2.1 六个基准的平均每任务成本,对比对象包含 Claude Code、Codex、oh-my-pi、OpenCode、DeepSeek Harness
对 Claude Code 单项对比 77% 同一任务、Anthropic Fable 5 模型、Terminal-Bench 2.1 上,Strands Harness 成本比 Claude Code 低 77%,且综合分数更高
媒体转述口径 26% 部分媒体报道为「相同底层模型下比其他框架构建的智能体效率高 26%」——与 28% 属于不同表述,均系 AWS 自报

28% 这个数字有个容易被略过的脚注:DeepSeek Harness 是全场 token 效率更高的 harness,运行成本比 Strands Harness 还低约 14%,只是在所有基准上分数都更低。把 DeepSeek Harness 计入对比后,整体节省数字从更高的水平回落到 28%。换句话说,28% 是一个「对弱者也让利」之后的保守值,这是诚实的呈现方式。

同模对决:Terminal-Bench 2.1 五 harness

整套评测中最有信息量的是 Terminal-Bench 2.1 上的同模型对比:同样的 Anthropic Fable 5,五个 harness、每格 89 次试验。评测在 Amazon EC2 上用 Harbor(Terminal-Bench 团队的评测框架)分布式执行:

Harness 运行成本(美元) 准确率
Strands Harness 56.29 69.7
oh-my-pi 86.83 69.7
OpenCode 73.42 66.3
Claude Code 248.05 61.8
DeepSeek Harness 40.30 59.5

从这张表能读出三层信息:

图表上分数最高的点位是 Claude Opus 5 跑在 Strands Harness 上,接近 85 分——这说明 harness 的上限取决于背靠的模型,而非 harness 本身。

💡 交叉印证:HarnessTax 研究

独立的 HarnessTax 研究曾对 Claude Code、Codex CLI 与 Pi 跨 7 个模型做过对比,结论与 AWS 的数据方向一致:harness 的选择几乎不改变成功率,但同样的模型达到相近成功率,成本差距可达 5 倍。token 经济学已经是软件架构问题——「智能体怎么遗忘、怎么摘要、怎么委派」决定了账单。

效率从哪来:三条上下文规则

AWS 团队把 token 效率与准确率的双赢主要归因于上下文管理,具体是三条默认规则:

  1. 工具结果截断:超过约 1500 token 的工具输出被截断,避免大块原始数据反复进入上下文
  2. 摘要压缩:上下文用量超过 85% 时触发 compaction,把历史对话压缩成摘要
  3. 循环内恢复:窗口溢出时在 agent 循环内部执行上下文恢复,而不是中断任务

配合提示词缓存(对重复请求的复用部分做缓存)与工具结果卸载(大输出写入文件、按需引用),这四件事构成了「默认就省钱」的运行时。值得强调的是:这些不是 Strands 的发明,而是 2026 年 harness 工程的共识做法——Strands Harness 的价值在于把它们变成了不用配置的默认值。

边界与冷思考

目前官方及行业暂未披露更多细节(如企业级支持政策、托管化路线与基准论文的完整方法学),后续将持续跟进迭代动态。

核心发现

参考来源

  1. AWS 官方博客 — Introducing Strands Harness(2026.09,经 SiliconANGLE/aVenture 9.21 报道转述)
  2. 至顶科技 — AWS 推出开源智能体 Strands Harness,可跨任意环境部署(2026.09.22)
  3. World Programming — AWS Strands Agents Team Releases Strands Harness: 28% Lower Token Cost at Comparable Accuracy(2026.09,含 TB2.1 五 harness 明细表)
  4. Stackademic — AWS Open-Sourced Strands Harness to Cut AI Agent Development Costs(2026.09)
  5. 网易号·星途科讯 — 亚马逊 AWS 开源 Strands Harness:跨云部署 AI 代理(2026.09.22)