9 月 21 日,AWS 的 Strands Agents 团队开源了 Strands Harness:一个 Apache 2.0 许可、同时支持 Python 与 TypeScript 的通用智能体框架,安装只需一行 pip install strands-harness 或 npm install @strands-agents/harness。它的卖法定得很直接——一行 create_harness() 调用,返回一个出厂即接好工具、上下文管理、会话与记忆的完整智能体。
这不是 Strands 系的起点。AWS 在 2025 年 5 月就开源了 Strands Agents SDK,但开发者很快发现一个尴尬:在成熟脚手架里调好的智能体原型,一旦自己从零搭外层循环,往往就散了架。Strands Harness 补的正是这一层——它不暴露零散积木,而是在 SDK 之上打包了一组合理的默认值。出厂默认包括:shell 与文件读写等基础工具、联网与搜索、程序化工具调用器、可委派开放式子任务的内置子智能体;会话可按 ID 恢复、长期记忆默认开启;Skills 文件自动加载;支持连接 MCP 服务器;模型侧可接 Amazon Bedrock、Anthropic、OpenAI、Google、Ollama 或 LiteLLM。随附的 CLI 还允许用自然语言先跑通原型,再一键导出成 Python 或 TypeScript 代码。
成本数据是这次发布的焦点,但需要先把口径摆清楚:基准由 AWS 自测,跑在自家 EC2 上,用的是 Terminal-Bench 团队开源的 Harbor 评测框架,成绩是六项基准(ALFWorld、ContextBench、GAIA、WebShop、tau2-bench 与 Terminal-Bench 2.1)的平均值——平均每任务 Token 成本比 Claude Code、Codex 等同类脚手架低 28%,准确率大体持平。最大的一组对比来自 Terminal-Bench 2.1 加 Claude Fable 5 的组合,每个脚手架各跑 89 次试验:Strands Harness 单次运行成本 56.29 美元,Claude Code 是 248.05 美元,便宜 77%,准确率反而高出 7.9 分。oh-my-pi 准确率与 Strands 持平,但成本贵 54%。表格里最省的是 DeepSeek Harness(40.30 美元),代价是每项基准都低——它把六项平均值拉低了,AWS 自己也承认,若不含它,降幅会更大。
比数字更有价值的是机制。按官方说明,效率增益既不来自更聪明的模型,也不来自特别的架构,而是三条朴素到近乎无聊的上下文规则:其一,工具结果超过约 1500 Token 就截断并落盘成文件,别让一次冗长的日志倾倒占住后续每一轮对话;其二,上下文用量到窗口的 85% 就触发摘要压缩;其三,压缩后仍溢出,就在智能体循环内部执行上下文恢复。这三条都不是专利技术——它们可迁移到任何脚手架,也解释了为什么成本差距可以达到 4 倍以上:差距出在 harness 层,不在模型层。
部署侧的提醒同样值得记下。第三方实践文章指出,Strands Harness 的出厂默认值对个人开发者友好,对企业却不安全:默认调用 Bedrock 上的模型、工具调用默认全部放行无需确认、会话与长期记忆写在本地目录。在数据合规严格的环境里(尤其欧盟),企业至少要先改掉这几个默认值,再让公司数据靠近它。迁移值不值也要自己算——拿厂商的 28% 直接套在自己的月账单上没有意义,正确做法是用同一组任务在两套脚手架上各跑一遍,量出属于自己的那组数字。
放眼整个 harness 赛道,Claude Code、Codex、OpenCode、oh-my-pi、DeepSeek Harness 挤满了玩家,AWS 的打法是把「最好的默认值」打包成开源产品,赌的是:当智能体工程从原型走向生产,团队愿意为省心的默认值换掉手搓的循环。逐基准的完整成绩表目前官方及行业暂未披露更多细节,后续将持续跟进迭代动态。