智能体之间、人和智能体之间,到底该用什么「语言」说话?10 月 1 日亮相的 NLIP(Natural Language Interaction Protocol,自然语言交互协议)想把这个答案标准化:它要为人机交互、智能体间交互提供一套统一的通信规范,底层基于 ECMAScript 与 ECMA-404(也就是 JSON),并拿到美国国家科学基金会 150 万美元的 Safe-OSE 资助来推进其安全生态,正按 ISO 路线发展。它想做的,是智能体世界的「普通话」。

为什么偏偏是现在

当下的人机、智能体通信,被一摞协议切得七零八落:MCP、A2A、ACP、AP2 各管一段,彼此并不完全通约。NLIP 的出现,反映出一个阶段性的转变——行业已经从「智能体能不能对话」走到了「不同厂商的智能体能不能可靠、安全地协同」。它选了一条聪明的采用路线:直接建在 JSON 和 ECMAScript 之上,也就是 Web 原生、门槛极低,任何会写 Web 的开发者都能上手,不必先啃一套专有规范。配套的那笔 NSF 资助,名字叫 Safe-OSE,专门推进基于 NLIP 的生态安全,也侧面说明:用自然语言做智能体协议,本身会开辟一块新的攻击面,安全不是事后补,而是从立项就带着。

人Agent AAgent BNLIP统一对话层系统ECMAScriptJSON
图 1|NLIP 想做人与多智能体、系统之间的翻译层:各方都通过同一套基于 ECMAScript 与 JSON 的协议对话,而非各说各话

和现有协议是互补还是替代

需要厘清的是,NLIP 未必是要取代谁。MCP 管工具调用、A2A 管智能体间寻址与交接、ACP/AP2 管 commerce,NLIP 更像想坐到这些之上,做那一层「对话层」——各方都通过同一套基于 ECMAScript 与 JSON 的协议来表达意图与确认,下面的传输、工具、支付各司其职。这种「收口到统一对话层」的设想,逻辑上能减少碎片化,但代价是又多了一套需要被采用的协议。它能否成事,不取决于标准写得多漂亮,而取决于有多少厂商愿意把自家 agent 的嘴,换成它这个调门。

当下MCP/A2A/ACP…NLIP 收口统一对话层协议碎片化冲 ISO 标准化
图 2|今天人机、智能体通信被一摞协议分割;NLIP 想把对话层收口成一套标准去冲 ISO,但真正难点在采用率而非写标准

标准化之外的真难题

辩证地看,把通信标准化是必要的一步,却也是最难的一步。ISO 的路线漫长,150 万美元的资助相对全局而言并不算厚,而协议的价值几乎完全由网络效应决定——用的人少,再好的规范也是孤本。更深的矛盾在于「自然语言」这个前缀本身:用自然语言做协议,降低了人和 agent 的表达门槛,却也牺牲了结构化 schema 的精确性,模糊的语义更容易在跨厂商协作时产生歧义,甚至被诱导。目前官方及行业暂未披露更多细节,后续将持续跟进迭代动态;但 NLIP 冲 ISO 这件事,本身就是一个值得盯的结构性信号:当行业开始认真把「智能体之间怎么说清楚话」送进国际标准组织,说明多智能体协同已经从炫技,变成了被认为值得用制度去约束的真问题。对买家与开发者,真正的观察点不是它会不会赢,而是它能不能先回答「凭什么让我家 agent 改说你的普通话」。

也别把它神化成银弹。标准之争的结局,历史上反复证明:赢的往往不是技术上最周全的那份,而是生态最大、迁移成本最低的那份。NLIP 的 Web 原生底子是个优势,但同样做着「统一通信」梦的协议并不少,最终是多家并存还是一家通吃,现在下定论为时过早。对正在做多智能体系统的团队,更务实的姿态是:先别All-in任何一套,把通信接口留得足够薄、足够可替换,等某套协议真的起量,再平滑切过去——毕竟在协议战国期,被某家标准锁死,比暂时各说各话更危险。从 MCP 被 Linux 基金会收编、A2A 由 Google 主推的先例看,协议的最终归属往往取决于背后谁的生态更厚,而非谁先写下规范条文。