8月3日,语音 Agent 初创公司 Smallest.ai 宣布完成1300万美元 A 轮融资,由 Seligman Ventures 领投,Sierra Ventures 与 3one4 Capital 参投,公司累计融资已超过2100万美元。这家成立于2024年末的公司,押了一个与主流叙事相反的判断:语音 Agent 的下一次飞跃,不会来自把通用大模型做得更快更大,而来自使用专为人类对话打造的、更小型的专用模型。当行业集体涌向「全模态大模型统一架构」时,Smallest.ai 选择了一条「以小制小」的路线——这恰好为近期火热的语音交互之争,提供了另一种解题思路。

一、小模型模拟「边听边想边说」

Smallest.ai 的核心产品,是一款小型语音模型,设计目标是模拟人类在对话时的信息处理方式:同时倾听、思考和表达。创始人 Sudarshan Kamath 的解释很直观——「当我在跟你说话,你其实已经在思考了;如果我说得太久,你甚至会打断我。」这正是人类对话的自然节奏,也是当前大语言模型最别扭的地方:它要等你给完一整段提示,才开始思考、再一次性输出,这种延迟在文字聊天尚可接受,在语音对话里哪怕短暂停顿都显得不自然。Smallest.ai 的模型充当一层实时智能,针对特定话题实现近乎零延迟的流畅对话,并支持自然打断。它不追求「什么都知道」,而追求「对话像人」。

二、二模共生:实时小模型 + 兜底大 LLM

小模型的代价是知识范围有限,Smallest.ai 的应对是「二模共生」。当遇到超出自身有限知识的话题,小模型会把问题转交给一个大型基础模型处理,同时像真人客服遇到不会的问题那样,短暂让客户「稍等一下」。Kamath 的判断是,未来所有 AI Agent 都会依赖两种模型:一种用于实时交互的小型语音模型,另一种是按需调用、解决复杂问题的「离线」大语言模型。这种分工把「对话的自然度」与「任务的复杂度」拆给不同模型,既保住了语音交互的流畅,又不牺牲处理难题的能力。其客户已包括 RingCentral、Truecaller 等语音领域的公司,说明「自然打断 + 低延迟」的需求在真实客服场景里是硬指标而非锦上添花。

三、对照 SeedRealtime:全模态大模型 vs 专用小模型

把 Smallest.ai 放进语音交互的版图,路线分野十分清晰。几天前字节跳动全量上线的 SeedRealtime,走的是原生音视频全双工大模型路线——用统一架构融合音频、视频、文本,让 AI「边看边听边说」,押注的是大模型一体化带来的全模态能力。Smallest.ai 则反其道而行:不追求一个模型包揽所有模态与所有知识,而是用小型专用模型专攻「语音对话的自然度」这一件事。两种路线各有道理:全模态大模型胜在能力与场景延展,专用小模型胜在延迟、成本与对话质感。前者更像「把 AI 做成全能伴侣」,后者更像「把 AI 做成听得懂人话的电话员」。对开发者而言,这不再是「谁的模型更大」的比赛,而是「谁的语音体验更像人」的比赛。

四、客观看:小模型的天花板与兜底

价值在于,Smallest.ai 指出了语音 Agent 一个被大模型叙事遮蔽的关键命题——对话的自然度,可能不靠更大的模型,而靠更专的模型。二模共生的设计,也给出了一条兼顾实时性与复杂度的务实路径,对客服、外呼等高并发语音场景有直接价值。但边界要讲清:其一,融资信息来自公司公告与 TechCrunch 等媒体报道,产品真实自然度与延迟指标仍主要靠客户口径,缺少大规模独立评测;其二,小模型知识范围有限,需依赖大 LLM 兜底,「稍等一下」的体验在任何语言、任何口音、任何嘈杂环境里都稳定,仍是工程难题,尤其小模型要处理不同口音、支持数十种语言、在噪声环境正常运行;其三,A 轮仍处于早期,商业模式与客户黏性待验证;其四,与大模型厂商自带的语音能力相比,独立小模型公司的护城河在于专业化与成本,但若大模型厂商把语音自然度快速补齐,其差异化空间会被压缩。Smallest.ai 选了一条清醒的窄路,而它能走多远,取决于「像人」这件事到底值多少溢价。