8月4日,由 MIT CSAIL 衍生、专注边缘部署混合基础模型的 Liquid AI 发布 LFM2.5-2.6B。与动辄数百亿、上千亿参数、必须依赖云端的同行不同,这款26亿参数的模型被明确定位为「Agent 级」而非通用聊天机器人:它能在手机、笔记本、PC 与机器人上完全本地运行,负责规划、调用工具与多步任务,且每次运行的边际推理成本几乎为零、数据不会离开设备。在端侧AI硬件扎堆做耳机、眼镜、手表的当下,Liquid AI 选择先把「能干活的 Agent 大脑」塞进设备本身——这指向一个被忽视的方向:端侧智能体的瓶颈,可能先被一个小模型补上。
一、2.6B 的甜点区间:小到能跑、大到能推理
LFM2.5 家族被 Liquid AI 定义为「为端侧 Agent AI 构建块优化」的模型线,此前已包含 LFM2.5-1.2B(含基础、指令与日文变体)、多模态的视觉语言模型与音频语言模型,以及 LFM2.5-8B-A1B 混合专家配置。2.6B 正好卡在中间:比 sub-1.5B 的密集模型大,又小于8B 的 MoE,属于一个「大到能处理复杂 agentic 推理、小到能在手机或笔记本无独显跑起来」的甜点区间。公司称其预训练约34万亿 tokens——若准确,对一个26亿参数的模型而言是相当庞大的训练语料。这种「小参数 + 大语料 + 面向端侧」的组合,本质是在设备算力约束下,尽量把推理与规划能力压实进一个可落地的体积。
二、不是聊天机器人,是「会干活的本地 Agent」
Liquid AI 在发布中把 LFM2.5-2.6B 明确框为 agent-class 系统:它会规划(plans)、调用外部工具(calls tools)、自主跑通多步任务(works through multi-step tasks),而不是等用户一句句问。这与需要联网、数据出设备的云端 Agent 框架形成对照——零边际推理成本加上数据不离设备,让它天然适配隐私敏感的场景,比如医疗、金融、工业现场,以及任何不希望每次交互都往返云端的离线环境。把它放进近期的「端侧 Agent」拼图看,与专注端侧推理芯片的原粒半导体、把 AI 做进头盔的京东外卖,处在不同层:一个补模型、一个补硬件、一个补载体,共同把「智能体长在人身上、长在设备里」这件事做实。
三、坐标参照:端侧 Agent 的两种路线
当前 Agent 落地大致分两派:云端优先,把推理与工具调用放在远程,模型强但数据要出设备、且受网络与计费约束;端侧优先,如 Liquid AI 这样把 Agent 大脑直接放进设备,换来对延迟、隐私与离线能力的掌控。端侧的优势是数据主权与近乎为零的边际成本,劣势是模型能力上限受设备算力约束,难以承接超长链路、超高复杂度的任务。这与「智联网」判断——网络行动主体从人扩展到 Agent、价值尺度从流量转向任务完成率——也彼此呼应:当 Agent 无处不在,多数交互本就不该把数据传上云。端侧 Agent 模型的出现,是把这层基础设施提前铺到设备里。
四、客观看:端侧 Agent 模型的上限与前提
价值在于,LFM2.5-2.6B 把「能规划、能调工具、能跑多步任务」的 Agent 能力,做成一个可完全本地运行的小模型,补上了端侧AI从「感知与对话」走向「行动与执行」的关键一环,对隐私与成本敏感的场景尤为友好。但边界要如实标注:其一,发布时主要基于 X 平台公告,尚无正式博客或模型卡,部分技术规格(如激活参数、上下文长度)行业暂未独立核实;其二,26亿参数的复杂 agentic 推理上限仍受规模约束,与云端大模型在长链路、高复杂度任务上存在客观差距,不能简单等同;其三,约34万亿 tokens 的预训练体量若准确值得关注,但仍需官方确认。端侧 Agent 模型是一条清晰且必要的路线,而它能在多大程度上替代云端,取决于小模型工程与设备算力的共同演进。