发布背景:长时程运行与主权智能体的交集
LOOP 的定位写在官方的一句话里:「智能体不再是聊天窗口,它们在真实工作上运行数小时、数天、数周」。据 Analytics India Magazine 与 Konsulteer 的报道,这个框架由 Soket AI 在班加罗尔开发,10 月 7 日在 Cypher 2026 大会上以开发者预览形态开源,代码托管在 GitHub。Soket AI 本身不是无名之辈:它是印度国家 IndiaAI 使命计划的入选团队,研究主线是 MCR(Math Code Reasoning)智能体——让模型以数学、代码与逻辑推理,并展示每一步推导以便在行动前被检验;其官网首页的示例就是一个七步推导的财务核验任务,每一步都带引用出处。该公司还宣布已聚合约 30 万亿训练 token 与近 20 亿条推理轨迹,正在训练一个 26B 参数的开源模型,计划连同数据集与训练栈一并开源;更大的 Project EKA 基础模型(120B+ 参数)亦在训练中,官网标注算力为 1,536 块 H100。
把 LOOP 放进这个语境里看会更清楚:Soket AI 的完整叙事是「模型 + Harness + 推理平台」的全栈主权方案——模型自研、服务可本地部署或物理隔离,而 LOOP 就是其中开源出来的执行层。这与主流 Harness 厂商的路径恰成对照:Claude Code、Codex CLI 等产品 Harness 依托自家闭源旗舰模型,而 LOOP 目前模型无关(通过 base URL 接入任意 OpenAI 兼容 API),押注的是「开源轻量 Harness + 任意模型」的自由组合。选择在 Harness 层先行开源,对一个模型还在训练的公司而言,是先用执行层建立开发者心智的标准打法。
LOOP 值得关注的原因不在某个单点功能,而在它把三组通常不共存的特性压缩进了同一个二进制文件:长时程运行(小时到周级)、极低资源占用(自报内存约为 Claude Code 的七分之一)、以及受监管行业级的部署边界(物理隔离与零信任)。前者通常是云端云端智能体产品的领域,后两者通常是本地开源 Harness 的领域。这个组合是否有真实需求支撑,是观察印度及全球南方主权 AI 市场的一个窗口。
三 crate 分层:统一模型 API、智能体循环与终端界面
据 GitHub 仓库直读,LOOP 的代码按 Rust workspace 组织为三个 crate,职责切分干净:
| Crate | 路径 | 职责 |
|---|---|---|
| loop-ai | crates/loop-ai | 统一 LLM API:接入 Soket 自家 provider(支持模型列表自动刷新)、OpenAI 兼容端点与「faux」模拟模式——测试与开发时可以不调用真实模型 |
| loop-agent | crates/loop-agent | 核心执行层:智能体循环、AgentHarness 抽象、工具调用、会话、沙箱与技能(skills) |
| loop-cli | crates/loop-cli | 交互式终端界面(TUI),基于 ratatui 构建 |
三个工程细节值得单独记录。其一,安装与分发走「单二进制」路线:官方安装脚本从 GitHub Releases 下载对应平台的 loop 二进制并校验 SHA-256,支持 macOS(Apple Silicon 与 Intel)、Linux(glibc)x86_64 与 arm64、以及 WSL;Windows 原生构建已发布但标注「安装器仍在测试、未正式支持」,musl(Alpine)环境不支持。其二,可观测性是可选编译特性:OpenTelemetry 追踪(可上报 Langfuse 或任意 OTLP 收集器)默认关闭,标准构建不携带相关依赖——对强调数据不出边界的目标用户,这是一个顺理成章的默认值;需要基准测试时再以特性开关编译,并通过命令行 trace 参数输出。其三,模型接入的默认项列表耐人寻味:Soket、OpenRouter、OpenAI 或任意 OpenAI 兼容 API,配置落盘在本地目录下——没有 Anthropic 的一级接入项,这与上述「全栈主权」叙事一致,也提示潜在用户:如果主力模型是 Claude 系,接入需要经过 OpenAI 兼容网关。
Git 式会话与 Swarm:长任务的分支与分身
LOOP 在会话模型上借用了 Git 的心智模型。官方描述其支持「Git 式会话管理」:工程师可以对运行中的智能体状态进行分支(fork)、恢复(resume)与追踪。这个设计对长时程任务的价值是直接的——一个跑了几天的任务,可以在关键节点分叉出一条替代路径去试不同的策略,失败则回到分叉点重来,成功则把分支结果合并回主线。传统 Harness 的会话模型大多是线性的「继续对话」,分支语义的缺失使得「试错成本」与任务时长成正比;把版本控制的成熟操作语义搬到智能体状态管理上,是 LOOP 在会话层最重要的差异化主张。
多智能体层面,LOOP 支持把单个目标拆解为「Swarm」:一个主目标分配给多个专职子智能体,参与智能体之间共享内存,同时保持可配置的进程隔离——协调与隔离两个需求被拆开对待,而不是二选一。官方还支持把技能与模板转换为 slash 命令,作为打包可复用能力的入口;MCP 协议支持则让它可以直接接入标准化的外部工具生态。路线图上预告的能力包括沙箱人设(sandboxing personas)、分级记忆(leveled memory)、远程智能体、可信远程沙箱与智能体群聊——这份清单本身说明官方对「多智能体协作」的长期投入方向,但截至发稿均为预告状态。
沙箱与隔离谱系:从 rootless 容器到微型虚拟机
LOOP 的执行环境选项构成一条完整的隔离强度谱系:从 rootless 容器(无 root 权限的容器化运行)到微型虚拟机(micro VM)。官方的定位是照顾「对执行边界有严格要求的企业环境」——智能体能触达哪些系统与资源,可以按部署场景逐级收紧。值得单独指出的是平台支持矩阵的现实约束:据 GitHub 仓库的功能支持表,沙箱目前在 Linux 上受支持,macOS 与 Windows 均为「计划中」;手动上下文压缩在 macOS 受支持;mcp-serve 在 Linux 与 macOS 受支持、Windows 测试中。换言之,这套「容器到虚拟机」的隔离能力目前实质上只在 Linux 服务器环境可用——这与它的目标客户(数据中心与私有化部署)是自洽的,但意味着 macOS 本地开发者的沙箱体验尚不完整。
官方还给出了一个直观的使用画像:官网将 LOOP 描述为「开源的智能体终端」——运行任务、自动化工作流、让智能体在安全沙箱里工作,并以「无限循环(Infinite loops)」特性明确承诺任务可以运行数小时或数天、完成后回来查看。Cypher 大会上的现场演示(多工具协作检索当日会议日程并产出相关场次清单)虽是简单任务,但展示的正是这套「长时程 + 多工具」的工作流。
自报基准的读法:7.7 倍内存与 17 倍 CPU 意味着什么
LOOP 的初轮基准数据全部为厂商自报,但数字本身值得完整列出。据 GenAI Daily 与 Konsulteer 的报道:在相同模型配置的内部对比中,LOOP 的内存(RAM)占用为 Claude Code 的约 1/7.7,本地 CPU 占用约为 1/17;与其他执行 Harness(Pi、OpenCode、Goose)的对比测试中,LOOP 在自动化多工具协调例程中的中位执行时长更短、峰值硬件占用更低。Konsulteer 的转述更谨慎一些:整体运行时长接近极简 Harness Pi,成本表现优于 OpenCode 与 Goose,任务耗时中位数在其对比名单中最低。所有对比数字均被该报道明确标注为「厂商自报、非独立验证」。
怎么读这组数字才不失真?三条建议。其一,对比对象要分清:7.7 倍内存、17 倍 CPU 是对 Claude Code(一个闭源的商业产品 Harness)的对比,而「接近 Pi」是对 Pi(本站此前解构过的极简 Harness)的对比——前者是资源效率声明,后者接近的是「性能不打大折扣」的下界声明,两者的可信度含义完全不同。其二,这些数字的测量任务集未公开:多工具协调例程是什么任务、跑多少次、模型输出长度分布如何,均未披露,第三方无法复算。其三,资源效率的真实含义要落到部署形态上:对云端按 token 计费的用户,客户端 Harness 的内存占用无关紧要;这组数字真正打动的是「在自有硬件上跑大量智能体」的用户——Soket AI 自己的说法是这类特性可以让数千个智能体跑在一台小系统上。如果你的部署形态不在这一类,这些数字的决策权重应当下调。
主权部署剖面与短板清单
LOOP 明确瞄准五类受监管工作负载:网络安全、国防、银行、金融服务与法律。官方给出的主权部署要求清单包括:物理隔离(air-gapped)运行、零信任网络配置、可审计的事务日志,以及对长时程任务的支持;Konsulteer 的报道特别提到,官方认为国防场景对「确定性」的要求尤为突出——理解与控制智能体的行为,与智能体的原始能力同等重要。这组主张与产品特性是咬合的:MIT 许可开源、单二进制分发、遥测默认关闭、模型经 base URL 自选、Linux 服务器沙箱,每一项都服务于「数据与执行不出自己的边界」。
短板清单同样要给足,共五条。其一,开发预览状态:官方明确这是 developer preview,API 稳定性无承诺,Windows 与 macOS 的部分能力仍在补齐。其二,基准全部自报:7.7 倍、17 倍等数字无任何独立复现。其三,生态从零起步:slash 命令、技能与模板生态尚无规模,对比 Claude Code 的 Mods 生态(发布即上 GitHub Trending)与 MCP 的既有工具池,冷启动差距真实存在。其四,公司层面的交付履历尚浅:26B 模型与 30T token 数据集仍在「计划开源」状态,LOOP 的长期维护投入与 Soket AI 的融资和商业化进度绑定。其五,社区规模未披露:GitHub 星标、贡献者数量、实际采用案例,目前官方及行业暂未披露更多细节,后续将持续跟进迭代动态。
与既有 Harness 的对照及观察点
把 LOOP 放进本站此前解构过的 Harness 谱系里对照,定位差异一目了然:
| 维度 | Soket LOOP(本轮) | Claude Code | DeepSeek Harness(Cordis) | Earendil Pi 1.0 |
|---|---|---|---|---|
| 开发语言 | Rust(单二进制) | 闭源商业产品 | 开源(MIT,据多方报道) | 开源 |
| 模型绑定 | 模型无关(OpenAI 兼容端点) | Anthropic 旗舰模型默认 | 模型无关,「模型+Harness」公式 | 多模型接入 |
| 会话模型 | Git 式分叉/恢复/追踪 | 线性会话为主 | 插件化状态管理 | Codemode 沙箱 + Durable 长任务基底 |
| 多智能体 | Swarm:共享内存 + 可配置隔离 | 子智能体机制 | 可替换智能体循环 | — |
| 隔离谱系 | rootless 容器到微型虚拟机(Linux 现阶段) | 受控执行环境 | 沙箱/存储/界面全可替换 | 沙箱内执行代码 |
| 资源定位 | 低内存低 CPU,自有硬件大量部署 | 依托云端模型计费 | 桌面公测形态 | token 压缩省成本 |
| 独有卖点 | 主权部署(物理隔离/零信任)+ 印度主权 AI 背景 | 模型与生态一体化 | 「一切皆插件」的 Koishi 式生态 | MCP 沙箱与长任务持久化 |
三个后续观察点。其一,独立基准是否出现:LOOP 的资源效率声明如果能在第三方基准(如 Terminal-Bench 系的 harness 级对比)中获得验证,其「低资源长时运行」主张的分量将完全不同。其二,26B MCR 模型的开源兑现:模型与 Harness 的组合才是 Soket 全栈叙事的完整形态,「模型 + 开源 Harness + 任意接入」与「开源模型 + 自家 Harness」两条路线的融合值得跟踪。其三,主权市场的真实订单:IndiaAI 背景给出的政策势能能否转化为国防、银行与法律行业的实际部署案例,是判断这个赛道成色的硬指标。LOOP 在 Windows 上的沙箱落地、Swarm 隔离配置的粒度文档,目前官方及行业暂未披露更多细节,后续将持续跟进迭代动态。