能力评测 2026-09-21 20 分钟阅读 通用

全栈 SaaS 搭建智能体横评:vibeCrm 实测六强

Lovable vs Bolt.new vs Replit vs V0 vs Base44 vs Totalum — 30+ 项目、100+ 小时的多租户 CRM 之战

摘要

独立评测站 ai-agents-benchmark.com 用同一个命题——构建一个全功能的多租户 CRM SaaS(vibeCrm)——实测六款应用搭建智能体,累计 30+ 项目、100+ 小时。结果呈现明显断层:仅 3 款能(在人工救助后)跑通完整命题,稳定性与 SQL 数据层支持是主要分水岭。本文复盘其评分体系与量化结果,对比免费额度差异,并讨论这类「应用搭建智能体」评测与我们此前覆盖的开发者 CLI 编码智能体评测在口径上的本质差异。

相关产品: Lovable Bolt.new V0

评测设计:一个多租户 CRM 的完整命题

与常见的「一句话生成落地页」演示不同,这次评测把难度刻意拉高。被测的六款智能体——Lovable、Bolt.new、Replit、V0、Base44、Totalum——都收到了同一个命题:构建一个名为 vibeCrm 的完整多租户 CRM SaaS,包含六个功能模块:

评测方法上有三个值得注意的设定:所有智能体使用相同提示词;尽可能先用免费计划,不足再升级到付费;对失败的应用给出报错日志与补充上下文、多次尝试后再判定。这意味着测得的是「人类适度协作下」的能力上限,而非完全无人干预的自主能力。

📋 命题的用意

多租户 CRM 刻意覆盖了「演示型任务」与「真实 SaaS」之间的全部鸿沟:权限边界、关系型数据、外部集成、以及一个会读业务数据的 AI 模块。任何一环掉链子,产品都无法声称完成命题。

总评榜:八维量化结果

评测从综合表现、稳定性、功能、UI 质量等维度给出十分制评分,结果如下:

排名 智能体 评分 评测站标签 核心优势 核心短板
1 Totalum 8/10 均衡型智能体 最稳定、SEO 佳、自带管理后台、内置 AI 集成 不支持 SQL 数据库
2 Base44 7/10 最快智能体 生成速度突出、UI 美观、自动测试 禁止导入任意 npm 包、后端供应商锁定
3 Lovable 6/10 「偷懒」的智能体 Supabase 集成好、生态成熟 倾向做最少的工作、崩溃频繁、SEO 弱
4 Bolt.new 5/10 token 吞噬者 UI 设计质量好 token 消耗极快、免费计划仅 1 次提示
5 Replit 3/10 炸药型智能体 开发者功能丰富、技术栈可选 速度极慢,简单提示有时超过 1 小时
6 V0 2/10 冒牌智能体 简单落地页可用 反复崩溃、SQL 报错不断

一个关键结论是断层而非连续谱:完整跑通全功能多租户 CRM 的只有 Lovable、Base44、Totalum 三款,且都需要评测者多次介入纠错。Replit 与 V0 与前三名的差距不是「细节打磨」级别的。

分水岭一:SQL 与数据层能力

把六款智能体的功能矩阵摊开看,数据层支持是最清晰的分界线:

能力 Lovable Bolt.new Replit V0 Base44 Totalum
PostgreSQL
导入任意 npm 包
自动测试
GitHub 集成
从 Figma 导入

评测站给出的选型指引与此一致:必须 PostgreSQL/Supabase 的场景选 Lovable(需接受其不稳定性);不在乎数据库类型、追求均衡质量选 Totalum;追求速度出 MVP 选 Base44(接受 npm 与后端锁定);要企业级的全代码与全栈控制,则直接用开发者级编码智能体(如 Claude Code)或传统开发。

分水岭二:稳定性与 token 成本

如果说数据层决定了「能不能」,稳定性与成本决定了「值不值」:

值得注意的是 UI 质量并不是本次评测的有效区分项——六款都能生成体面的界面。真正拉开差距的是生成之后的部分:数据层、稳定性、可迁移性与可维护性。

免费额度对比:试错成本差距明显

对个人开发者与小团队,免费额度直接决定「敢不敢拿来试错」:

智能体 免费计划提示额度 试错空间评价
Bolt.new 1-2 次提示 几乎无试错空间
Replit 2-3 次提示 偏紧
Lovable 2-4 次提示 偏紧
Base44 2-4 次提示 偏紧
Totalum 5 次提示 六款中最宽裕
V0 5-6 次提示 额度宽但完成质量低

额度排序与能力排序并不同步:额度最宽的 V0 恰恰是完成度最低的。结合 Bolt 的高 token 消耗,可以看出「免费额度」与「单任务真实成本」是两个独立变量,选型时应分开评估。

与开发者 CLI 编码智能体评测的口径差异

龙虾智能体研究院此前的多篇评测覆盖的是另一类产品:Claude Code、Codex CLI、Cursor 等面向开发者的编码智能体,度量口径是 Terminal-Bench、SWE-bench 等基准的解决率与成本。这两类评测不可互相换算,原因有三:

  1. 任务形状不同:CLI 编码智能体的输入通常是仓库上下文中的工程任务(修 bug、写测试、重构),应用搭建智能体的输入是从零到一的产品描述。前者考「改对」,后者考「立起来」;
  2. 用户画像不同:前者服务专业开发者,后者面向想做产品的非专业或不写代码的用户。Base44 禁止导入 npm 包对前者是硬伤,对后者几乎无感;
  3. 评价维度不同:CLI 智能体评测很少把 UI 美观、SEO、内置管理后台计入总分,而这些恰是本榜的计分项。

因此,本榜榜首的 Totalum 与 Terminal-Bench 榜单上的头部模型不存在可比性——它们在赛不同的项目。真正有信息量的对比发生在类内:同样以「帮人从零搭出产品」为卖点的六款之间。

方法论批判:这份评测能信多少

按本研究院对评测类内容的惯例,需要把这份结果的适用边界讲清楚:

综合来看,这份评测最有价值的不是 8/10 与 2/10 的精确排序,而是它验证的两个结构性结论:其一,应用搭建智能体的能力断层集中在数据层与稳定性,而非界面生成;其二,「完全无人干预构建全功能 SaaS」在当前所有产品上都还不成立——即便表现靠前的三款也需要人类在关键节点介入。目前官方及行业暂未披露这些产品的下一步版本规划细节,后续将持续跟进迭代动态。

核心发现

参考来源

  1. ai-agents-benchmark.com — AI Coding Agents Benchmark 2026: Lovable vs Bolt vs Replit vs V0 vs Base44 vs Totalum(2026.09)
  2. Lovable 官方文档 — Supabase/PostgreSQL 集成与项目发布(lovable.dev)
  3. Bolt.new 官方站点 — 免费计划与 token 计费说明(bolt.new)
  4. Replit 官方文档 — Replit Agent 功能与配额(replit.com)
  5. Vercel V0 官方文档 — 生成能力与数据层支持(v0.dev)