评测设计:一个多租户 CRM 的完整命题
与常见的「一句话生成落地页」演示不同,这次评测把难度刻意拉高。被测的六款智能体——Lovable、Bolt.new、Replit、V0、Base44、Totalum——都收到了同一个命题:构建一个名为 vibeCrm 的完整多租户 CRM SaaS,包含六个功能模块:
- 展示层:带博客的营销落地页
- 用户体系:注册登录与密码找回
- 联系人管理:完整 CRUD 操作
- 商机管理:Kanban 看板
- 邮件集成:营销邮件活动
- 内置 AI 智能体:可就 CRM 实时数据提问
评测方法上有三个值得注意的设定:所有智能体使用相同提示词;尽可能先用免费计划,不足再升级到付费;对失败的应用给出报错日志与补充上下文、多次尝试后再判定。这意味着测得的是「人类适度协作下」的能力上限,而非完全无人干预的自主能力。
多租户 CRM 刻意覆盖了「演示型任务」与「真实 SaaS」之间的全部鸿沟:权限边界、关系型数据、外部集成、以及一个会读业务数据的 AI 模块。任何一环掉链子,产品都无法声称完成命题。
总评榜:八维量化结果
评测从综合表现、稳定性、功能、UI 质量等维度给出十分制评分,结果如下:
| 排名 | 智能体 | 评分 | 评测站标签 | 核心优势 | 核心短板 |
|---|---|---|---|---|---|
| 1 | Totalum | 8/10 | 均衡型智能体 | 最稳定、SEO 佳、自带管理后台、内置 AI 集成 | 不支持 SQL 数据库 |
| 2 | Base44 | 7/10 | 最快智能体 | 生成速度突出、UI 美观、自动测试 | 禁止导入任意 npm 包、后端供应商锁定 |
| 3 | Lovable | 6/10 | 「偷懒」的智能体 | Supabase 集成好、生态成熟 | 倾向做最少的工作、崩溃频繁、SEO 弱 |
| 4 | Bolt.new | 5/10 | token 吞噬者 | UI 设计质量好 | token 消耗极快、免费计划仅 1 次提示 |
| 5 | Replit | 3/10 | 炸药型智能体 | 开发者功能丰富、技术栈可选 | 速度极慢,简单提示有时超过 1 小时 |
| 6 | V0 | 2/10 | 冒牌智能体 | 简单落地页可用 | 反复崩溃、SQL 报错不断 |
一个关键结论是断层而非连续谱:完整跑通全功能多租户 CRM 的只有 Lovable、Base44、Totalum 三款,且都需要评测者多次介入纠错。Replit 与 V0 与前三名的差距不是「细节打磨」级别的。
分水岭一:SQL 与数据层能力
把六款智能体的功能矩阵摊开看,数据层支持是最清晰的分界线:
| 能力 | Lovable | Bolt.new | Replit | V0 | Base44 | Totalum |
|---|---|---|---|---|---|---|
| PostgreSQL | ✅ | ❌ | ✅ | ❌ | ❌ | ❌ |
| 导入任意 npm 包 | ✅ | ✅ | ✅ | ✅ | ❌ | ✅ |
| 自动测试 | ❌ | ❌ | ✅ | ❌ | ✅ | ✅ |
| GitHub 集成 | ✅ | ✅ | ✅ | ✅ | ❌ | ✅ |
| 从 Figma 导入 | ✅ | ✅ | ❌ | ✅ | ❌ | ✅ |
评测站给出的选型指引与此一致:必须 PostgreSQL/Supabase 的场景选 Lovable(需接受其不稳定性);不在乎数据库类型、追求均衡质量选 Totalum;追求速度出 MVP 选 Base44(接受 npm 与后端锁定);要企业级的全代码与全栈控制,则直接用开发者级编码智能体(如 Claude Code)或传统开发。
分水岭二:稳定性与 token 成本
如果说数据层决定了「能不能」,稳定性与成本决定了「值不值」:
- Bolt.new 被 tag 为「token 吞噬者」:能产出不错的 UI,但 token 消耗速度极快,免费计划只允许 1 次提示,试错几乎完全依赖付费;
- Replit 的慢是结构性的:开发者功能(自选技术栈、在线 IDE)在六款中最全,但简单提示有时超过 1 小时,评测者的结论颇为直接——同样的活自己用 Claude Code 甚至 Cursor 写反而更快更省;
- V0 的 SQL 问题反复出现:多次崩溃于数据库错误,结论是只适合简单落地页;
- Lovable 的「偷懒」模式:倾向以最少的工作完成任务,集成能力好但过程崩溃频繁,SEO 输出差。
值得注意的是 UI 质量并不是本次评测的有效区分项——六款都能生成体面的界面。真正拉开差距的是生成之后的部分:数据层、稳定性、可迁移性与可维护性。
免费额度对比:试错成本差距明显
对个人开发者与小团队,免费额度直接决定「敢不敢拿来试错」:
| 智能体 | 免费计划提示额度 | 试错空间评价 |
|---|---|---|
| Bolt.new | 1-2 次提示 | 几乎无试错空间 |
| Replit | 2-3 次提示 | 偏紧 |
| Lovable | 2-4 次提示 | 偏紧 |
| Base44 | 2-4 次提示 | 偏紧 |
| Totalum | 5 次提示 | 六款中最宽裕 |
| V0 | 5-6 次提示 | 额度宽但完成质量低 |
额度排序与能力排序并不同步:额度最宽的 V0 恰恰是完成度最低的。结合 Bolt 的高 token 消耗,可以看出「免费额度」与「单任务真实成本」是两个独立变量,选型时应分开评估。
与开发者 CLI 编码智能体评测的口径差异
龙虾智能体研究院此前的多篇评测覆盖的是另一类产品:Claude Code、Codex CLI、Cursor 等面向开发者的编码智能体,度量口径是 Terminal-Bench、SWE-bench 等基准的解决率与成本。这两类评测不可互相换算,原因有三:
- 任务形状不同:CLI 编码智能体的输入通常是仓库上下文中的工程任务(修 bug、写测试、重构),应用搭建智能体的输入是从零到一的产品描述。前者考「改对」,后者考「立起来」;
- 用户画像不同:前者服务专业开发者,后者面向想做产品的非专业或不写代码的用户。Base44 禁止导入 npm 包对前者是硬伤,对后者几乎无感;
- 评价维度不同:CLI 智能体评测很少把 UI 美观、SEO、内置管理后台计入总分,而这些恰是本榜的计分项。
因此,本榜榜首的 Totalum 与 Terminal-Bench 榜单上的头部模型不存在可比性——它们在赛不同的项目。真正有信息量的对比发生在类内:同样以「帮人从零搭出产品」为卖点的六款之间。
方法论批判:这份评测能信多少
按本研究院对评测类内容的惯例,需要把这份结果的适用边界讲清楚:
- 单一评测者:全部项目由一人完成,评分含主观成分(如「偷懒」「冒牌」等拟人化标签),无第三方复核;
- 免费计划优先的偏置:Bolt 的低分与其免费额度紧张直接相关,付费用户实际体验可能显著不同;
- 产品迭代速度快:六款产品均处于快速迭代期,评测快照会随版本更新迅速过时;
- 单一命题:CRM 代表不了所有 SaaS 形态——内容型、交易型、数据密集型应用的排序可能不同。
综合来看,这份评测最有价值的不是 8/10 与 2/10 的精确排序,而是它验证的两个结构性结论:其一,应用搭建智能体的能力断层集中在数据层与稳定性,而非界面生成;其二,「完全无人干预构建全功能 SaaS」在当前所有产品上都还不成立——即便表现靠前的三款也需要人类在关键节点介入。目前官方及行业暂未披露这些产品的下一步版本规划细节,后续将持续跟进迭代动态。