一家采用入门 AI Nimbia 的公司称,其首周激活率从 49% 提升至 70%。这是一个引人注目的结果,但1.4 倍这个数字应当被视为需要验证的假设,而不是购买依据。
从 49% 到 70% 不是“提升 21%”
先准确解读这些数字。Nimbia 是一款入门代理,能够与软件新用户实时语音对话,查看屏幕、点击按钮并填写字段。它称会从产品文档、录制的入门通话和测试账户中学习,然后向应用中添加一段脚本。
Product Hunt 上的介绍称,首家采用它的公司将其与原有入门流程进行了 A/B 测试,Nimbia 在首周激活和试用→付费转化方面取得了高出 1.4 倍的结果。 Nimbia 官网公开的客户 WeMind 数据更具体一些:首周激活率从 49% 提升至 70%,付费转化达到 1.4 倍。
这里必须区分表述。49% 到 70% 是提升了 21 个百分点;按相对提升率计算约为 42.9%,即约 1.43 倍。写成“激活提升了 21%”会低估实际变化,而写成“提升了 70%”则完全是另一回事。
改变的不是聊天机器人,而是“抵达首次价值的执行距离”
Nimbia 的核心不在于写出更好的说明,而在于减少用户在体验首次价值前必须亲自完成的操作。普通聊天机器人会回答“打开设置菜单并点击集成按钮”,而 Nimbia 称其会延续语音对话,进入对应页面并填写字段。
这种差异在复杂的 B2B SaaS 中可能更大。对于需要连接数据源、创建项目并生成首个成果才能显现价值的产品,阅读帮助内容与实际完成工作之间会有很长的间隔。相反,在注册后点击一次就能体现价值的简单产品中,AI 通话反而可能成为不必要的步骤。
| 方式 | 用户获得的帮助 | 适合的场景 | 需要确认的风险 |
|---|---|---|---|
| 清单·工具提示 | 指引既定顺序和位置 | 简短且可预测的流程 | UI 变更和异常路径 |
| 支持聊天机器人 | 以文字回答问题 | 用户能够说明问题时 | 不知道当前屏幕和任务是否真正完成 |
| 人工入门通话 | 根据上下文讲解和演示 | 高客单价、高复杂度合同 | 受日程和人力限制,难以扩展 |
| 屏幕操作型 AI | 通过对话共同完成实际任务 | 设置步骤很长的自助试用 | 误操作、个人信息、用户抵触感 |
因此,实验假设也不能只写成“接入 AI 会提高转化”,而应写得具体。例如:“需要经过 5 个步骤才能创建首份报告的新试用用户,在获得屏幕操作型引导后,7 天内创建首份报告的比例会提高。” Amplitude 也建议,在改善激活之前先定义用户首次感受到价值的行为,再用数据验证该行为是否与长期留存相关。
为什么不能仅凭 1.4 倍决定购买
公开结果缺少做决策所需的实验信息。对照组和处理组的样本量、用户分组方式、实验周期、付费转化的原始比例以及统计不确定性均未公开。因此,外部无法判断 1.4 倍是否是超出随机波动的效果,还是仅出现在特定客户群中的结果。
尤其不要把自愿参与和随机分配混为一谈。
如果只把点击帮助按钮并参加 AI 通话的人归入处理组,再与其他人比较,结果可能只是筛选出了原本意愿更强的用户。应在注册时对所有符合条件的用户进行随机分配,并且无论是否实际参加通话,都要按最初分配的组别检查结果。
在实验前确定所需样本量和最小可检测效果也很重要。LaunchDarkly 说明,样本越大,对结果的信心越高;若采用固定周期方式,应在开始前计算样本量和周期。 Adobe 同样警告,在数据较少时看到暂时的优势就提前停止实验,很可能把随机性误认为胜者。
还需要确认随机分配是否正常运行。两组用户比例与预期明显偏离的样本比例失衡、将用户与工作区混在一起的分配错误,以及事件缺失,都可能使整个实验失效。LaunchDarkly 的实验检查项也将曝光单位、样本比例和指标分析单位是否一致列为核心条件。
最后,也可能只提高激活而损害长期表现。如果 AI 替用户完成首项任务,激活事件会被记录,但用户下周可能无法独自重复同一任务。因此,必须同时关注付费转化、30 日留存率、退款、支持请求和 AI 误操作等后续与安全指标。
在你的产品中验证的 4 个步骤
- 先用一句话确定激活契约。
写明对象、行为和期限,例如“注册后 7 天内连接真实数据源并创建首份报告的新工作区”。排除注册完成或完成导览等与价值距离较远的事件,并先用既有队列确认该行为是否与 30 日留存相关。 - 在测试账户中验证 AI 可执行操作的边界。
除了正常路径,还要测试空数据、权限不足、页面缓慢以及用户中途提问。支付、删除和对外发送应禁止执行或要求人工批准;同时与供应商确认敏感字段脱敏、通话告知与同意、日志保留期限、立即停止按钮及转接人工支持。NIST 建议评估第三方生成式 AI 集成中的数据隐私和信息安全风险,并记录部署前测试。 - 按工作区维度随机分配新增合格队列。
为避免同一公司的多个用户看到不同版本,B2B 产品按工作区分配比按账户分配更安全。向对照组提供当前入门流程,向处理组提供当前流程及 AI 引导入口。获客渠道、套餐、国家和设备条件应在两侧保持一致。 - 在结果成熟前不要更改定义。
将主指标定为唯一的 7 日激活率,把付费转化和 30 日留存率设为后续指标。将 AI 通话启动率和完成率记录为诊断指标,将误操作、中断、转接人工和支持工单记录为安全指标。待试用期和付费观察期结束后,一并查看绝对差值、相对提升率、样本量和不确定性区间,再决定是否采用。
结论很简单。Nimbia 案例显示,能够理解屏幕并采取行动的 AI 可能缩短复杂入门流程中的执行距离。但仅凭公开的 1.4 倍,无法了解这种效果的确定性或可复现范围。在购买产品之前,应该先在内部就激活定义和实验设计达成一致。
如果想进一步深入
Nimbia: AI screen-sharing calls for user onboarding — 可以最先核实产品介绍和 1.4 倍 A/B 测试主张的页面。 producthunt.com
Nimbia onboards your users in live screen-sharing calls — 可以核实 49%→70% 的激活数据及产品的语音和屏幕操作方式。 nimbia.ai
Getting Started: Driving Product Engagement by Obsessing Over Activation — 说明如何确定各产品的激活行为,并用真实行为数据进行验证。 amplitude.com
Experiment sample size and run time — 确定 A/B 测试所需样本量和运行周期时可参考的官方文档。 launchdarkly.com
How long should you run an A/B test? — 梳理了仅因结果看起来不错就提前结束实验时会出现的问题。 experienceleague.adobe.com
Artificial Intelligence Risk Management Framework: Generative Artificial Intelligence Profile — 可用于检查第三方 AI 引入、个人信息和部署前评估的 NIST 资料。 nist.gov


