Klarna 在 2024 年初宣布,其 AI 聊天机器人相当于700 名员工的工作量。他们会裁减支持人员,每年节省 4000 万美元。然后在 2025 年末到 2026 年初之间,他们悄悄开始重新招聘人员。

问题不在这个数字本身。问题在于这个数字看起来回答了它其实回答不了的问题。一旦你想用一个数字来回答"我们的 AI 投资回报率是多少?"这个问题,并把整个公司都平均到这个数字里,就会一再看到这种情况。

3 秒总结
厂商 PR 数据 Klarna 的反转 任务边界外准确度 -19 个百分点 工作流重设仅占 21% 任务级验证基准

为什么 700 人在半年内反转了

看看 Klarna 的实际数据就一目了然了。AI 能好好处理直白的问询,但一遇到复杂支付纠纷、欺诈举报、政策例外处理就卡壳了。客户因为同一问题反复来电。聊天机器人不擅长安抚生气的客户。最后公司退而其次,让 AI 处理首次回复,让人工处理例外和客户维系。

真正的问题不是"700 人"这个数字本身。问题是这个数字没有说出数据来自哪项业务。对于简单问询,也许确实值 700 人的工作量。但一旦这个数字扩展到整个客户服务部门——其中 20-30% 的工作需要处理例外——成本就开始再次泄露。

"2.5 倍 ROI"这类数字为什么危险

最可怕的地方在于,这不只是 Klarna 的特殊案例。哈佛商学院和 BCG 用 758 名顾问做了一项现场实验,在 AI 擅长的业务领域(边界内),AI 的表现速度快 25%,质量高 40%。但在稍微超出边界的业务上,使用 AI 的顾问出错的概率高 19 个百分点。 研究小组把这种现象叫做"凹凸不平的技术前沿(jagged frontier)"——同一个工作流内,有些任务 AI 压倒性地优秀,有些任务反而不如人工。

一旦你把"我们公司的 AI 投资回报率是 2.5 倍"这类数字平铺到整个公司,就把好的业务和差的业务平均到一起了。麦肯锡调查发现,88% 使用生成型 AI 的组织说他们在定期使用,但实际上根本重设了工作流的只有 21%。这个重设的有无,是 EBIT 影响的最大决定因素。 MIT 的研究数据更极端:他们调查的生成型 AI 试点中,95% 都没能产生可测量的利润改善。 BCG 调查了 1800 多名高管,75% 把 AI 列为优先项,只有 25% 说他们真正实现了有意义的价值。

公司级别平铺数字任务级验证基准
典型例子"AI 裁减 700 人"客支,标准问询 -15% 处理时间
数据来源公司新闻稿同行评审现场实验 / 随机对照试验
可重现性异常混入就反转任务边界清晰,易于重现
Klarna 结果半年后重新招聘时推翻开发生产率 +55.8% 可重现

那到底该怎么向 CFO 汇报

可信的数字是存在的。不过只在任务边界清晰的地方。GitHub 用 95 名专业开发者做了随机对照实验。用 Copilot 的组别完成同样的 HTTP 服务器构建任务快 55.8%(1 小时 11 分钟 vs 2 小时 41 分钟),质量也更高(78% vs 70%)。在统计学上显著(p=0.0017)。

这些数字的共同点:数据来源的可信度分层。厂商的客户案例(Klarna 的 700 人)和随机对照试验(Copilot 的 55.8%)不能放在同一级别。按可信度排列是这样的。

可信度来源类型例子
① 最高同行评审现场实验HBS/BCG 顾问实验,GitHub Copilot RCT
② 高投资者披露财报中包含的财务数据
③ 中等内部运营案例内部仪表板验证的节减成果
④ 中-低厂商客户案例"我们的客户节省了 700 人"
⑤ 低单个高管问卷高管主观感受(仅与其他来源交叉验证时使用)

Klarna 的数字是第④级——厂商客户案例。这一级的数字可参考,但不能直接放进董事会报告。Copilot 的 55.8% 或顾问实验的 25%,那是第①级,更安全地引用。

5 步打造可防守的 ROI 矩阵

  1. 细分业务
    别把"客户服务 AI 上线"混在一起。把"标准问询"和"支付纠纷"分开,各自独立测量。
  2. 记录各任务的基线
    AI 上线前先记录处理量、耗时、成本、质量、异常率。没有这个基线,后来就没法验证任何改善。
  3. 标记源信度
    按上面 5 级表给每个数字贴等级。④⑤级标记"仅供参考",单独列出来。
  4. 别混预测、年化、实现节减
    "年省 4000 万"和"本季度实际减少的成本"要写在不同行。混在一起就是 Klarna 翻车的故事再演一遍。因为沉没成本,CFO 也得管好不让试点项目无限拖延。
  5. 记录工作流重设情况
    同个工具,重新设计流程的团队和直接套用旧流程的团队效果不一样。用单独一列记录重设有无。

注意

把 AI 用到任务边界之外时特别小心。用某项任务的成功来给例外处理和需要人情味的工作背书,会导致准确率反而低于人工。

常见问题

试点已经在进行,怎么样事后验证 ROI?

没有上线前的基线的话,完美验证是不可能的。代替方案是找类似工作但还没用 AI 的团队或地点做准实验对比。实在不行,至少从现在开始建立新的任务级基线,下个季度开始对比。

各部门测量标准不一样,全公司怎么比?

别勉强统一指标。五个项目"量、时间、成本、质量、异常率"全公司固定,其他随业务特点调整。这五个相同的话,即使部门间倍数不同,信度等级也能比。

能把厂商的数字直接给董事会吗?

标记等级的话可以。注明"厂商引述第④级",说明是内部没有重现的数据。这样就算后来像 Klarna 一样反转,信誉也不会完全崩。

不重设工作流有最小的可测 ROI 单位吗?

有。代码审查、标准问询这样天然边界清晰的工作,直接套到旧流程上也能看到效果。但异常混杂的工作不重设流程就数字站不住。

试点阶段怎么抓住失败信号?

看重复问询率和转交给人工的比率。同个问题反复来,或者 AI 转交给人工的比例没有下降,说明这项工作还不在 AI 的边界里。

深入了解

Navigating the Jagged Technological Frontier 758 名顾问的现场实验,划分 AI 擅长和不擅长的任务 aiinstitute.hbs.edu

MIT GenAI Divide 报告解读 为什么 95% 的生成型 AI 试点没有产生可测利润 virtualizationreview.com

麦肯锡 State of AI 2025 重点 为什么 21% 的工作流重设和高绩效企业的 3 倍差距 gend.co

GitHub Copilot 生产率 RCT 原文 95 名开发者对照试验验证的 55.8% 加速 github.blog

BCG AI 影响差距总结 1800+ 高管中仅 25% 说实现了有意义的价值 tekstac.com

Klarna AI 反转时间线 从 700 人节省宣言到重新招聘的全过程 digitalapplied.com

CFO 的 AI 投资三步战略 如何避开 FOMO 和沉没成本陷阱 clobe.ai