Klarna 在 2024 年初宣布,其 AI 聊天机器人相当于700 名员工的工作量。他们会裁减支持人员,每年节省 4000 万美元。然后在 2025 年末到 2026 年初之间,他们悄悄开始重新招聘人员。
问题不在这个数字本身。问题在于这个数字看起来回答了它其实回答不了的问题。一旦你想用一个数字来回答"我们的 AI 投资回报率是多少?"这个问题,并把整个公司都平均到这个数字里,就会一再看到这种情况。
为什么 700 人在半年内反转了
看看 Klarna 的实际数据就一目了然了。AI 能好好处理直白的问询,但一遇到复杂支付纠纷、欺诈举报、政策例外处理就卡壳了。客户因为同一问题反复来电。聊天机器人不擅长安抚生气的客户。最后公司退而其次,让 AI 处理首次回复,让人工处理例外和客户维系。
真正的问题不是"700 人"这个数字本身。问题是这个数字没有说出数据来自哪项业务。对于简单问询,也许确实值 700 人的工作量。但一旦这个数字扩展到整个客户服务部门——其中 20-30% 的工作需要处理例外——成本就开始再次泄露。
"2.5 倍 ROI"这类数字为什么危险
最可怕的地方在于,这不只是 Klarna 的特殊案例。哈佛商学院和 BCG 用 758 名顾问做了一项现场实验,在 AI 擅长的业务领域(边界内),AI 的表现速度快 25%,质量高 40%。但在稍微超出边界的业务上,使用 AI 的顾问出错的概率高 19 个百分点。 研究小组把这种现象叫做"凹凸不平的技术前沿(jagged frontier)"——同一个工作流内,有些任务 AI 压倒性地优秀,有些任务反而不如人工。
一旦你把"我们公司的 AI 投资回报率是 2.5 倍"这类数字平铺到整个公司,就把好的业务和差的业务平均到一起了。麦肯锡调查发现,88% 使用生成型 AI 的组织说他们在定期使用,但实际上根本重设了工作流的只有 21%。这个重设的有无,是 EBIT 影响的最大决定因素。 MIT 的研究数据更极端:他们调查的生成型 AI 试点中,95% 都没能产生可测量的利润改善。 BCG 调查了 1800 多名高管,75% 把 AI 列为优先项,只有 25% 说他们真正实现了有意义的价值。
| 公司级别平铺数字 | 任务级验证基准 | |
|---|---|---|
| 典型例子 | "AI 裁减 700 人" | 客支,标准问询 -15% 处理时间 |
| 数据来源 | 公司新闻稿 | 同行评审现场实验 / 随机对照试验 |
| 可重现性 | 异常混入就反转 | 任务边界清晰,易于重现 |
| Klarna 结果 | 半年后重新招聘时推翻 | 开发生产率 +55.8% 可重现 |
那到底该怎么向 CFO 汇报
可信的数字是存在的。不过只在任务边界清晰的地方。GitHub 用 95 名专业开发者做了随机对照实验。用 Copilot 的组别完成同样的 HTTP 服务器构建任务快 55.8%(1 小时 11 分钟 vs 2 小时 41 分钟),质量也更高(78% vs 70%)。在统计学上显著(p=0.0017)。
这些数字的共同点:数据来源的可信度分层。厂商的客户案例(Klarna 的 700 人)和随机对照试验(Copilot 的 55.8%)不能放在同一级别。按可信度排列是这样的。
| 可信度 | 来源类型 | 例子 |
|---|---|---|
| ① 最高 | 同行评审现场实验 | HBS/BCG 顾问实验,GitHub Copilot RCT |
| ② 高 | 投资者披露 | 财报中包含的财务数据 |
| ③ 中等 | 内部运营案例 | 内部仪表板验证的节减成果 |
| ④ 中-低 | 厂商客户案例 | "我们的客户节省了 700 人" |
| ⑤ 低 | 单个高管问卷 | 高管主观感受(仅与其他来源交叉验证时使用) |
Klarna 的数字是第④级——厂商客户案例。这一级的数字可参考,但不能直接放进董事会报告。Copilot 的 55.8% 或顾问实验的 25%,那是第①级,更安全地引用。
5 步打造可防守的 ROI 矩阵
- 细分业务
别把"客户服务 AI 上线"混在一起。把"标准问询"和"支付纠纷"分开,各自独立测量。 - 记录各任务的基线
AI 上线前先记录处理量、耗时、成本、质量、异常率。没有这个基线,后来就没法验证任何改善。 - 标记源信度
按上面 5 级表给每个数字贴等级。④⑤级标记"仅供参考",单独列出来。 - 别混预测、年化、实现节减
"年省 4000 万"和"本季度实际减少的成本"要写在不同行。混在一起就是 Klarna 翻车的故事再演一遍。因为沉没成本,CFO 也得管好不让试点项目无限拖延。 - 记录工作流重设情况
同个工具,重新设计流程的团队和直接套用旧流程的团队效果不一样。用单独一列记录重设有无。
注意
把 AI 用到任务边界之外时特别小心。用某项任务的成功来给例外处理和需要人情味的工作背书,会导致准确率反而低于人工。
常见问题
试点已经在进行,怎么样事后验证 ROI?
没有上线前的基线的话,完美验证是不可能的。代替方案是找类似工作但还没用 AI 的团队或地点做准实验对比。实在不行,至少从现在开始建立新的任务级基线,下个季度开始对比。
各部门测量标准不一样,全公司怎么比?
别勉强统一指标。五个项目"量、时间、成本、质量、异常率"全公司固定,其他随业务特点调整。这五个相同的话,即使部门间倍数不同,信度等级也能比。
能把厂商的数字直接给董事会吗?
标记等级的话可以。注明"厂商引述第④级",说明是内部没有重现的数据。这样就算后来像 Klarna 一样反转,信誉也不会完全崩。
不重设工作流有最小的可测 ROI 单位吗?
有。代码审查、标准问询这样天然边界清晰的工作,直接套到旧流程上也能看到效果。但异常混杂的工作不重设流程就数字站不住。
试点阶段怎么抓住失败信号?
看重复问询率和转交给人工的比率。同个问题反复来,或者 AI 转交给人工的比例没有下降,说明这项工作还不在 AI 的边界里。
深入了解
Navigating the Jagged Technological Frontier 758 名顾问的现场实验,划分 AI 擅长和不擅长的任务 aiinstitute.hbs.edu
MIT GenAI Divide 报告解读 为什么 95% 的生成型 AI 试点没有产生可测利润 virtualizationreview.com
麦肯锡 State of AI 2025 重点 为什么 21% 的工作流重设和高绩效企业的 3 倍差距 gend.co
GitHub Copilot 生产率 RCT 原文 95 名开发者对照试验验证的 55.8% 加速 github.blog
BCG AI 影响差距总结 1800+ 高管中仅 25% 说实现了有意义的价值 tekstac.com
Klarna AI 反转时间线 从 700 人节省宣言到重新招聘的全过程 digitalapplied.com
CFO 的 AI 投资三步战略 如何避开 FOMO 和沉没成本陷阱 clobe.ai




