演示结束了,却没有人能批准部署

AI 对客户咨询的分类做得相当不错。演示画面中的结果很好,业务团队的反馈也不错。但一讨论生产部署,问题就接踵而来:允许出错到什么程度?能否访问客户数据?一旦发生事故,谁来关闭系统?这些问题都没有预先确定的答案。

在这个阶段,继续调优模型并不能解决问题。因为在试点之前,没有写下进入生产环境的标准。这也是 Vellum 的 AI 转型手册提出的务实转变:按战略、团队、工具、试点和组织推广的顺序推进,但从第一阶段起就要共同设计 KPI、责任、数据访问和审批条件。

NIST AI RMF 同样没有将 GOVERN 置于最后的检查阶段,而是将其作为贯穿 MAP、MEASURE 和 MANAGE 的跨领域功能。治理不像是在部署前一刻获得的盖章,更接近一种持续决定构建什么、由谁负责以及在何种条件下停止的运营方式。

首先,要放下“95% 会死掉”这个数字

Vellum 原文引用 MIT NANDA,称 95% 的企业生成式 AI 试点未能产生可衡量的 ROI。 但没有得到验证的依据可以将这句话改写为“95% 在生产部署中失败”,或“剩下的 5% 因早期治理而存活”。

目前可核实的 MIT NANDA 官方页面介绍了研究团队及其研究方向,并为相关报告提供了单独的访问路径。 由于无法在公开的官方原文中直接核实样本构成、ROI 的定义和 95% 的计算方法,因此不应将这个数字作为普遍失败率使用。

应当带走的不是对 95% 的恐惧,而是做出部署判断的顺序。 Vellum 的五个阶段是供应商提出的手册,而不是对成功企业和失败企业进行控制比较的研究。因此,与其承诺某个特定的成功概率,不如用它来制定自己试点的晋级条件。

试点前需要在一页上确定七件事

比工具对比表更早需要的文档,是一份将“哪些方面需要改善、改善多少,以及出现何种风险时应停止”关联起来的一页运营协议。至少应将以下七项内容放在同一个地方。

项目应写明的内容缺失时会出现的问题
KPI 基线当前处理时间、成本和错误率无法比较是否有所改善
目标和期限何时达到什么水平试点无休止地持续
KPI 负责人最终判断业务结果的人好的演示被直接视为成功
数据协议来源、所有者、访问和保留条件在接入真实数据阶段停滞
职责分离构建者、审批者和部署者构建者自行批准风险
错误预算可接受的错误和必须立即停止的事故出现问题时无法判断是否继续
回滚路径回到现有工作流程的方法和授权人部署后无法安全关闭

这份文档不必是冗长的政策手册。NIST AI RMF 也是一个不强制规定特定组织架构或产品的自愿、结果导向型框架。它旨在让组织根据自身的使用情境和风险承受度,选择 GOVERN、MAP、MEASURE 和 MANAGE 的行动。 如果处理生成式 AI,可将 NIST 针对其特有或被放大风险制定的生成式 AI 概况作为辅助材料。

第一个试点应从关闭实际操作开始

没有必要从一开始就让 AI 执行退款审批或向客户发送消息。Vellum 建议先从影子运行开始,将建议结果发送至审核队列,对照 SOP 和黄金集进行比较,之后再逐步扩大到小规模用户群体的辅助模式和受限的自动化操作。

使用 AI RMF 1.0 中当前概况和目标概况的概念整理状态,从 NIST AI RMF Playbook 中选择所需行动,然后按以下顺序准备一项工作流程。

  1. 选择一项已知基线的工作流程。 您应当已经在记录处理时间、成本或错误率中的至少一项。如果没有基线,请在接入 AI 之前从本周开始按相同标准记录。
  2. 将价值假设和停止条件写进一句话。 例如:“在 90 天内,通过由客服人员审批的退款分类,将中位处理时间从 12 分钟降至 9 分钟或以下,同时将整体误分类率控制在当前 4% 以内。”90 天和相关数字仅为示例,应根据组织的工作周期确定。
  3. 分离人员与数据的权限。 记录数据来源、所有者和允许的访问方式,并指定构建者、业务审批者、隐私审查者和部署者。即使一人兼任多个角色,也必须区分其以何种权限作出的决定。
  4. 运行关闭操作功能的影子模式。 用正常案例和具有代表性的失败案例构建黄金集,不要将 AI 结果发送给客户,而是将其积累在审核队列中。记录相对于 SOP 的通过率和错误类型。
  5. 只有通过所有闸门后才开启辅助模式。 在满足评估阈值、错误预算、数据控制和所有者审批后,才向小规模用户群体提供建议功能。即使扩大范围,也要重新检查同样的闸门。

目标工作流程: ______
基线 / 目标 / 期限: ______
KPI 负责人: ______
数据来源、所有者和访问条件: ______
构建者 / 审批者 / 部署者: ______
通过阈值和错误预算: ______
立即停止条件: ______
回滚方法和授权人: ______

最初的成功并不是自动化率。 第一项运营成果,是负责人能够查看这份文档和影子运行结果,并批准说:“在这些条件下,可以开启小规模辅助模式。”如果基线、数据权限、失败案例、日志或回滚功能中有任何一项尚未核实,应先补上这个缺口,而不是改进模型。

如果想进一步了解

Complete 2026 AI Business Transformation Playbook 您可以查看从战略到组织推广的五个阶段,以及影子运行和晋级闸门的示例。应认识到它作为供应商建议的局限,并将其作为实务检查清单来阅读。 vellum.ai

Artificial Intelligence Risk Management Framework (AI RMF 1.0) 您可以在原文中了解 GOVERN 为何贯穿整个生命周期,以及它与 MAP、MEASURE 和 MANAGE 的关系。 nist.gov

NIST AI RMF Playbook 您可以了解适合组织使用情境的具体可选行动。 nist.gov