AI智能体在电脑操作基准测试里超过了人类(72%)。85%。

但同一个名字的基准测试,更难的版本里只跑出了20.6%。

数字没说谎。是我们没问清楚测的是什么条件。

3秒摘要
基准测试85% 超过人类(72%) 但OSWorld 2.0只有20.6% 原因:测量方式不同 落地前5条检查清单

大家都这么信

上周a16z发的报告标题就很有底气,叫《Can Agents Use a Computer Yet? We've Got the Data》。结论也很明确:已经可以了。

85%
OSWorld-Verified,Claude Fable 5
72%
人类测试者基准线
12%→85%
2024年4月 → 2026年6月

两年前,表现最好的模型在OSWorld-Verified上也只有12%。现在Claude Fable 5冲到了85%,超过了人类基准线(72%)。a16z的Serafini、Amble和Zhou还算了一笔账:操作电脑的AI智能体每小时成本6~8美元,印度的BPO人力每小时约10美元,美国后台员工时薪20.59美元再加上福利,能到30~45美元。

实际落地案例也有。一家消费品数据平台每月靠智能体处理1500万~2100万次门户交互;一家全球系统集成商靠27个工作流,每天处理1500~2100张IT工单。看到这个程度,"我们要不要也上"这个念头就很自然了。

但这个数字只说了一半

差不多同一时间,一个名字完全相同的基准测试里冒出了完全不同的数字。做OSWorld的XLang Lab在2026年上半年发布了OSWorld 2.0,结果表现最好的智能体也只完成了20.6%的任务

差距从哪来的?OSWorld 2.0由108个真实任务组成,一个熟练的人平均要花1.6小时才能做完,覆盖研究、内容创作、软件开发、商业金融等7个领域,每个任务平均设了27.25个检查点用来给部分分。相比之下,原来的OSWorld(1.0)大多是更短、更自成一体的任务。

"这两个数字之间的差距,是这个领域最重要的事实。"

— Adnan Masood,AI研究员

开发者博客youngju.dev说得更具体:同一个模型在所谓"同一个"基准测试上能差出63个百分点(83.5% vs 20.6%),不是模型突然变差了,而是测量方式不一样。短的、自成一体的任务能跑到80%多,像真实业务那样的长流程就掉到20%多。而且大约45%的任务其实是靠终端脚本执行完成的,不是靠点鼠标,这说明"电脑操作能力"这个词本身就混杂了GUI操作、脚本编写和推理。作为参考,OpenAI的Operator在原版OSWorld上的分数是38%,被评价为"在很多任务类别上跟随机差不多"。

基准测试的数字是这么来的

同一个"OSWorld"这个名字下,既有短任务版本(1.0),也有1.6小时真实工作版本(2.0)。一个没说清楚步数预算、重试次数和测试版本的数字,根本没法拿来比较。

那到底该信什么?

其实重新看a16z的报告,作者们自己也清楚这个陷阱。他们真正的论点不是"AI现在电脑操作全能了",而是范围更窄的一句:"电脑操作智能体在标准化、可重复的任务上最强。"他们举的落地案例——更新CRM、分类IT工单、登录政府/保险门户——每一个都有清晰的完成标准。15%的失败率没关系,只要有人能接手升级处理,靠24小时不间断的处理量就能把它抵消掉。

换句话说,"85%"和"20.6%"回答的是两个不同的问题。先搞清楚自己的业务属于哪一类。

开放式任务结构化、可重复任务
例子开放式调研、需要判断的工作、例外情况多的任务CRM数据录入、IT工单分类、门户登录/填表
完成标准每次都得靠判断清晰且可重复
基准测试依据OSWorld 2.0约20.6%OSWorld-Verified约85%
目前状态还得靠人主导已经有生产环境落地案例

供应商来推销时该问什么

  1. 先问是哪个版本的基准测试
    光说"我们跑了OSWorld"不够。要问清楚是1.0还是2.0,测试任务平均花了多长时间。
  2. 确认步数预算和重试次数
    允许重试几次、失败时人介入了几次,这直接决定分数会差多少。
  3. 把自己的业务分类
    先判断它是完成标准清晰、可重复的,还是每次都得靠判断的。
  4. 先从结构化任务开始试点
    照a16z举的例子,从工单分类、数据录入、门户登录这类窄而重复的任务开始验证。
  5. 提前规划失败率的应对方案
    如果没有人能接手那15%左右的失败,说明还没准备好上线。

想深入了解

Can Agents Use a Computer Yet? a16z原文,详细列出了成本计算和实际落地案例。a16z.com

OSWorld官方基准测试网站 可以直接查看任务构成和排行榜。osworld-v1.xlang.ai

The Hardest Easy Problem in AI 把基准分数和实际完成度之间的差距讲得很清楚的一篇文章。medium.com

操作浏览器和电脑的AI智能体,到底走到哪了 一篇韩国开发者博客,深挖基准数字到底测的是什么。youngju.dev

Computer-use agents hit 85% on OSWorld 梳理了这两年基准测试快速攀升的时间线。cryptobriefing.com

OSWorld 2.0的韩文报道 介绍了108个任务的构成和评分方式。aitimes.com