AI智能体在电脑操作基准测试里超过了人类(72%)。85%。
但同一个名字的基准测试,更难的版本里只跑出了20.6%。
数字没说谎。是我们没问清楚测的是什么条件。
大家都这么信
上周a16z发的报告标题就很有底气,叫《Can Agents Use a Computer Yet? We've Got the Data》。结论也很明确:已经可以了。
两年前,表现最好的模型在OSWorld-Verified上也只有12%。现在Claude Fable 5冲到了85%,超过了人类基准线(72%)。a16z的Serafini、Amble和Zhou还算了一笔账:操作电脑的AI智能体每小时成本6~8美元,印度的BPO人力每小时约10美元,美国后台员工时薪20.59美元再加上福利,能到30~45美元。
实际落地案例也有。一家消费品数据平台每月靠智能体处理1500万~2100万次门户交互;一家全球系统集成商靠27个工作流,每天处理1500~2100张IT工单。看到这个程度,"我们要不要也上"这个念头就很自然了。
但这个数字只说了一半
差不多同一时间,一个名字完全相同的基准测试里冒出了完全不同的数字。做OSWorld的XLang Lab在2026年上半年发布了OSWorld 2.0,结果表现最好的智能体也只完成了20.6%的任务。
差距从哪来的?OSWorld 2.0由108个真实任务组成,一个熟练的人平均要花1.6小时才能做完,覆盖研究、内容创作、软件开发、商业金融等7个领域,每个任务平均设了27.25个检查点用来给部分分。相比之下,原来的OSWorld(1.0)大多是更短、更自成一体的任务。
"这两个数字之间的差距,是这个领域最重要的事实。"
— Adnan Masood,AI研究员
开发者博客youngju.dev说得更具体:同一个模型在所谓"同一个"基准测试上能差出63个百分点(83.5% vs 20.6%),不是模型突然变差了,而是测量方式不一样。短的、自成一体的任务能跑到80%多,像真实业务那样的长流程就掉到20%多。而且大约45%的任务其实是靠终端脚本执行完成的,不是靠点鼠标,这说明"电脑操作能力"这个词本身就混杂了GUI操作、脚本编写和推理。作为参考,OpenAI的Operator在原版OSWorld上的分数是38%,被评价为"在很多任务类别上跟随机差不多"。
基准测试的数字是这么来的
同一个"OSWorld"这个名字下,既有短任务版本(1.0),也有1.6小时真实工作版本(2.0)。一个没说清楚步数预算、重试次数和测试版本的数字,根本没法拿来比较。
那到底该信什么?
其实重新看a16z的报告,作者们自己也清楚这个陷阱。他们真正的论点不是"AI现在电脑操作全能了",而是范围更窄的一句:"电脑操作智能体在标准化、可重复的任务上最强。"他们举的落地案例——更新CRM、分类IT工单、登录政府/保险门户——每一个都有清晰的完成标准。15%的失败率没关系,只要有人能接手升级处理,靠24小时不间断的处理量就能把它抵消掉。
换句话说,"85%"和"20.6%"回答的是两个不同的问题。先搞清楚自己的业务属于哪一类。
| 开放式任务 | 结构化、可重复任务 | |
|---|---|---|
| 例子 | 开放式调研、需要判断的工作、例外情况多的任务 | CRM数据录入、IT工单分类、门户登录/填表 |
| 完成标准 | 每次都得靠判断 | 清晰且可重复 |
| 基准测试依据 | OSWorld 2.0约20.6% | OSWorld-Verified约85% |
| 目前状态 | 还得靠人主导 | 已经有生产环境落地案例 |
供应商来推销时该问什么
- 先问是哪个版本的基准测试
光说"我们跑了OSWorld"不够。要问清楚是1.0还是2.0,测试任务平均花了多长时间。 - 确认步数预算和重试次数
允许重试几次、失败时人介入了几次,这直接决定分数会差多少。 - 把自己的业务分类
先判断它是完成标准清晰、可重复的,还是每次都得靠判断的。 - 先从结构化任务开始试点
照a16z举的例子,从工单分类、数据录入、门户登录这类窄而重复的任务开始验证。 - 提前规划失败率的应对方案
如果没有人能接手那15%左右的失败,说明还没准备好上线。
想深入了解
Can Agents Use a Computer Yet? a16z原文,详细列出了成本计算和实际落地案例。a16z.com
OSWorld官方基准测试网站 可以直接查看任务构成和排行榜。osworld-v1.xlang.ai
The Hardest Easy Problem in AI 把基准分数和实际完成度之间的差距讲得很清楚的一篇文章。medium.com
操作浏览器和电脑的AI智能体,到底走到哪了 一篇韩国开发者博客,深挖基准数字到底测的是什么。youngju.dev
Computer-use agents hit 85% on OSWorld 梳理了这两年基准测试快速攀升的时间线。cryptobriefing.com
OSWorld 2.0的韩文报道 介绍了108个任务的构成和评分方式。aitimes.com




