有一门生意,就是把两个AI的输出摆在一起,问"哪个更好?"
一家公司靠这个烧光了3300万美元,没多久就关门了。另一家公司靠同样的问题,六个月把营收做到了12倍,昨天还刚拿到790万美元融资。
大家不都是靠跑分选AI模型的吗?
在MMLU、GSM8K这类跑分上,现在的前沿模型已经接近满分,甚至超过人类专家了。但这个分数,跟实际用起来的感受到底有多大关系?
DesignArena的创始人Grace Li和联合创始人们,是2025年从哈佛毕业前夕开始做这门生意的。 团队本来在做一个AI游戏引擎,结果碰到一个问题:技术上完全跑得通,但人玩起来觉得没意思。Li把这个问题称为"这些模型在设计领域无法改进的那个被忽略的瓶颈"。 通过跑分和真正打动人心,原来是完全不同的两件事。
于是团队彻底转向了。不再做游戏,而是做一个大规模收集人类审美偏好的平台,这就是DesignArena。用户输入一句提示词,多个AI模型各自生成网站、图片、演示文稿或Logo,人来给两者投票选出更好的一个。 把这些投票数据卖给前沿AI实验室,就是它的商业模式。Li说,签下第一单大客户一周之后,"剩下的就都成了历史"。
那Yupp为什么死了,DesignArena却火了?
其实"给用户看两个AI结果、让他们投票"这个点子并不新鲜。一家叫Yupp的创业公司做的就是同一件事。它在a16z crypto的Chris Dixon领投下融了3300万美元,做了一个能对比800多个模型的平台,吸引了130万用户。 但最后还是关门了。
关门的原因很有意思。OpenAI、Anthropic这些大实验室早就有了自己的RLHF流水线,Scale AI这类公司也早就占住了数据标注市场。Yupp本该争取的企业客户,基本都已经有了自己的反馈闭环。 摊子铺得太大太广,结果对谁来说都不是不可替代的。
相比之下,专门对比文本回答的Arena(前身LMArena,再之前叫Chatbot Arena)走的是完全相反的路线。它2023年4月起步时,只是三名UC伯克利研究者的一个side project,到2026年1月就以17亿美元估值融了1.5亿美元。当时它的付费"AI Evaluations"服务年化营收已经超过3000万美元,现在已经突破1亿美元。 CEO Anastasios Angelopoulos这么说:"如果不知道AI到底给人类带来了什么价值,我们没办法负责任地把它部署出去。"
| Yupp | DesignArena · Arena | |
|---|---|---|
| 覆盖范围 | 800+模型,什么都做,广撒网 | 专攻设计/专攻文本回答——真正的细分领域 |
| 企业客户处境 | 客户早已有自己的反馈闭环 | 直接签约,给前沿实验室供应它们缺的数据 |
| 融资与结果 | 融资3300万美元后关门 | 790万美元种子轮换来6个月ARR翻12倍/1.5亿美元A轮 |
同样是"问问人类"的模式,结果却天差地别,原因只有一个:有没有在一个别人替代不了的细分领域,卖出前沿实验室真正缺的数据。DesignArena的杀手锏,是能追踪审美偏好按地区、按时段的变化——比如亚洲用户对网页仪表盘的投票,明显比欧美用户更偏爱极繁主义风格。
现在就能用上的做法
这个故事有意思的地方在于,它不只是一条融资新闻。DesignArena现在谁都可以免费试用。跑分之外,这几个方法可以直接用起来。
- 让真人给你的AI草稿打分
在designarena.ai输入一句提示词,多个模型会同时生成网站、图片或演示文稿。如果拿不准自己做出来的东西到底行不行,拿去做个A/B投票试试。 - 选工具看排行榜,别只看跑分
网站、Logo、演示文稿等每个类别都有独立的真实用户投票排名。"这个模型代码写得好,审美是不是也在线",与其看参数表,不如看真实投票结果。 - 在团队内部搭个迷你A/B循环
只要新落地页或文案有两个以上的方案,就用Slack或一个简单表单让团队投"哪个更好",养成习惯。DesignArena是在几百万人规模上做这件事,你可以在团队几十人的规模上复刻同一个机制。 - 上传前再确认一遍条款
上传到这类平台的草稿,有可能作为审美数据卖给前沿实验室。如果是涉及客户机密的作品,上传前一定要看清条款。
想深入了解可以看看
TechCrunch原文 最早报道这家公司的文章,附Grace Li的完整采访。techcrunch.com
DesignArena官网 亲自输入提示词,查看各类别排行榜。designarena.ai
Y Combinator主页 创始人背景、团队规模、批次信息都在这里。ycombinator.com
Yupp关门始末 拆解这家几乎一模一样的竞品为什么倒下。techbuzz.ai
Arena融资1.5亿美元的报道 同样的模式如何在文本评估市场跑出一只独角兽。siliconangle.com




