有一款AI检测工具判定美国宪法是AI写的。还有一款直接判定《达芬奇密码》100%是AI生成的。
就是这样一个检测工具市场,这周拿到了900万美元融资。
同一篇文章,两个检测工具给出两个答案
先看看现在互联网到底有多少内容是AI写的。截至2025年5月,新建网站里35.3%是在AI辅助下做的,其中17.6%几乎完全由AI生成。这是伦敦帝国理工学院、斯坦福大学和互联网档案馆的联合研究团队,通过扒Wayback Machine的历史存档得出的数字。
正因为这样,判断"这是不是AI写的"的工具一下子冒出来一大堆。问题是这些工具彼此的判断经常互相矛盾。Fritz AI做的GPTZero和Originality.ai横向测评里,GPTZero把美国宪法标记为AI写的,Originality.ai则把《达芬奇密码》原文判定为100%AI生成。
面对最新模型,差距更大。同一个测评里,GPTZero能识别出100%的GPT-5生成文本,Originality.ai只能识别31.7%。GPT-5-mini的话,两者分别是94.9%和7.3%。你用哪个工具,直接决定了"是不是AI写的"这个结论。
| 工具 | 优势 | 已知弱点 |
|---|---|---|
| GPTZero | GPT-5检测率100%,有免费额度(每月1万词) | 对改写文本较弱,曾误判宪法 |
| Originality.ai | 抗改写检测能力强,附带查重功能 | 主要基于旧模型训练,GPT-5检测率仅31.7% |
| Pangram | 精度99%+,错误率约万分之一,已扩展到图像检测 | 没有免费额度(月费$20起),海外案例还不多 |
这不是纸上谈兵,已经在现实中造成了伤害。认真自己写作业的学生被误判成用了AI,反而真用AI写的内容顺利过关。就连Originality.ai自己汇总15项独立研究做的元分析都提醒:"不应把AI检测分数当作学术不端的唯一证据"。
所以Pangram换了个思路
这次拿到900万美元的Pangram是一家纽约创业公司。由Menlo Ventures领投,Haystack、ScOp、Script Capital、Cadenza跟投,加上2025年6月的270万美元种子轮,公司累计融资额已达约1300万美元。联合创始人Max Spero毕业于斯坦福AI研究生项目,他说自己创业的原因是看到了LLM驱动的俄罗斯虚假信息宣传活动。
技术思路挺有意思。它不看水印也不看元数据,而是给每篇文档生成一个"合成镜像(synthetic mirror)"——主题、长度、语气都一样,但由顶尖LLM重新写一遍的"双胞胎"文档。然后学习两者之间的文风差异,也就是AI反复出现的、一致的用词选择模式。
这轮融资也带来了新产品——图像检测(Pangram Image)。它靠的是像素级的统计差异,而不是水印,所以能识别FLUX、Midjourney、Grok Imagine这类没有水印的生成工具。这一点很关键,因为人类在这方面表现很差:平均识别AI图片的准确率只有63.7%,面对FLUX生成的图片时更是跌到29%——比抛硬币还不如。Substack和Quora已经在用Pangram检测内容了,Substack上个月(7月21日)开始给100词以上的帖子打上"人工撰写/AI辅助/AI生成"的比例标签。
不过韩国的情况有点不一样。据Muhayu公司CEO的采访,用海外检测工具检测韩语文本,准确率基本靠运气。所以他们专门做了个韩语专用检测工具"GPT杀手"(GPT Killer),2025年8月还加上了GPT-5检测功能,号称精度98%。
AI检测结果,实际工作中要这样用才安全
拿到一个检测工具的分数就直接取消录用或者处分学生,是很容易出事的。按下面这个顺序用会安全得多。
- 不要把结果当成唯一证据
检测分数只是旁证,不是最终判决。做决定之前,一定要给对方解释的机会。 - 至少用两个工具交叉验证
先用GPTZero的免费额度(每月1万词)过一遍,结果模糊的话再用付费的Pangram或Originality.ai复查。如果两个结果完全对不上,这本身就是个信号。 - 看段落级别的分数,不只看整体平均
检测工具是按段落算概率的。别只看总分,要确认到底是哪一段触发了警报。 - 非英语内容要搭配本地化工具
海外工具单独用,在非英语内容上误判率可能很高。中文或韩语内容建议搭配本地专用工具。 - 团队用的话,先把申诉流程写清楚
出现误判时如果没人负责复核,被冤枉的人就这么被晾在那了。
| 只信一个检测结果 | 交叉验证 | |
|---|---|---|
| 误判风险 | 可能出现宪法、达芬奇密码级别的误判 | 两个工具同时判错的概率很低 |
| 决策依据 | 一个数字直接下结论 | 旁证+解释机会 |
| 成本 | 一个工具的订阅费 | 靠免费额度组合也能做到 |
想深入了解的话
Pangram 900万美元融资原文 关于合成镜像检测方式和创业背景讲得最详细的TechCrunch原文 techcrunch.com
Pangram图像检测扩展报道 累计融资额、图像检测精度、人类识别准确率的数字都在这里 siliconangle.com
GPTZero对比Originality.ai测评 包含宪法、达芬奇密码误判案例的实测对比 fritz.ai
AI检测精度15项研究元分析 "别当唯一证据"这个建议的出处 originality.ai
验证Dead Internet Theory的研究 伦敦帝国理工、斯坦福、互联网档案馆实测了互联网到底有多少内容是AI生成的 gizmodo.com
Muhayu「GPT杀手」精度98%发布 韩国本土韩语专用检测服务的最新更新消息 hellot.net




