有一款AI检测工具判定美国宪法是AI写的。还有一款直接判定《达芬奇密码》100%是AI生成的。

就是这样一个检测工具市场,这周拿到了900万美元融资。

3秒读懂
检测工具结果各不相同 误判事故频发 Pangram融资900万美元 号称精度99%+ 但交叉验证仍是必须的

同一篇文章,两个检测工具给出两个答案

先看看现在互联网到底有多少内容是AI写的。截至2025年5月,新建网站里35.3%是在AI辅助下做的,其中17.6%几乎完全由AI生成。这是伦敦帝国理工学院、斯坦福大学和互联网档案馆的联合研究团队,通过扒Wayback Machine的历史存档得出的数字。

正因为这样,判断"这是不是AI写的"的工具一下子冒出来一大堆。问题是这些工具彼此的判断经常互相矛盾。Fritz AI做的GPTZero和Originality.ai横向测评里,GPTZero把美国宪法标记为AI写的,Originality.ai则把《达芬奇密码》原文判定为100%AI生成

面对最新模型,差距更大。同一个测评里,GPTZero能识别出100%的GPT-5生成文本,Originality.ai只能识别31.7%。GPT-5-mini的话,两者分别是94.9%和7.3%。你用哪个工具,直接决定了"是不是AI写的"这个结论。

工具优势已知弱点
GPTZeroGPT-5检测率100%,有免费额度(每月1万词)对改写文本较弱,曾误判宪法
Originality.ai抗改写检测能力强,附带查重功能主要基于旧模型训练,GPT-5检测率仅31.7%
Pangram精度99%+,错误率约万分之一,已扩展到图像检测没有免费额度(月费$20起),海外案例还不多

这不是纸上谈兵,已经在现实中造成了伤害。认真自己写作业的学生被误判成用了AI,反而真用AI写的内容顺利过关。就连Originality.ai自己汇总15项独立研究做的元分析都提醒:"不应把AI检测分数当作学术不端的唯一证据"。

所以Pangram换了个思路

这次拿到900万美元的Pangram是一家纽约创业公司。由Menlo Ventures领投,Haystack、ScOp、Script Capital、Cadenza跟投,加上2025年6月的270万美元种子轮,公司累计融资额已达约1300万美元。联合创始人Max Spero毕业于斯坦福AI研究生项目,他说自己创业的原因是看到了LLM驱动的俄罗斯虚假信息宣传活动。

技术思路挺有意思。它不看水印也不看元数据,而是给每篇文档生成一个"合成镜像(synthetic mirror)"——主题、长度、语气都一样,但由顶尖LLM重新写一遍的"双胞胎"文档。然后学习两者之间的文风差异,也就是AI反复出现的、一致的用词选择模式。

$900万
本轮融资额
99%+
号称的文本检测精度
29%
人类识破FLUX生成图片的比例

这轮融资也带来了新产品——图像检测(Pangram Image)。它靠的是像素级的统计差异,而不是水印,所以能识别FLUX、Midjourney、Grok Imagine这类没有水印的生成工具。这一点很关键,因为人类在这方面表现很差:平均识别AI图片的准确率只有63.7%,面对FLUX生成的图片时更是跌到29%——比抛硬币还不如。Substack和Quora已经在用Pangram检测内容了,Substack上个月(7月21日)开始给100词以上的帖子打上"人工撰写/AI辅助/AI生成"的比例标签。

不过韩国的情况有点不一样。据Muhayu公司CEO的采访,用海外检测工具检测韩语文本,准确率基本靠运气。所以他们专门做了个韩语专用检测工具"GPT杀手"(GPT Killer),2025年8月还加上了GPT-5检测功能,号称精度98%。

AI检测结果,实际工作中要这样用才安全

拿到一个检测工具的分数就直接取消录用或者处分学生,是很容易出事的。按下面这个顺序用会安全得多。

  1. 不要把结果当成唯一证据
    检测分数只是旁证,不是最终判决。做决定之前,一定要给对方解释的机会。
  2. 至少用两个工具交叉验证
    先用GPTZero的免费额度(每月1万词)过一遍,结果模糊的话再用付费的Pangram或Originality.ai复查。如果两个结果完全对不上,这本身就是个信号。
  3. 看段落级别的分数,不只看整体平均
    检测工具是按段落算概率的。别只看总分,要确认到底是哪一段触发了警报。
  4. 非英语内容要搭配本地化工具
    海外工具单独用,在非英语内容上误判率可能很高。中文或韩语内容建议搭配本地专用工具。
  5. 团队用的话,先把申诉流程写清楚
    出现误判时如果没人负责复核,被冤枉的人就这么被晾在那了。
只信一个检测结果交叉验证
误判风险可能出现宪法、达芬奇密码级别的误判两个工具同时判错的概率很低
决策依据一个数字直接下结论旁证+解释机会
成本一个工具的订阅费靠免费额度组合也能做到

想深入了解的话

Pangram 900万美元融资原文 关于合成镜像检测方式和创业背景讲得最详细的TechCrunch原文 techcrunch.com

Pangram图像检测扩展报道 累计融资额、图像检测精度、人类识别准确率的数字都在这里 siliconangle.com

GPTZero对比Originality.ai测评 包含宪法、达芬奇密码误判案例的实测对比 fritz.ai

AI检测精度15项研究元分析 "别当唯一证据"这个建议的出处 originality.ai

验证Dead Internet Theory的研究 伦敦帝国理工、斯坦福、互联网档案馆实测了互联网到底有多少内容是AI生成的 gizmodo.com

Muhayu「GPT杀手」精度98%发布 韩国本土韩语专用检测服务的最新更新消息 hellot.net