米国憲法をAIが書いたと判定した検出ツールがあります。ダ・ヴィンチ・コードを100%AI作品だと言い張った検出ツールもあります。
そんな検出ツール市場に、今週900万ドルが集まりました。
検出ツールを2つ回すと結果が違うんです
まず、インターネットのどれだけがAI製なのかから見てみましょう。2025年5月時点で新規に作られたウェブサイトの35.3%がAIの助けを借りて作られていて、そのうち17.6%はほぼ完全にAI生成でした。Imperial College London、Stanford、Internet Archiveの共同研究チームがWayback Machineのアーカイブを調べて出した数字です。
だからこそ「これAIが書いたんじゃない?」を判定するツールが次々出てきたんですけど、問題はこのツールたちがお互いに矛盾する判定を出すことなんです。GPTZeroとOriginality.aiを並べてベンチマークしたFritz AIのテストでは、GPTZeroが米国憲法をAI作成としてフラグを立て、Originality.aiはダ・ヴィンチ・コードの本文を100%AI生成と判定しました。
最新モデルへの対応力の差はもっと深刻です。同じベンチマークで、GPT-5で書かれた文章をGPTZeroは100%見抜いたのに、Originality.aiは31.7%しか見抜けませんでした。GPT-5-miniだとそれぞれ94.9%と7.3%です。どちらを使うかで「AIが書いた」という判定自体が変わってしまうんですよね。
| ツール | 強み | 知られている弱点 |
|---|---|---|
| GPTZero | GPT-5検出100%、無料枠(月1万語)あり | 言い換え文章に弱い、憲法を誤検出した実績 |
| Originality.ai | 言い換え回避の検出に強い、盗用チェック機能付き | 旧モデル中心の学習でGPT-5検出は31.7%止まり |
| Pangram | 精度99%以上、エラー率は1万件に1件、画像にも対応拡大 | 無料枠なし(月$20〜)、実績はまだ米国中心 |
これは机上の話じゃなくて、現場で実害になっています。真面目に自分で書いた学生の文章がAIと誤判定される一方、AIが書いた提出物がそのまま通ってしまうこともあるんです。Originality.ai自身が15件の独立研究をまとめたメタ分析でも、「AI検出スコアを学術不正の唯一の指標として使うべきではない」と釘を刺しています。
だからPangramは違うアプローチを取ったんです
今回900万ドルを調達したPangramは、ニューヨーク拠点のスタートアップです。Menlo Venturesが主導し、Haystack、ScOp、Script Capital、Cadenzaが参加。2025年6月のシード270万ドルを含め、累計調達額は約1,300万ドルになりました。共同創業者のMax SperoはStanfordのAI大学院出身で、LLMを使ったロシアの偽情報キャンペーンを見て起業を決めたと語っています。
技術のアプローチが面白いんです。透かしやメタデータを見るんじゃなくて、文書ごとに「synthetic mirror(合成ミラー)」を作るんです。テーマ・長さ・トーンは同じで、最先端LLMで書き直した双子の文書です。この2つのスタイルの違い、つまりAIが一貫して繰り返す言葉選びのパターンを学習する方式なんですよね。
今回の調達で画像検出(Pangram Image)も新しく始まりました。ピクセル単位の統計的な違いを見る方式なので、FLUX、Midjourney、Grok Imagineのように透かしがない生成ツールにも対応できるそうです。それも当然で、人がAI画像を見抜く精度は平均63.7%なのに、FLUX製画像だと29%まで下がるんです — コイントスより悪い数字です。SubstackとQuoraはすでにPangramでコンテンツをチェックしていて、Substackは先月(7月21日)から100語以上の投稿に「人間作成/AI補助/AI生成」の割合ラベルを表示し始めました。
もちろん韓国の事情はちょっと違います。ムハユ代表のインタビューによると、海外の検出ツールで韓国語を検査すると、精度はほぼ「運任せ」レベルだったそうです。だから韓国語専用に学習させた「GPTキラー」を別に作っていて、2025年8月にはGPT-5検出機能を追加して精度98%を主張しています。
AI検出結果、実務ではこう使うと安全です
検出ツール1つの数字を鵜呑みにして採用を取り消したり、学生を処分したりすると事故になります。以下の順番で使うのが安全です。
- 結果を唯一の証拠にしない
検出スコアはあくまで状況証拠で、確定判決じゃありません。最終判断の前に必ず本人に弁明の機会を与えましょう。 - 最低2つのツールでクロスチェック
GPTZeroの無料枠(月1万語)でまず確認して、微妙なら有料のPangramやOriginality.aiでもう一度回してみましょう。結果が完全に割れたら、それ自体がサインです。 - 文書全体じゃなく段落単位で見る
検出ツールは段落ごとの確率を合算しています。全体平均だけじゃなく、どの段落が引っかかったかを確認しましょう。 - 非英語コンテンツは言語専用ツールも併用
海外ツールだけだと非英語コンテンツの判定が不正確なことがあります。韓国語ならGPTキラーのような国内ツールを併用しましょう。 - チームなら異議申し立て手順を先に文書化
誤検出が起きたとき誰がどう再確認するか決めていないと、間違って疑われた人がそのまま埋もれてしまいます。
| 検出結果を1つだけ信じる | クロスチェックする | |
|---|---|---|
| 誤検出リスク | 憲法・ダ・ヴィンチ・コード級の誤判定もあり得る | 2つのツールが同時に間違う確率は低い |
| 判断根拠 | 数字1つで断定 | 状況証拠+弁明の機会 |
| コスト | ツール1つ分の料金 | 無料枠の組み合わせでも可能 |
もっと深く知りたいなら
Pangramの900万ドル調達、原文はこちら synthetic mirror方式と創業の背景を一番詳しく扱ったTechCrunchの原文です techcrunch.com
Pangramの画像検出拡大に関する記事 累計調達額、画像検出精度、人間の判別精度の数字がまとまっています siliconangle.com
GPTZero vs Originality.aiベンチマーク 憲法・ダ・ヴィンチ・コードの誤検出事例を含む実際の比較テストです fritz.ai
AI検出精度、15件の研究メタ分析 「唯一の指標にするな」という提言の元になった分析です originality.ai
Dead Internet Theoryを検証した研究 Imperial College London・Stanford・Internet Archiveが実際にインターネットの何%がAIかを測定した研究です gizmodo.com
ムハユ「GPTキラー」精度98%発表 韓国唯一の韓国語専用検出サービスの最新アップデート情報です hellot.net




