AIの声が人間より速く反応すると、かえって鳥肌が立ってしまうんです。

最新の音声AIモデルは150ms以内に答えるのに対して、人間の平均反応速度は200~300msなんです。

その50msの差が信頼を崩してしまうことに気づいたスタートアップが、1,300万ドルを賭けて正反対の答えを作っています。

3秒でわかる要約
超人的なスピード 不信感(不気味の谷効果) Smallest.aiに1,300万ドル投資 並列処理+LLMオフロードのハイブリッド 人間のように「ためらう」音声エージェント

みんな、AIの声は速ければ速いほどいいと思っていますよね

対話型AIを作る人たちの間には、昔からの定説があります。レイテンシを下げれば下げるほど人間らしく聞こえるというものです。人同士が会話するとき、自然なターンテイキングの間隔は200~500msで、この範囲を外れると会話が「途切れた」ように感じられる、というのがその根拠です。

そこで業界はここ数年、この数字を縮めることに躍起になってきました。その結果、最新の音声モデルはストリーミング条件下で約150msで応答できるレベルまで到達しています。問題は、これが人間の平均反応速度(200~300ms)より速いということなんです。

スピード競争には勝ったのに、肝心の通話はかえってぎこちなくなってしまいました。

でも、そのスピードこそが問題だったんです

Voximplant CEOのAlexey Aylarovは、この現象を「不気味の谷効果(uncanny effect)」と呼んでいます。彼の説明はこうです。人は会話のタイミングによって、相手が話を聞いているか、急いでいるか、この会話が安全かどうかを判断しているというのです。AIが完璧で淀みない文章で機械的に割り込んでくると、相手の社会的シグナルを無視しているように感じられてしまう、というわけです。

ポイント

レイテンシをどれだけ下げたかよりも、その間をどれだけ人間らしく埋めたかが、実際の信頼度を左右します。

Smallest.aiが今回のシリーズA投資で作ろうとしているのは、まさにこの部分です。新アーキテクチャ「Hydra」は、聞く・推論する・行動する・応答するという工程を順番に処理するのではなく、同時に並列で処理します。複雑な質問が来たときは無理に即答せず、大型LLMに処理を委ねながら「今調べていますね」といった繋ぎのひと言を自然に挟み込みます。

これが可能なのは、ボトルネックの位置を把握しているからです。音声パイプラインの中で、LLM推論のステップが全体の遅延の40~60%を占めているんです。その遅延を隠すのではなく、人が実際に考えているときに出す「あー、ちょっと待ってくださいね」のような間として演出したわけです。スピードをただ削るのではなく、人間のためらいのパターンを模倣すること――これが今回のラウンドが狙っているポイントです。

150ms
最新音声AIの応答速度
200~300ms
人間の平均反応速度
2,100万ドル+
Smallest.ai累計調達額

じゃあ、なぜみんな自作せずに買って使うんでしょうか

Smallest.ai創業者のSudarshan Kamathの言葉が、この問いへの答えになっています。「音声を極限まで作り込むこと自体が、ほとんどの企業にとっては本業からリソースを奪う行為だ」というんです。コールセンターSaaSでもない限り、ターンテイキングのタイミングをチューニングしたり、STT・TTSモデルを管理したりするのは本業ではない、ということですね。

この主張を裏付ける数字もあります。Smallest.aiは、導入企業の対応コストが最大80%削減され、エージェントの生産性が10倍に伸びたと発表しています。RingCentral、Truecallerなどがすでに顧客として名を連ねています。同社自体も、このレイヤーをまるごと販売しています ― TTS(Waves)と音声エージェント(Atoms)を分あたり0.01ドルからAPIで提供しているんです。

実際、このレイヤーをアウトソーシングする流れは、市場全体の数字にも表れています。音声AIへのVC投資は、2022年の3億1,500万ドルから2024年には21億ドルへと7倍に増えました。2026年1月だけを見ても、ElevenLabsが5億ドル、Decagonが2億5,000万ドル、Deepgramが1億3,000万ドルを調達しています。ただ、全員が楽観的というわけではありません ― AnthropicのMike Kriegerは、今でもテキストインターフェースの方を信頼していると述べています。

韓国国内でも流れは同じです。Gartnerは2028年までに企業向けソフトウェアの33%以上にエージェント型AIが組み込まれると予測しており、Hyundai自動車やKakaoのような大企業も音声ベースのAIエージェントを自社サービスに取り入れつつあります。結局、残された選択肢はひとつです ― このレイヤーを自前で作るか、専門業者に任せるか。

3社を並べてみると、戦略の違いがはっきり見えてきます。

サービスポジショニングレイテンシベンチマーク
Smallest.ai小型特化モデル+LLMハイブリッドTTSで10秒分の音声を100msで生成
CartesiaSSMベース、オンプレミス配備が可能Sonic Turbo 40ms
ElevenLabs品質・多様性でリード、コンテンツ制作に特化Flash V2 75ms

音声AIエージェントを導入する前にチェックすべきこと

今すぐこうしたアーキテクチャを自前で実装する必要はありません。その代わり、ベンダーを選ぶときは以下の5つを必ず確認してください。

  1. レイテンシの基準を数値で明確にする
    「1秒以内」ではなく「300~500ms、ストリーミング対応の有無」を基準にしましょう。韓国国内の多くの導入ガイドが示す「1秒以内」という基準は、業界最新の基準よりもかなり緩いものです。
  2. デモでわざと話を遮ってみる
    自然に譲って会話を再開するか、それとも機械的に声をかぶせてくるだけなのか、実際にテストしてみてください。
  3. 複雑な質問を委任する流れを確認する
    LLMに処理を渡すとき、つなぎのひと言が自然かどうか、不自然な沈黙が続いていないかをチェックしましょう。
  4. オンプレミス・データマスキングのオプションを確認する
    通話録音や個人情報の扱い方はベンダーごとに大きく異なります。自社の運用環境に合っているか、事前に確認しておきましょう。
  5. 小さなシナリオひとつからパイロット導入
    対応業務をまとめて丸ごと任せるのではなく、反復頻度が高くリスクの低いシナリオをひとつ選んで先に導入し、数値を見てから拡張しましょう。

もっと深く知りたい方へ

Smallest.ai公式サイト Waves(TTS)・Atoms(音声エージェント)の製品ラインとリアルタイムデモを直接確認できます smallest.ai

The 300ms Rule (AssemblyAI) なぜ遅延300msが音声AIの生命線なのか、6段階のパイプラインを分解して解説した記事です assemblyai.com

The Uncanny Effect in Modern Voice AI AIの声が速すぎるとなぜかえって不快に感じるのか、Voximplant CEOが書いた原因分析です theaiinsider.tech

Cartesia vs ElevenLabs比較 SSMベースのアーキテクチャとトランスフォーマーベースのアーキテクチャが、レイテンシの面でどう違うのかを比較しています cartesia.ai

Voice AI in 2026 (AssemblyAI) 音声AIへの投資・採用動向をデータでまとめたシリーズです。市場全体の流れが気になる方はここから assemblyai.com

AIボイスエージェント導入ガイド (Humelo) コールボットとボイスエージェントの違い、韓国企業が実際にチェックしている導入基準をまとめた資料です humelo.com