AI電話対応の本当のリスクは、声が不自然なことではありません。間違った住所を聞き取っているのに、自信を持って次の段階へ進んでしまう瞬間です。ThunderPhoneで注目すべき点も、1分2セントや47言語ではなく、導入前のシミュレーションと運用中の介入を一つの改善ループに結び付けていることです。
1分2セントは完成した通話の価格ではありません
ThunderPhoneの最安料金は、Sparkエンジンで1分2セントです。Boltは5セント、複雑なプロンプトと音声理解に重点を置くStormは9セントです。サブスクリプション料やシート料金なしの前払い従量制ですが、この数字はあくまで基本エンジン価格です。
| 選択肢 | 公開料金 | 実務で確認する点 |
|---|---|---|
| Spark | 2¢/分 | 定型的な予約確認・リード判定など、単純なフローから試験 |
| Bolt | 5¢/分 | 応答速度と一般業務性能のバランスが必要な場合に比較 |
| Storm | 9¢/分 | 例外が多く、長い指示や複雑な判断が必要な通話で検討 |
| リアルタイム監督 | +8¢/分 | SparkとStormで提供され、Boltには適用されません |
| プレミアム言語・音声ルーティング | 最大 +3¢/分 | 実際に使用した音声・言語の組み合わせによって異なります |
長いプロンプト、より強力な推論オプション、リアルタイム監督、デモ番号、一部の言語には追加料金がかかります。シミュレーションも無料の複製通話ではありません。AI発信者はSpark料金で、テスト対象のエージェントは選択したエンジンとオプションに従って別々に計算されます。そのため、最低仕様同士を直接つないだシミュレーションのエンジン費用は単純計算で1分約4セントからですが、電話網と音声・言語オプションによって最終額は変わります。
47言語も同じように読む必要があります。公式ドキュメントによると、音声エージェントは47言語と123種類の音声をサポートし、設定した追加言語へ通話中に自動で切り替えられます。ただし、基本エンジン料金に含まれるのは15言語で、残り32のプレミアム言語には1分3セントが追加されます。韓国語は含まれる言語で、公式リストには韓国語の音声が8種類表示されています。
価格は「成功した業務1件の原価」で比較してください。
1分あたりの価格に平均通話時間を掛けるだけでは、再通話、人への引き継ぎ、誤った予約の取消コストが抜け落ちます。総通話費を、実際に完了した予約・検証済みリード・解決済み問い合わせ数で割った値の方が有用な指標です。
差別化ポイントは、シミュレーションから実通話まで続く閉ループです
良い仕組みとは、導入前に失敗を作り出し、導入後に見つかった失敗を次のテストへ戻すことです。ThunderPhoneのシミュレーションでは、AI発信者が指定された人物像と目的に基づいて実際の会話を行います。エージェントまたは電話番号へ直接接続でき、結果は通常の通話と同様に録音・文字起こし・評価とともに記録されます。
シナリオは自分で作成することも、エージェントのプロンプトから生成することもできます。怒った顧客、間違い電話、不完全な回答といったエッジケースを含めるよう依頼することも可能です。複数のシナリオをスイートにまとめ、最低合格率を設定すれば、CIのデプロイゲートとして使えます。また、実通話で見つけた問題は再利用可能なテストケースへ昇格できます。
そこにリアルタイムの運用介入が加わります。Live画面では進行中の通話を確認して静かに聞いたり、発信者には聞こえない最大500文字のテキスト指示をエージェントへ送ったりできます。誤って案内した割引コードを訂正したり、人へ引き継ぐよう指示したりする使い方です。ただし公式ドキュメントによると、この操舵機能は実通話でのみ動作し、シミュレーションでは無効です。
通話終了後は、成功率、失敗通話、早期終了、インフラエラー、平均通話時間をエージェントごとに確認できます。ただしThunderPhoneの成功率はAI評価に基づき、通話量が多い期間では最近の通話を標本として詳細指標を算出する場合があると、ドキュメントに明記されています。数字を見る際に、評価基準と標本かどうかを併せて確認すべき理由です。
このアプローチは特定製品だけのマーケティング論理ではありません。Twilioも、音声AIの評価ではレイテンシーや単語誤り率だけでは不十分であり、注文・予約などのユーザージャーニー全体の成功を測る必要があると説明しています。現実的な人物像と会話フローをシミュレーションし、変更後の回帰テストと運用監視をつなぐ方法も推奨しています。
ベンチマークとAI採点は出発点であり、購入の証明ではありません
Product Huntの紹介には、Stormの追加インテリジェンスオプションがBig Bench Audioで99.4%を記録したという主張があります。 高い数字ですが、これだけで予約成功率や対応品質を予測するのは危険です。Big Bench Audioは1,000件の合成音声質問でオーディオモデルの推論能力を評価し、形式論理・経路探索・物体数え・真偽推論の4カテゴリーで構成されます。 騒音下での住所確認、CRMツールの呼び出し、顧客のキャンセル意思の処理といった企業固有の通話フローとは、評価対象が異なります。
シミュレーターの採点も再検証が必要です。商用音声AIテストプラットフォーム3社を人による評価と比較した研究では、プラットフォームごとにシミュレーション品質と評価品質に有意な差が見られました。この研究は、顧客満足、適切な終了、繰り返し回避、会話の進行、応答の一貫性、期待結果の達成などを人の基準と比較しました。 つまり、エージェントがAI試験官から90点を取ったことよりも、その試験官の判定が実際のサポート管理者とどれほど一致するかが先です。
リアルタイムの聞き取りと操舵は品質機能であると同時に、権限の問題でもあります。
誰がどの通話を聞けるのか、操舵文がログに残るのか、対応記録と個人情報をどれだけ保管するのかを、運用ポリシーとして定めてください。米国の消費者向けアウトバウンドマーケティングでは、AI生成音声に適用されるTCPAおよびFTCのテレマーケティング規則、事前同意とオプトアウト手続きも別途確認する必要があります。FTCは、販売目的の自動・事前録音メッセージ、Do Not Call、発信時間、開示義務に具体的な制限を設けています。 他国へ電話する場合は、その管轄の通信・録音・個人情報規則を確認してください。
小規模なマーケティング通話で1週間検証する方法
1. 結果を一つだけ選びます
最初から販売プロセス全体を任せず、「ウェビナー参加の確認」「相談予約時間の確定」「既存問い合わせの適格条件確認」のように、成功の可否を明確に判定できる業務を選んでください。必須入力、禁止行為、人へ引き継ぐ条件を文章で書き、成功・失敗・安全の指標をそれぞれ一つずつ定めます。
2. 正常ケース6件と失敗ケース6件をシミュレーションします
Voice Agentsで下書きを作成したら、上部のSimulationを開きます。正常シナリオには同意・拒否・日程変更を、失敗シナリオには周囲の雑音、名前のスペル訂正、話の遮り、言語切り替え、無関係な質問、人の担当者への依頼を入れます。各結果で最終的な業務完了だけでなく、誤って実行されたツール呼び出しや不要な聞き直しも記録してください。
3. 人の判定とAIスコアを照合します
Call Historyの文字起こし・録音・評価を、マーケティング担当者とサポート運用担当者がそれぞれ確認します。二人が合意した判定を正解とし、AI採点と異なる通話を集めてください。差異が繰り返される場合は、プロンプトを直す前に評価基準から修正します。
4. 限定した実通話にのみ導入します
事前同意を確認できた小規模な対象から始め、Live画面の聞き取り・操舵権限は指定された運用担当者だけに与えます。早期終了、人への引き継ぎ、業務完了率に中止基準を設けてください。失敗通話はCreate test caseでシナリオに追加し、修正版が既存テストと新規テストの両方に合格したときだけ範囲を広げます。
このように運用すれば、「1分2セントの担当者」という比較から抜け出せます。最終的な購入判断は最も安い通話ではなく、繰り返す失敗をどれだけ速く発見・再現し、次のデプロイで防げるかで下すべきです。
さらに深く知りたい場合
ThunderPhone: Platform for building reliable AI phone agents (from 2c/min) | Product Hunt — リリース説明と、制作者が示したマルチモデル・レイテンシー・可観測性に関する主張を原文の文脈で確認できます。 producthunt.com
ThunderPhone pricing and usage charges — エンジン別の基本料金、監督・言語・長いプロンプトの追加費用、シミュレーションの課金方式を計算する際に必要な公式表です。 thunderphone.com
Simulate a call before you ship — シナリオ生成、テストスイート、最低合格率、実際の失敗をテストケースへ変換する手順を説明しています。 thunderphone.com
How Do You Know if Your Voice AI Agents are Working? — 技術指標より業務全体の成功を先に評価すべき理由と、音声エージェントの回帰テスト方法をまとめた資料です。 twilio.com
Testing the Testers: Human-Driven Quality Assessment of Voice AI Testing Platforms — シミュレーションと自動評価そのものの品質を、人の基準で検証すべきだとする研究です。 arxiv.org
Complying with the Telemarketing Sales Rule — 米国消費者向けのアウトバウンドキャンペーンを運用する際に、同意、開示、オプトアウト、自動発信の制限を確認できます。 ftc.gov


