AI 전화 상담의 진짜 위험은 자연스럽지 않은 목소리가 아니라, 틀린 주소를 알아듣고도 자신 있게 다음 단계로 넘어가는 순간이에요. ThunderPhone에서 눈여겨볼 부분도 분당 2센트나 47개 언어보다, 배포 전 시뮬레이션과 운영 중 개입을 하나의 개선 루프로 묶었다는 점입니다.

3초 요약
업무 성공 기준 정의 AI 발신자 시뮬레이션 실제 통화 모니터링·조향 실패를 회귀 테스트로 전환

분당 2센트는 완성된 통화 가격이 아니에요

ThunderPhone의 최저 요금은 Spark 엔진 기준 분당 2센트입니다. Bolt는 5센트, 복잡한 프롬프트와 오디오 이해에 초점을 둔 Storm은 9센트예요. 구독료나 좌석 요금 없이 선불 종량제로 운영되지만, 이 숫자는 어디까지나 기본 엔진 가격입니다.

선택공개 요금실무에서 확인할 점
Spark2¢/분정형화된 예약 확인·리드 분류처럼 단순한 흐름부터 시험
Bolt5¢/분응답 속도와 일반 업무 성능의 균형이 필요한 경우 비교
Storm9¢/분예외가 많고 긴 지침이나 복잡한 판단이 필요한 통화에 검토
실시간 감독+8¢/분Spark와 Storm에서 제공되며 Bolt에는 적용되지 않음
프리미엄 언어·음성 경로최대 +3¢/분실제로 사용된 음성·언어 조합에 따라 달라짐

긴 프롬프트, 더 강한 추론 옵션, 실시간 감독, 데모 번호와 일부 언어에는 추가 비용이 붙습니다. 시뮬레이션도 무료 복제 통화가 아니에요. AI 발신자는 Spark 요금으로, 테스트 대상 에이전트는 선택한 엔진과 옵션대로 각각 계산됩니다. 따라서 최저 사양끼리 직접 연결한 시뮬레이션의 엔진 비용은 단순 계산상 분당 약 4센트부터지만, 전화망과 음성·언어 옵션에 따라 최종액은 달라집니다.

47개 언어도 같은 방식으로 읽어야 해요. 공식 문서상 음성 에이전트는 47개 언어와 123개 음성을 지원하고, 설정한 추가 언어로 통화 중 자동 전환할 수 있습니다. 다만 기본 엔진 요금에 포함되는 언어는 15개이고 나머지 32개는 분당 3센트가 추가됩니다. 한국어는 포함 언어이며 공식 목록에는 한국어용 음성 8개가 표시돼 있습니다.

가격 비교는 ‘성공한 업무 1건의 원가’로 하세요.

분당 가격에 평균 통화시간만 곱하면 재통화, 사람 전환, 잘못된 예약 취소 비용이 빠집니다. 총 통화비를 실제 완료된 예약·검증된 리드·해결된 문의 수로 나눈 값이 더 쓸모 있는 지표예요.

차별점은 시뮬레이션에서 실통화까지 이어지는 폐쇄 루프예요

좋은 구조는 배포 전에는 실패를 만들어내고, 배포 후에는 발견된 실패를 다음 테스트에 다시 넣는 것입니다. ThunderPhone의 시뮬레이션에서는 AI 발신자가 지정된 인물과 목적을 바탕으로 실제 대화를 진행합니다. 에이전트나 전화번호에 직접 연결할 수 있고, 결과는 일반 통화처럼 녹음·대화록·평가와 함께 기록됩니다.

시나리오는 직접 작성하거나 에이전트 프롬프트에서 생성할 수 있어요. 화난 고객, 잘못 건 전화, 불완전한 답변 같은 엣지 케이스를 포함하도록 요청할 수도 있습니다. 여러 시나리오를 스위트로 묶고 최소 통과율을 정하면 CI의 배포 게이트로 사용할 수 있고, 실제 통화에서 발견한 문제는 재사용 가능한 테스트 케이스로 승격할 수 있습니다.

여기에 실시간 운영 개입이 붙습니다. Live 화면에서 진행 중인 통화를 확인하고 조용히 듣거나, 발신자에게는 들리지 않는 최대 500자의 텍스트 지시를 에이전트에 보낼 수 있어요. 잘못 안내한 할인 코드를 바로잡거나 사람에게 넘기도록 지시하는 식입니다. 다만 공식 문서상 이 조향 기능은 실제 통화에서만 작동하고 시뮬레이션에서는 비활성화됩니다.

시뮬레이션은 미래의 실패를 찾고, 실시간 조향은 현재의 피해를 줄이며, 운영 관측은 반복되는 실패를 다음 배포의 테스트 자산으로 바꿉니다.

통화가 끝난 뒤에는 성공률, 실패 통화, 조기 종료, 인프라 오류, 평균 통화시간을 에이전트별로 볼 수 있습니다. 다만 ThunderPhone의 성공률은 AI 평가를 기반으로 하며, 통화량이 많은 구간에서는 최근 통화를 표본으로 상세 지표를 계산할 수 있다고 문서에 명시돼 있어요. 숫자를 볼 때 평가 기준과 표본 여부를 함께 확인해야 하는 이유입니다.

이 접근은 특정 제품만의 마케팅 논리가 아닙니다. Twilio도 음성 AI 평가에서 지연시간이나 단어 오류율만으로는 부족하고, 주문·예약 같은 전체 사용자 여정의 성공 여부를 측정해야 한다고 설명합니다. 현실적인 인물과 대화 흐름을 시뮬레이션하고, 변경 후 회귀 테스트와 운영 모니터링을 연결하는 방식도 권장해요.

벤치마크와 AI 채점은 출발점이지 구매 증명이 아니에요

Product Hunt 소개에는 Storm의 추가 지능 옵션이 Big Bench Audio에서 99.4%를 기록했다는 주장이 나옵니다. 높은 숫자지만 이것만으로 예약 성공률이나 상담 품질을 예측하면 곤란해요. Big Bench Audio는 1,000개의 합성 음성 질문으로 오디오 모델의 추론 능력을 평가하며, 형식 논리·길 찾기·물체 세기·참거짓 추론 네 범주로 구성됩니다. 소음 속 주소 확인, CRM 도구 호출, 고객의 취소 의사 처리 같은 회사 고유의 통화 흐름과는 평가 대상이 다릅니다.

시뮬레이터의 채점도 다시 검증해야 합니다. 상용 음성 AI 테스트 플랫폼 세 곳을 사람 평가와 비교한 연구에서는 플랫폼에 따라 시뮬레이션 품질과 평가 품질에 유의미한 차이가 나타났습니다. 연구는 고객 만족, 적절한 종료, 반복 회피, 대화 진행, 응답 일관성, 기대 결과 달성 등을 사람의 기준과 비교했어요. 즉, 에이전트가 AI 시험관에게 90점을 받았다는 사실보다 그 시험관의 판정이 실제 상담 관리자와 얼마나 일치하는지가 먼저입니다.

실시간 듣기와 조향은 품질 기능인 동시에 권한 문제예요.

누가 어떤 통화를 들을 수 있는지, 조향 문구가 로그에 남는지, 상담 기록과 개인정보를 얼마나 보관할지를 운영 정책으로 정하세요. 미국 소비자 대상 아웃바운드 마케팅이라면 AI 생성 음성에 적용되는 TCPA와 FTC의 텔레마케팅 규정, 사전 동의와 수신 거부 절차도 별도로 검토해야 합니다. FTC는 판매 목적의 자동·사전녹음 메시지와 Do Not Call, 발신 시간, 고지 의무에 구체적인 제한을 두고 있습니다. 다른 국가에 전화한다면 해당 관할의 통신·녹음·개인정보 규정을 확인해야 해요.

작은 마케팅 통화로 1주일 검증하는 법

1. 한 가지 결과만 고르세요

처음부터 판매 전 과정을 맡기지 말고 ‘웨비나 참석 확인’, ‘상담 예약 시간 확정’, ‘기존 문의의 자격 조건 확인’처럼 성공 여부를 명확히 판정할 수 있는 업무를 선택하세요. 필수 입력값, 금지 행동, 사람에게 넘길 조건을 문장으로 적고 성공·실패·안전 지표를 각각 하나씩 정합니다.

2. 정상 6개와 실패 6개를 시뮬레이션하세요

Voice Agents에서 초안을 만든 뒤 상단의 Simulation을 여세요. 정상 시나리오에는 동의·거절·일정 변경을, 실패 시나리오에는 주변 소음, 이름 철자 정정, 말 끊기, 언어 전환, 엉뚱한 질문, 사람 상담 요청을 넣습니다. 각 결과에서 최종 업무 완료뿐 아니라 잘못 실행된 도구 호출과 불필요한 재질문도 표시하세요.

3. 사람 판정과 AI 점수를 대조하세요

Call History의 대화록·녹음·평가를 마케팅 담당자와 상담 운영자가 각각 검토합니다. 두 사람이 합의한 판정을 정답으로 두고 AI 채점과 다른 통화를 모으세요. 차이가 반복되면 프롬프트를 고치기 전에 평가 기준부터 수정합니다.

4. 제한된 실통화에만 배포하세요

사전 동의가 확인된 소규모 대상부터 시작하고, Live 화면의 듣기·조향 권한은 지정된 운영자에게만 줍니다. 조기 종료, 사람 전환, 업무 완료율에 중단 기준을 걸어두세요. 실패 통화는 Create test case로 시나리오에 추가하고, 수정 버전이 기존 테스트와 새 테스트를 모두 통과할 때만 범위를 넓힙니다.

이렇게 운영하면 ‘분당 2센트짜리 상담원’이라는 비교에서 빠져나올 수 있어요. 최종 구매 판단은 가장 싼 통화가 아니라, 반복되는 실패를 얼마나 빨리 발견하고 재현하며 다음 배포에서 막을 수 있는지로 내려야 합니다.