如果AI的声音比人反应还快,反而会让人起鸡皮疙瘩。

最新的语音AI模型能在150毫秒内做出回应,而人类的平均反应速度是200~300毫秒。

一家创业公司发现,正是这50毫秒的差距在悄悄瓦解信任,于是押上1300万美元,反其道而行之。

3秒速览
超人速度 不信任感(uncanny effect) Smallest.ai获得1300万美元投资 并行处理+LLM卸载混合架构 像人一样会“犹豫”的语音智能体

大家都以为AI的声音越快越好

做对话式AI的人之间流传着一个老公式:延迟越低,听起来就越像人。人与人对话时,自然的轮流间隔是200~500毫秒,一旦超出这个区间,对话就会给人一种“卡壳”的感觉,这就是这个公式的依据。

所以过去几年,整个行业都在拼命压缩这个数字。结果最新的语音模型在流式传输条件下,已经能做到约150毫秒就响应。问题是,这比人类的平均反应速度(200~300毫秒)还要快。

速度竞赛赢了,可通话本身却变得更别扭了。

但问题恰恰出在这个速度上

Voximplant CEO Alexey Aylarov把这种现象称为“恐怖谷效应(uncanny effect)”。他是这么解释的:人会通过对话的节奏来判断对方是不是在认真听、是不是在赶时间、这场对话是否安全。如果AI用完美无瑕、干净利落的句子像机器一样插话进来,就会让人觉得它完全无视了对方发出的社交信号。

核心要点

真正决定信任感的,不是把延迟压得多低,而是那段空白被填补得有多像人。

Smallest.ai这轮A轮融资要打造的,正是这个点。它的新架构“Hydra”不再按顺序处理听、推理、行动、回应这几步,而是同时并行处理。遇到复杂问题时,它不会硬着头皮马上作答,而是把问题交给大模型处理,同时自然地插入一句“我正在帮您查一下”之类的过渡话术。

之所以能做到这一点,是因为他们清楚瓶颈在哪里。在语音处理链路里,LLM推理这一步占了整体延迟的40%~60%。与其藏起这段延迟,不如把它演绎成人真正在思考时会说的“嗯,稍等一下”。不是一味压缩速度,而是模仿人类的犹豫模式——这才是这一轮融资真正瞄准的方向。

150ms
最新语音AI的响应速度
200~300ms
人类的平均反应速度
$2,100万+
Smallest.ai累计融资额

那为什么大家都不自己做,而是选择直接采购?

Smallest.ai创始人Sudarshan Kamath的话就是答案。他说:“把语音这件事做到极致本身,对大多数公司来说就是在从核心业务里抢资源”。也就是说,除非你本身就是做呼叫中心SaaS的,否则调优对话轮换的时机、维护STT/TTS模型根本不是你的主业。

支撑这个说法的还有具体数字。Smallest.ai表示,客户企业的客服成本最多降低了80%,坐席生产力提升了10倍。RingCentral、Truecaller等公司已经是它的客户。公司本身就是把这整套能力打包出售——TTS产品(Waves)和语音智能体(Atoms)以每分钟$0.01起的价格通过API提供。

把这一层外包出去的趋势,从整个市场的数字上也能看出来。流向语音AI的风投资金从2022年的3.15亿美元增长到2024年的21亿美元,翻了7倍。仅在2026年1月这一个月里,ElevenLabs就融资5亿美元,Decagon融资2.5亿美元,Deepgram融资1.3亿美元。不过也不是所有人都这么乐观——Anthropic的Mike Krieger就表示,他仍然更信任文字界面。

韩国国内的情况也类似。Gartner预测到2028年,超过33%的企业软件将接入智能体式AI,现代汽车、Kakao等大企业也在把语音AI智能体接入自家服务。说到底,能选的路只有一条——是自己做这一层,还是交给专业的公司。

把这三家公司放在一起比较,战略差异就很明显了。

产品定位延迟基准
Smallest.ai小型专用模型+LLM混合架构100毫秒内生成10秒时长的TTS语音
Cartesia基于SSM,支持本地化部署Sonic Turbo 40毫秒
ElevenLabs音质与多样性领先,专注内容创作场景Flash V2 75毫秒

接入语音AI智能体之前,先检查这几点

你不需要马上自己去实现这种架构。但挑选供应商时,下面这5点一定要确认清楚。

  1. 把延迟标准量化到具体数字
    不要用“1秒以内”这种模糊标准,而是明确到“300~500毫秒,是否支持流式传输”。国内不少导入指南给出的“1秒以内”标准,比行业最新水平要宽松得多。
  2. 在演示中故意打断它说话
    亲自测试一下:它是自然地让步再接着说,还是像机器一样直接和你说话重叠。
  3. 确认复杂问题的转交流程
    检查转交给LLM处理时,过渡话术是否自然,会不会出现尴尬的沉默。
  4. 确认本地化部署与数据脱敏选项
    不同供应商在通话录音和个人信息处理方式上差异很大。提前确认是否符合你的部署环境要求。
  5. 先从一个小场景试点
    不要一次性把所有客服业务都交出去,先挑一个高频、低风险的场景接入,看数据表现再逐步扩大范围。

想深入了解的话

Smallest.ai官网 可以直接查看Waves(TTS)和Atoms(语音智能体)产品线以及实时演示 smallest.ai

The 300ms Rule (AssemblyAI) 拆解语音AI的6步处理链路,解释为什么300毫秒延迟是一道分水岭 assemblyai.com

The Uncanny Effect in Modern Voice AI Voximplant CEO撰写的原因分析,解释AI语音太快为什么反而让人不舒服 theaiinsider.tech

Cartesia vs ElevenLabs对比 直接比较了基于SSM的架构和基于Transformer的架构在延迟上的差异 cartesia.ai

Voice AI in 2026 (AssemblyAI) 用数据梳理语音AI投资与采用趋势的系列文章,想了解市场全貌可以从这里开始 assemblyai.com

AI语音智能体导入指南(Humelo) 梳理了呼叫机器人与语音智能体的区别,以及韩国企业实际会用到的导入评估标准 humelo.com