随着AI代理在客户支持领域的能力不断提升,大多数人仍能立刻分辨出自己是在与机器还是人类对话。Smallest.ai是一家成立于2024年底的初创公司,他们认为语音代理的下一次飞跃不会来自加速大型语言模型,而是依靠专为人类对话设计的小型专业模型。简单来说,该公司致力于让与AI代理的对话与人类交流无异。
为此,Smallest.ai正在开发一款小型语音模型,模拟人类在听、思考和说话时的同步处理方式。
Smallest.ai的创始人兼CEO Sudarshan Kamath表示:“当我和你说话时,你已经在思考了,如果我说得太久,你可能会打断我。”这正是他们模型设计的工作原理。
为了实现这一目标,Smallest.ai完成了由Seligman Ventures领投,Sierra Ventures和3one4 Capital参与的1300万美元A轮融资,使公司累计融资超过2100万美元。
Kamath解释道:“大型语言模型的工作方式是先接收完整提示,然后开始思考。虽然这种延迟在文本聊天中可以接受,但在语音对话中,即使是短暂的停顿也会显得不自然。我们说话时,不会先给你一大段音频,然后你才开始思考。”
该公司的模型作为实时智能层,支持特定话题上的自然客户对话,几乎没有响应延迟。但当遇到模型知识库之外的问题时,Smallest.ai会将查询转交给大型基础模型,短暂让客户等待“查询”问题,就像真人客服一样。
Kamath认为,未来所有AI代理都将依赖两种模型:一个用于实时交互的小型语音模型,另一个是按需调用的“离线”大型语言模型,用于解决复杂问题。

与大型基础模型不同,Smallest.ai专注于语音特有的细节处理,比如应对多样口音、支持多种语言以及在嘈杂环境中的表现。
目前,Smallest.ai的客户包括语音领域的企业,如RingCentral和Truecaller。Kamath表示,任何客户支持公司,包括新兴企业如Sierra和Decagon,都是潜在客户。
当被问及为何资金充足的AI客户支持公司不自行开发语音模型时,Kamath指出:“对客户支持初创企业来说,专注于语音技术会分散他们的核心业务精力。”
Smallest.ai的竞争对手包括语音AI领导者ElevenLabs,以及专注本地语言的Cartesia和Sarvam等区域性企业。
虽然部分竞争者将语音AI应用于音频配音和播客等场景,Smallest.ai则专注于为企业客户打造实时对话语音代理。
Kamath总结道:“我们的目标是让模型通过图灵测试。你和我们的模型对话时,无法分辨是AI还是人类。这是公司的唯一追求。”


