8 月 31 日消息,AI视频公司 Tavus 发布实时对话理解模型 Sparrow-2,并已在 Tavus PAL、API 和企业平台中正式可用。它不再只用静音时长判断用户是否说完,而是同时分析语义、词汇结构、语调、停顿、说话人和环境声音,持续判断系统应当倾听、等待、说话还是继续说。

Sparrow-2 以 10ms 帧率流式处理音频,每秒可更新 100 次对话状态,粒度较上一代提高 4 倍;处理 80ms 音频约需 7ms,上一代约为 30ms。模型可区分「嗯」等附和与真正打断,在用户思考时等待 6~8 秒,并在声音无法可靠辨认时请求重复,而非基于错误转写继续回答。
Tavus 称,模型使用 1.6 万段真实对话和 2000 段合成对话训练。在 575 个真实对话事件测试中,Sparrow-2 的时机判断失败率为 2.1%,约为最佳对比模型的四分之一;面对超过 1 秒的思考停顿,它有 97% 的情况不会抢话。上述对比包含 Tavus 自建评测,LiveKit 仅采用可在设备端运行的 v1-mini,并非其最先进模型。