Tavus 发布 Sparrow-2,让语音 Agent 学会等待和识别环境声

8 月 31 日消息,AI视频公司 Tavus 发布实时对话理解模型 Sparrow-2,并已在 Tavus PAL、API 和企业平台中正式可用。它不再只用静音时长判断用户是否说完,而是同时分析语义、词汇结构、语调、停顿、说话人和环境声音,持续判断系统应当倾听、等待、说话还是继续说。

Tavus 发布 Sparrow-2,让语音 Agent 学会等待和识别环境声

Sparrow-2 以 10ms 帧率流式处理音频,每秒可更新 100 次对话状态,粒度较上一代提高 4 倍;处理 80ms 音频约需 7ms,上一代约为 30ms。模型可区分「嗯」等附和与真正打断,在用户思考时等待 6~8 秒,并在声音无法可靠辨认时请求重复,而非基于错误转写继续回答。

Tavus 称,模型使用 1.6 万段真实对话和 2000 段合成对话训练。在 575 个真实对话事件测试中,Sparrow-2 的时机判断失败率为 2.1%,约为最佳对比模型的四分之一;面对超过 1 秒的思考停顿,它有 97% 的情况不会抢话。上述对比包含 Tavus 自建评测,LiveKit 仅采用可在设备端运行的 v1-mini,并非其最先进模型。

声明:内容来源公开的各类媒体平台,若收录的内容侵犯了您的权益,请联系邮箱,本站将第一时间处理。
资讯

Dario Amodei:Anthropic 希望与软件公司共建产品,而非取代所有 SaaS

2026-8-31 9:35:25

资讯

24 小时订单超 260 万美元,Hugging Face 机器鸭 Microduck 爆单

2026-8-31 9:39:52

搜索