京东开源实时视频视觉语言交互模型 JoyAI-VL-Interaction

6 月 23 日消息,昨天,京东宣布开源实时视频视觉语言交互模型 JoyAI-VL-Interaction。官方称,这是全球首个全栈开源的 interaction 模型和系统,并获得 vLLM-Omni 的 day-0 原生支持。

京东开源实时视频视觉语言交互模型 JoyAI-VL-Interaction

JoyAI-VL-Interaction 支持语音输入输出、可视化界面、长期记忆、后台模型接口和 vLLM 部署方案。京东称,开发者可替换 ASR、TTS、后台模型、外部工具和业务模块,把它改造成安防监控、老人小孩看护、直播讲解、电商导购、操作指导、AI 眼镜或无障碍辅助等实时 AI 助手。

官方数据显示,在 58 个真人盲评案例中,JoyAI-VL-Interaction 对比豆包视频通话助手总体胜率 77.6%,对比 Gemini 视频通话助手总体胜率 87.9%。

💻 GitHub: github.com/jd-opensource/JoyAI-VL-Interaction

🤗 Hugging Face: huggingface.co/jdopensource/JoyAI-VL-Interaction-Preview

声明:内容来源公开的各类媒体平台,若收录的内容侵犯了您的权益,请联系邮箱,本站将第一时间处理。
资讯

阿里发布 HappyHorse 1.1 视频生成模型

2026-6-23 15:44:13

资讯

Sakana AI 发布 Fugu Ultra,性能对标 Fable 5

2026-6-23 15:48:23

搜索