志明会玩
26-07-04 11:32 微博认证:数码博主 头条文章作者

京东正式官宣开源全球首个全栈实时视频视觉语言交互模型JoyAI-VL-Interaction,这套从底层模型到完整系统全部开放的方案,还拿到了vLLM-Omni的首日原生支持,开发者不用从零搭建复杂框架,就能快速落地自己的实时视频AI应用。

这套模型自带完整的全链路能力,语音输入输出、可视化交互界面、长期记忆模块、后台模型接口和vLLM部署方案全部配齐,相当于直接给开发者递了一套开箱即用的基础框架。最灵活的是它支持全模块自由替换,你可以根据自己的需求更换ASR语音识别、TTS语音合成、后台大模型、外部工具接口和业务逻辑模块,不用被固定的闭源框架绑死。

官方给出的真人盲测数据也相当亮眼,在58个真实场景的盲评案例里,JoyAI-VL-Interaction对比豆包视频通话助手的总体胜率达到77.6%,对比Gemini视频通话助手更是拿到了87.9%的胜率,实时交互的流畅度和理解精准度都站到了第一梯队。

依托这套开源方案,开发者可以快速做出适配不同场景的实时AI助手,不管是安防监控实时预警、老人小孩居家看护、直播智能讲解、电商实时导购,还是AI眼镜的第一视角操作指导、面向视障群体的无障碍辅助工具,都能大幅降低开发成本,让更多垂直场景的实时视频AI应用快速落地。
#京东开源AI交互模型##全球首个全栈开源#

发布于 福建