
6月22日消息,京东正式开源JoyAI-VL-Interaction实时视频视觉语言交互模型,这是全球首个全栈开源的视觉交互模型与整套部署系统。上线即原生适配vLLM-Omni,彻底改变传统多模态模型“一问一答”的交互模式,实现AI持续观看实时画面、自主判断、主动响应的流式交互能力。前台观测+后台分工协作:遇到复杂推理、代码生成、工具调用等重任务时,可委托后台Agent处理,前台模型不间断持续观测画面,任务完成后无缝接续交互。这源于交互模型相较传统“一问一答”的回合制模型的天然优势:自主交互性长在模型内部,而非依赖外部触发。