京东这个开源视频理解大模型太深得我心了!
我最近在研究视频总结 Skills,所以格外关注多模态大模型
刚刚发现,京东开源的 JoyAI-VL-Interaction,登上了 Hugging Face Trending 视频理解类第一!
据我观察,过去很多视频多模态模型,重点是“看完一段视频,然后回答问题”,JoyAI-VL-Interaction 关注的是另一种产品形态:模型持续看着视频流,自己判断什么时候该回应、什么时候该安静、什么时候把复杂任务交给后台模型或 Agent 处理。也就是说,多模态 AI 正在从 turn-based 的“你问我答”,走向 real-time interaction 的“流式交互”
这类能力在真实场景里会很关键:
体育赛事直播解说、监控预警、老人/儿童看护、宠物照看、手机购物陪伴、穿搭评价、操作指引、AI 视频通话……这些场景里,AI 光能看懂画面还不够,它还得知道“什么时候说话”。
最直观的例子就是视频直播场景,它也可以在比赛进行时做实时解说,比如正在看世界杯比赛,JoyAI-VL-Interaction 可以监控比赛中的处罚事件,有裁判出示黄牌的时候提醒
技术报告里的对比也挺直接:在 58 个真实流式视觉交互案例中,JoyAI-VL-Interaction 相比豆包整体胜率 77.6%,相比 Gemini 整体胜率 87.9%。其中监控预警场景,对两个基线都是 100% 胜率。
开源社区关注它,还有一个很现实的原因:开发者需要的是能跑起来、能改、能接进业务系统的东西。JoyAI-VL-Interaction 开放了训练 recipe、超过 400 万条时间对齐交互数据,以及完整可部署系统。ASR/TTS、三层长程记忆、可视化界面、后台 Agent 桥接,也都做成了可插拔模块。
我觉得,这可能是视频 AI 一个很重要的转向:AI 不再只是等你提问,它开始持续观察、主动判断、适时开口,并把复杂任务交给后台执行。
视频理解之后,真正值得看的方向,可能是视频交互。
#AI #多模态 #开源模型 #HuggingFace #视频理解 #京东 #Agent #实时交互 #大模型
![]()
![]()
![]()
![]()
![]()
![]()
![]()
![]()
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.