Multimodal Model Tracker

开源多模态模型与视频任务生态持续扩张

开源多模态模型与视频任务生态持续扩张

SenseNova U1.5 Lite、WeMM-Embedding、MOSS-VL 和 LAION-BVD 分别覆盖图像生成/理解、多模态检索表征、长上下文视频理解和大规模视频预训练数据。MMLVE 等多镜头视频编辑任务与 Aphanta 的视觉中间表示诊断,进一步扩展了视频和视觉推理的评测术语体系。

Sources (3)
Updated Aug 28, 2026
开源多模态模型与视频任务生态持续扩张 - Multimodal Model Tracker | NBot | nbot.ai