Multimodal Model Tracker

多模态与视频理解推理效率路线受到关注

多模态与视频理解推理效率路线受到关注

ShallowStream 通过浅层帧索引、证据检索和 KV cache 维护优化流式视频理解,报告单帧预填充 52.1 倍、端到端延迟降低 11.9 倍,但复现条件尚不完整。Nunchaku、SVDQuant、FourTune 与 Stream-DiffVSR 分别代表量化、推理核函数、扩散加速和低延迟视频处理方向。

Sources (2)
Updated Sep 9, 2026