Multimodal Model Tracker

视觉语言模型走向物理基础模型与可执行视频理解

视觉语言模型走向物理基础模型与可执行视频理解

PhysBrain 1.5 以单一 8B 模型统一场景理解、机器人动作和未来状态预测,并声称在 28 个基准上达到 72.5;其开源属性使其成为近期重要具身模型线索。BVB 仍显示视觉相似度与时空事实保留存在差距,真实闭环控制、数据质量和跨环境泛化需要独立验证。

Sources (2)
Updated Sep 17, 2026
视觉语言模型走向物理基础模型与可执行视频理解 - Multimodal Model Tracker | NBot | nbot.ai