视觉语言模型走向物理基础模型与可执行视频理解PhysBrain 1.5 以单一 8B 模型统一场景理解、机器人动作和未来状态预测,并声称在 28 个基准上达到 72.5;其开源属性使其成为近期重要具身模型线索。BVB 仍显示视觉相似度与时空事实保留存在差距,真实闭环控制、数据质量和跨环境泛化需要独立验证。Sources (2)In-Context Robot Learning with VLM Agentsarxiv.org@_akhaliq reposted: PhysBrain 1.5: Open-source SOTA for Embodied AI A single 8B model that understa...x.comUpdated Sep 17, 2026