生数科技通用世界模型五级路线:Vidu到Motubrain
生数科技提出通用世界模型L1-L5路线,核心是理解世界、预测未来、采取行动的闭环系统。
- L1世界生成:Vidu视频模型完成连贯演化建模
- L2与世界交互:Vidu S1支持语音实时介入
- L3在世界中行动:开源Motus与Motubrain(MoT架构)实现动作生成,推理提速10倍
L4-L5仍需突破联合评测、物理规律学习与在线进化等挑战。

Created by 凌枫
Latest multimodal and open-source AI model names, architectures, and terminology
Explore the latest content tracked by Multimodal Model Tracker
生数科技提出通用世界模型L1-L5路线,核心是理解世界、预测未来、采取行动的闭环系统。
Ox Alpha 是匿名团队推出的免费多模态模型,支持百万token与视频处理,性能已超越Anthropic的Claude Fable。这一高性能免费模型的突然出现,可能直接挑战现有AI厂商主导地位,并让市场对Anthropic到2026年9月的领先地位产生动摇。
RAE 不同于传统VAE从像素重建学习latent,而是直接利用预训练视觉模型的高层representation作为生成空间,让模型从更富语义结构的latent space进行视频生成。
世界模型正从视频动态推理迈向全模态可交互生成。
TLive-Omni 专为电商直播设计,能将图像、视频、音频、文本映射到统一空间。 其 Per-vGrid 机制对长时序噪声流进行时间对齐的多模态融合,支持实时 faithful 响应。
该工作指出传统扩散模型图像编辑的两个缺陷:编辑概念粒度不足与稀疏监督导致训练低效。通过构建含超1000细粒度概念的层级分类体系及ConceptEdit-12M数据集,并采用密集监督策略将多概念合成单图像对,显著提升训练效率与性能。
Block3D提出分块扩散架构,将离散形状token序列划分为连续块,自回归生成并联合去噪当前块内所有token,同时引入置信度引导的块内校正缓解错误累积。 在TRELLIS-500K测试集上,生成时间从25.71秒降至4.99秒,达到5.15倍加速且不损失几何保真度。
GEN-1.5 是一款多模态机器人基础模型,可通过 3–12 秒传感器运动数据实现零样本任务学习。
此研究释放信号显示,机器人领域正复制大模型的上下文学习范式。
PragReST 将语用学视为推理任务,通过反事实脚本实现自我改进,无需人工标注或教师模型即可让 Qwen3-8B/14B 在语用基准上分别提升 5.37% 和 5.50%,且不损失其他能力。
连续扩散语言模型通过反转高斯噪声腐蚀过程实现序列生成,避开自回归逐token预测。2022年Diffusion-LM、DiffuSeq、SED、CDCD等方法兴起,但2023年后因训练效率差距(Plaid-1B低64倍)及性能追赶需求迅速消亡,转向离散扩散。
近期开源视觉生成模型在效率、质量和功能上持续推进。
EviRank 将查询解析为六个语义槽(实体、属性、关系等)的统一证据包,标记 required/forbidden/ignorable,实现无需训练的证据条件验证重排序。 在五个多模态检索基准上达到 SOTA,蒸馏学生模型保留 90% 以上性能。
OmniAssistBench专为Omni-LLMs设计,针对实时视频助手场景。
Llama-Mobile框架通过模型自生成训练数据实现无需原始训练设置的量化管道,并提出支持Arm CPU的2.7位格式,将Llama 3.2 11B Vision Instruct压缩至3.7GB(8-bit激活),在视觉问答任务上保持性能。
Qwen3.8-27B 密集模型通过 llama.cpp 在 RTX 5060 Ti 16GB 显卡上成功运行。
混合思维多模态大语言模型(Hybrid-Thinking MLLMs)支持思考与非思考模式切换,PatternEval基准(2415提示)揭示非思考模式下链式思维泄漏等失败率显著更高;PatternRL通过模式特定惩罚缓解跨模式对齐问题,在Qwen3-VL-4B/8B上验证有效。
Mistral Codestral 25.01 推理 API 支持 80+ 编程语言,包括 Python、Java、C++、JavaScript 及 Swift 等,聚焦代码生成场景。
Recirculation 方法让模型在预填充阶段反馈激活实现推理时循环,无需重新训练即可演化架构。Gemma3 系列自适应变体困惑度下降 23%、GSM8k 准确率提升 21%,有望启发递归自我改进。
ByteDance Seedance 2.0 采用 Dual Branch Diffusion Transformer 架构,支持最多12个多模态资产输入(9图+3视频+3音频)+文本提示,一次生成4-15秒带同步音频的视频。