统一视觉生成与低成本图像模型路线升温SenseNova-Vision-7B-MoT 将检测、OCR、分割、深度、法线和多视图几何统一到文本/图像输出空间,并公开权重与训练流程;无任务专用预测头是值得跟踪的架构信号。微软 MAI-Image-2.6-Flash 代表低延迟图像生成方向,但性能与成本优势仍需独立验证。Sources (4)数字人边说边动快5.4倍,北大等团队做出Motion-Omni|arXivDaily行业趋势arxivdaily.com微信视觉团队开源通用多模态嵌入模型WeMM-Embedding - 搜狐m.sohu.comH Company Releases NeoMME: A Family of 260M and 800M Single-Tower Multimodal Encoders That Drop the Vision Tower and Causal Decodermarktechpost.com微软发布MAI-Image-2.6-Flash:生图速度是全球最佳AI的2倍tech.ifeng.comUpdated Sep 7, 2026