从CLIP到Omni Model:视觉提示工程拓展多模态边界
多模态模型正从CLIP/SigLIP的对比学习架构,快速演进至具备图像与音频理解能力的Omni Model。
Google DeepMind提出的VIPE(视觉提示工程)通过优化视觉输入,将抽象草图转为照片级真实场景,在VPCT任务上使Veo 3.1准确率从41.3%升至59.3%,Omni Flash从56.3%升至67.5%,常优于文本提示工程。
这一趋势显示,视觉提示本身可被系统优化,结合VLM与图像编辑模型的自动化流程(含ACE原子概念编辑),正成为激发视频模型推理性能的新范式。



