7月20日技术
DeepMind 将视频生成器转为视觉模型
谷歌 DeepMind 认为,视频生成器其实已经包含了计算机视觉一直缺失的“世界模型”
谷歌 DeepMind 的研究人员认为,GenCeption 说明视频生成器可能已经包含了计算机视觉长期缺失的“世界模型”。他们没有从零开始设计新的视觉架构,而是把阿里巴巴开源的 Wan2.1 视频模型改造成了深度估计、分割、表面法线估计和 3D 姿态估计等任务的基础。该模型通过文本提示来指定要执行的任务,方式有点像聊天机器人接受指令。为了让不同任务共用同一套架构,研究团队把深度图、分割掩码等多种输出都统一表示为标准的三通道 RGB 图像。对于 3D 关键点预测这类不直接输出图像的任务,团队再加入可训练模块来补足。
阅读更多