
7月20日技术
DeepMind 将视频生成器转为视觉模型
谷歌 DeepMind 认为,视频生成器其实已经包含了计算机视觉一直缺失的“世界模型”
谷歌 DeepMind 的研究人员认为,GenCeption 说明视频生成器可能已经包含了计算机视觉长期缺失的“世界模型”。他们没有从零开始设计新的视觉架构,而是把阿里巴巴开源的 Wan2.1 视频模型改造成了深度估计、分割、表面法线估计和 3D 姿态估计等任务的基础。该模型通过文本提示来指定要执行的任务,方式有点像聊天机器人接受指令。为了让不同任务共用同一套架构,研究团队把深度图、分割掩码等多种输出都统一表示为标准的三通道 RGB 图像。对于 3D 关键点预测这类不直接输出图像的任务,团队再加入可训练模块来补足。
阅读更多
5月23日新闻
OpenAI:推进内容溯源,构建更安全、更透明的 AI 生态
依托内容凭证、SynthID 以及面向公众的早期验证工具,帮助人们理清 AI 生成内容的来源
如今,人们每天都在使用 OpenAI 的工具来创作和编辑图像与音频,让日常沟通变得更具表现力、更实用、更触手可及。随着这些工具融入人们构建、想象和分享的方方面面,使用户能够理解并验证媒介的来源变得至关重要,这能让他们在解读信息时更有信心。内容溯源特征可以通过提供上下文,帮助人们了解内容的来源、创建或编辑的方式,以及它是否可信。
阅读更多