幻兹快讯
谷歌DeepMind推出GenCeption通用视觉模型
幻兹快讯
2026年07月21日
阅读 29 次

2026年7月20日,谷歌DeepMind发布GenCeption模型,将预训练视频生成器逆向改造为多任务视觉分析引擎。该模型基于通义万相Wan2.1系列,仅用7500段合成视频训练,单次前向传播即可完成深度估计、图像分割、3D姿态估计等五类任务。其支持文本提示驱动,可输出深度图、表面法线图及分割掩码,并具备跨域泛化能力,能在真实多人视频及动物、机器人场景中有效工作。小模型处理81帧视频约需6秒,大模型(140亿参数)约需10秒。

Copyright © 幻兹网 All Rights Reserved粤ICP备2026034579号粤公网安备44030002012995号