跳转至

打破碎片化瓶颈!浙大&哈佛开源UniGeo,高保真相机可控编辑

Ch01.1093 打破碎片化瓶颈!浙大&哈佛开源UniGeo,高保真相机可控编辑

📊 Level ⭐⭐ | 5.7KB | entities/打破碎片化瓶颈浙大哈佛开源unigeo高保真相机可控编辑.md

打破碎片化瓶颈!浙大&哈佛开源UniGeo,高保真相机可控编辑

来源: 新智元

发布日期: 2026-05-07

原文链接: https://mp.weixin.qq.com/s/ejSrcVpibbJebtQ1kiVuWw


--- 新智元报道

编辑:LRST 【新智元导读】 UniGeo通过视频模型的连续视角先验与统一几何引导,实现稳定、高质量的相机可控图像生成,全面超越现有方法,在不同幅度的相机运动中提升跨视角一致性与结构稳定性。

当前主流的相机可控图像编辑主要基于图像扩散模型,通过处理离散视角映射,在场景生成和新视角合成领域取得了显著成功。

然而,图像模型天生的离散属性使其在应对连续相机运动时,极易出现几何漂移和结构退化。现有方法引入的几何引导也往往是碎片化的(如仅在表示层注入点云),这导致即使引入视频模型来克服图像模型的缺点,提供连续视角先验,模型也依然难以形成稳定的全局几何理解,无法彻底消除结构退化现象。

近日,浙大联合哈佛发布了全新的基于视频模型的统一几何引导相机可控编辑框架 UniGeo 。该框架系统性地打破了碎片化瓶颈,创新性地在决定生成输出的三个核心层面(表示层、架构层、损失函数层)全面注入了统一的几何引导。结合视频模型的连续先验与全局统一的几何引导,UniGeo 有效克服了结构退化问题,显著提升了在不同幅度的相机运动下的视觉质量与跨视角几何一致性。

模型代码网址:https://github.com/mo230761/UniGeo

英文技术报告网址:https://arxiv.org/pdf/2604.17565

Project Page网址:https://mo230761.github.io/UniGeo.github.io/

HF Space网址:https://huggingface.co/spaces/123123aa123/UniGeo

现有主流的相机可控图像编辑(Camera-controllable image editing)主要依托于图像扩散模型。其基本范式是:通过处理离散的二维视角映射,并辅以局部层面的几何信息(如仅在表示层注入点云),来合成不同相机姿态下的新场景。这一技术路径在二维视角的转换上取得了显著进展。

然而,这类方法在应对真实的连续相机运动时,面临着跨视角几何不一致和结构退化等严峻问题。真实物理世界中的相机运动在三维空间内是平滑且连续的,但受限于图像模型天生的「离散属性」,以及仅停留在单一层面的「碎片化」几何引导,现有模型内部难以形成全局协同的三维几何对应关系,导致生成过程常常发生几何漂移。

鉴此,研究团队认为,要实现高保真的相机可控图像生成,必须摒弃以往「离散生成+碎片化几何引导」的局限思路。视频模型天然具备连续视角建模的先验能力,这为攻克上述难题提供了绝佳基座。

但仅引入视频先验并不充分,研究团队在此基础上提出了一条系统性重构的新路径:即系统地将「统一几何引导」贯穿于生成模型的全链路,确保模型从特征输入到特征交互、再到最终优化的每一个环节,都遵循严格的三维几何引导。

在该思路的指引下,研究团队探索了连续视频先验与全局几何引导的深度融合,提出了全新的相机可控图像编辑框架 UniGeo 。该框架系统地重构了决定生成输出的三大核心基石:在表示层实现帧解耦的几何参考注入,在架构层引入对齐多视角的几何锚点注意力,并在损失函数层强化轨迹端点的几何监督。

UniGeo 成功打通了视频模型与三维几何理解之间的壁垒,

原文存档


关联