生图3D类

InfiniSplat:单张照片生成3D场景,大角度切换不再碎——SIGGRAPH Asia 2026录用,代码已开源

2026年8月5日4 次阅读
InfiniSplat:单张照片生成3D场景,大角度切换不再"碎"——SIGGRAPH Asia 2026录用,代码已开源

InfiniSplat:单张照片生成3D场景,大角度切换不再"碎"——SIGGRAPH Asia 2026录用,代码已开源

一张照片,能不能直接生成一个可以自由转视角的3D场景?3D Gaussian Splatting(3DGS)让这件事变得可行,但现有方法有个老大难问题:近处看着还行,视角一拉远,场景就开始"碎"——裂缝、散点、结构崩塌,根本没法用。

浙江大学团队提出的 InfiniSplat,正是来解决这个问题。论文已被 SIGGRAPH Asia 2026(ACM Transactions on Graphics)录用,代码已开源。

痛点:像素对齐的"近看还行,远看崩"

目前主流的单图3DGS方法,基本都采用"像素对齐"策略——把图像的每个像素位置当作锚点,直接从这些固定位置预测高斯点的属性。这样做简单高效,近处渲染效果也不错。

但问题在于:像素是2D网格,场景表面是3D的。当视角发生较大变化时,这些固定在像素网格上的高斯点跟实际场景表面脱节,导致渲染结果出现裂缝、散乱碎片,整个场景结构"散架"。

简单说:像素对齐让高斯点"站错了位置",视角一变就露馅。

核心思路:从像素对齐到表面对齐

InfiniSplat 的关键创新,是把高斯点的生成从"像素对齐"转向"表面对齐"。具体分两步:

第一步:几何引导采样。 利用单目深度估计得到的几何信息,在2D平面上按照深度诱导的局部表面结构来放置支撑点(support points),而不是机械地按像素网格排列。这样支撑点天然贴合场景的几何表面。

第二步:隐式高斯解码器。 在这些表面对齐的支撑点上,用一个查询条件化的隐式解码器(query-conditioned implicit decoder)来预测高斯属性。解码器从图像特征中查询信息,而不是直接绑定像素位置,让高斯点的预测更灵活、更贴合真实表面。

两步合在一起,高斯点不再被像素网格"绑架",而是真正沿着场景表面分布,大视角变化下也能保持结构连贯。

效果:跨数据集SOTA,零样本泛化到开放世界

在多个跨数据集的新视角合成评测中,InfiniSplat 达到了当前最优(SOTA)水平。更值得注意的是:

  • 零样本泛化:仅在 Hypersim 室内合成数据上训练,就能直接泛化到复杂的开放世界场景,不需要额外微调。
  • LiDAR增强:如果额外输入稀疏LiDAR点云(InfiniSplat-LiDAR版本),新视角渲染质量进一步提升,大幅超越此前方法 ADGaussian。

这意味着 InfiniSplat 不只是"实验室里好看",在真实场景中也有实用价值。

对谁有用?

  • AR/VR 开发者:单张照片就能生成可自由浏览的3D场景,降低内容制作门槛
  • 数字孪生/场景重建:配合LiDAR数据,可以快速生成高质量3D场景表示
  • 3DGS 研究者:表面对齐的思路为后续研究提供了新方向,代码开源方便复现和改进

开源信息

代码已发布在 GitHub:github.com/zju3dv/InfiniSplat

项目主页:zju3dv.github.io/InfiniSplat

---

*基于 arXiv 论文及项目主页信息整理,InfiniSplat 由浙江大学 CAD&CG 国家重点实验室、UDeer.ai、深圳大学联合完成。*

参考来源

评论

0 条已公开
登录注册后可以参与评论。

正在加载评论...