PointDiT: Pixel-Space Diffusion for Monocular Geometry Estimation
A minimalist pixel-space diffusion transformer using plain ViT architecture directly processes 3D point map patches conditioned on image tokens from DINOv3, outperforming complex l…
Hugging Face · Daily Papers
·Haofei Xu, Rundi Wu
·
·▲ 9 upvotes
Este artigo está em destaque na seleção diária de papers do Hugging Face, curada pela comunidade de pesquisa em IA.
Autores: Haofei Xu, Rundi Wu, Philipp Henzler, Nikolai Kalischek, Michael Oechsle, Fabian Manhardt
- 9 upvotes da comunidade
- Temas: Diffusion Transformer, ViT, 3D point map patches, DINOv3, pixel-space, latent diffusion models
Resumo
Resumo original (em inglês), extraído do paper:
A minimalist pixel-space diffusion transformer using plain ViT architecture directly processes 3D point map patches conditioned on image tokens from DINOv3, outperforming complex latent-based models while maintaining simplicity and robustness in ambiguous regions.Onde ler
// relacionados
Leia também
Editorial
EditBridge: edição de imagem em 4K sem inventar o que não estava lá
Blog
Coarse-to-Fine Multi-Resolution Diffusion Models for Trajectory Generation in Urban Systems
Blog
DiSCO: Defending text-to-image generation through distribution-guided contrastive prompt optimization
Blog