Hugging Face · Daily Papers

Hunyuan3D-Buffalo 1.0:可扩展3D生成、理解与编辑的统一多模态模型

Hunyuan3D-Buffalo 1.0: A Unified Multimodal Model for Scalable 3D Generation, Understanding, and Editing

Junliang Ye, Kenkun Liu, Guocun Wang, Yang Li, Yansong Qu, Chunshi Wang, Jingwei Xu, Yunhan Yang 等 15 位
来自 Tencent Hunyuan
二〇二六年八月五日 · arXiv:2608.02711 · PDF

近期图像生成领域的进展表明,统一多模态模型在整合理解、生成与编辑方面展现出潜力。然而,统一的3D建模仍受限于稀缺的多模态数据,尤其是缺乏大规模且几何一致的编辑数据。为应对这一局限,我们提出Hunyuan3D-Buffalo 1.0,一个在单一架构中支持3D理解、文本到3D生成、指令引导的3D编辑以及文本驱动的部件生成的统一框架。为实现可扩展训练,我们构建了一个规模达87M的3D多模态语料库,包含25M理解样本、50M文本到3D配对以及12M编辑配对,这些配对由Nano3D-v2生成。在架构上,该框架结合了Hunyuan3D-VLM用于语义、结构与空间理解,以及Hunyuan3D DiT用于高保真3D合成。VLM为生成提供多模态语义条件,而编辑与部件生成则额外以源对象表示作为扩散过程的调节条件,以保持其整体结构及未编辑区域。大量实验表明,Hunyuan3D-Buffalo 1.0在文本到3D生成和3D编辑基准上达到最先进或领先性能,同时展现出强大的理解与部件生成能力。我们的分析进一步显示,生成与理解均能提升编辑效果,验证了统一3D多模态训练的有效性。项目页面:https://tencent-hunyuan.github.io/Hunyuan3D-Buffalo1.0/

译自 Hugging Face · Daily Papers · arXiv:2608.02711 · 录于 二〇二六年八月五日