2026 年 8 月 3 日(当地时间)——腾讯(Tencent)发布了将可扩展的 3D 生成、理解与编辑整合为一体的多模态模型(multimodal model)「Hunyuan3D-Buffalo 1.0」。
Hunyuan3D-Buffalo 1.0 管线概览
Hunyuan3D-Buffalo 1.0 是作为「Tencent Hunyuan3D」项目的一环公开发布的,是一个集成了 3D 理解(3D understanding)、文本到 3D 生成(text-to-3D generation)、基于指令的 3D 编辑(3D editing)以及部件级 3D 生成的统一型 3D 多模态框架(multimodal framework)。它通过连接语言、3D 表示与生成式 3D 模块,在单一的处理流程中支持多种多样的任务。
该框架采用了共享的「Hunyuan3D-VLM」骨干网络(backbone)。由此,它能在 3D 空间中的问答(QA,Question Answering)、视觉定位(grounding,即语言与 3D 对象的对应绑定)、生成、编辑以及部件级拆解等各项任务之间起到桥梁作用。
此外,在统一表示的基础上结合「Hunyuan3D DiT」模块,实现了多模态生成的可扩展性(scalability)、高质量的 3D 编辑以及精密的部件生成。

四大主要功能
该管线主要由以下四项功能构成。
3D 理解(3D Understanding)
利用语言引导的推理,对 3D 模型执行问答(3D QA)与视觉定位(grounding)。

文本到 3D 生成(Text-to-3D)
基于输入的文本提示词(prompt),可生成全新的 3D 资产。

3D 编辑(3D Editing)
使用自然语言指令,即可对现有的 3D 对象进行编辑。

部件生成(Part Generation)
借助语言信息,可从 3D 模型中提取并生成具有语义的部件(零件)。

可将整个网格(mesh)与所有部件组件可视化。不仅能以组合状态显示,还能以分解图(爆炸视图,exploded view)呈现,有助于理解模型的结构。
借助该框架,仅用单一模型即可从生成到编辑、再到结构分析流畅地完成。作为一项能够梳理基于语言的 3DCG 制作流程、大幅提升作业效率的技术,备受期待。


评论留言