2D數(shù)據(jù)解鎖3D世界:首個面向運動學部件分解的多視角視頻擴散框架 微資訊
來源:機器之心Pro時間:2025-09-22 21:31:35
張昊,伊利諾伊大學香檳分校(UIUC)博士生,研究方向涵蓋 3D/4D 重建、生成建模與物理驅(qū)動動畫。目前在 Snap Inc. 擔任研究實習生,曾于 Stability AI 和 上海人工智能實驗室實習。本項目 Stable Part Diffusion 4D (SP4D) 由 Stability AI 與 UIUC 聯(lián)合完成,能夠從單目視頻生成時空一致的多視角 RGB 與運動學部件序列,并進一步提升為可綁定的三維資產(chǎn)。個人主頁:https://haoz19.github.io/
- 論文標題:Stable Part Diffusion 4D: Multi-View RGB and Kinematic Parts Video Generation
- 論文鏈接:https://arxiv.org/pdf/2509.10687
- 項目主頁:https://stablepartdiffusion4d.github.io/
研究背景與動機
【資料圖】
在角色動畫和 3D 內(nèi)容制作中,rigging(骨骼綁定)與部件分解是實現(xiàn)可動畫化資產(chǎn)的核心。然而,現(xiàn)有方法存在明顯局限:
- 自動 rigging:依賴規(guī)模有限的 3D 數(shù)據(jù)集及骨骼/蒙皮標注,難以覆蓋多樣化的物體形態(tài)與復雜姿態(tài),導致模型泛化性不足。
- 部件分解:現(xiàn)有方法多依賴語義或外觀特征(如「頭部」、「尾部」、「腿」等)進行分割,缺乏對真實運動學結(jié)構(gòu)的建模,結(jié)果在跨視角或跨時間序列上往往不穩(wěn)定,難以直接應用于動畫驅(qū)動。
為此,我們提出核心動機:利用大規(guī)模 2D 數(shù)據(jù)和預訓練擴散模型的強大先驗知識,來解決運動學部件分解的問題,并進一步延伸到自動 rigging。 這一思路能夠突破 3D 數(shù)據(jù)稀缺的瓶頸,讓 AI 真正學會生成符合物理運動規(guī)律的 3D 可動畫資產(chǎn)。
研究方法與創(chuàng)新
基于這一動機,我們提出了 Stable Part Diffusion 4D (SP4D) —— 首個面向運動學部件分解的多視角視頻擴散框架。主要創(chuàng)新包括:
- 雙分支擴散架構(gòu):同時生成外觀與運動學結(jié)構(gòu),實現(xiàn) RGB 與部件的聯(lián)合建模。
- BiDiFuse 雙向融合模塊:實現(xiàn) RGB 與部件信息的跨模態(tài)交互,提高結(jié)構(gòu)一致性。
- 對比一致性損失:確保同一部件在不同視角、不同時間下保持穩(wěn)定一致。
- KinematicParts20K 數(shù)據(jù)集:團隊基于 Objaverse-XL 構(gòu)建超過 20,000 個帶骨骼注釋的對象,提供高質(zhì)量訓練與評估數(shù)據(jù)。
這一框架不僅能生成時空一致的部件分解,還能將結(jié)果提升為 可綁定的 3D 網(wǎng)格,推導骨骼結(jié)構(gòu)與蒙皮權(quán)重,直接應用于動畫制作。
實驗結(jié)果
在 KinematicParts20K 驗證集上,SP4D 相較現(xiàn)有方法取得了顯著提升:
- 分割精度:mIoU 提升至 0.68,相比 SAM2(0.15)與 DeepViT(0.17)大幅領(lǐng)先。
- 結(jié)構(gòu)一致性:ARI 達到 0.60,遠高于 SAM2 的 0.05。
- 用戶研究:在「部件清晰度、跨視角一致性、動畫適配性」三項指標上,SP4D 平均得分 4.26/5,顯著優(yōu)于 SAM2(1.96)和 DeepViT(1.85)2509.10687v1。
在 自動 rigging 任務中,SP4D 也展現(xiàn)出更強的潛力:
- 在 KinematicParts20K-test 上,SP4D 的 Rigging Precision 達到 72.7,相比 Magic Articulate(63.7)和 UniRig(64.3)有明顯優(yōu)勢。
- 在用戶評估的動畫自然度上,SP4D 平均得分 4.1/5,遠高于 Magic Articulate(2.7)與 UniRig(2.3),展現(xiàn)出對未見類別與復雜形態(tài)的更好泛化。
這些結(jié)果充分證明了 2D 先驗驅(qū)動的思路 不僅能解決 kinematic part segmentation 的長期難題,還能有效延伸到自動 rigging,推動動畫與 3D 資產(chǎn)生成的全自動化。
結(jié)語
Stable Part Diffusion 4D (SP4D) 不僅是技術(shù)上的突破,也是一次跨學科合作的成果,并且被Neurips 2025 接受為 Spotlight。它展示了如何利用大規(guī)模 2D 先驗打開 3D 運動學建模與自動 rigging 的新局面,為動畫、游戲、AR/VR、機器人模擬等領(lǐng)域的自動化與智能化奠定了基礎(chǔ)。
標簽:
動畫
運動學
視頻擴散框架