欧美一区二区三区视频免费_亚洲国产欧美一区二区丝袜黑人_一区二区三区资源_欧美一区二区视频免费观看

不靠 CFG、DMD、GAN、Drifting 和MeanFlow,如何訓練一步生成模型?

不靠CFG、DMD、GAN、Drifting和MeanFlow,如何訓練一步生成模型?,算法

只做一次生成器前向,就能得到一張圖,這是一步生成追求的效率。但想把采樣步數降到 1,難題其實在訓練端:怎樣用足夠穩定、簡單的監督信號,讓生成分布靠近真實分布?


(資料圖片僅供參考)

現有路線各有結構性取舍:

  • 自回歸、擴散和流匹配(Flow Matching)模型擴展性強,但前者需按順序或尺度解碼,后兩者沿噪聲 — 數據路徑反復調用網絡,都會增加推理時間。
  • 生成對抗網絡(GAN)天然支持單次前向推理,但學習信號來自同步訓練的判別器,極小極大優化較敏感。
  • 一致性模型(Consistency Models)和分布匹配蒸餾(Distribution Matching Distillation,DMD)可以壓縮采樣步數,但通常需要噪聲 — 時間監督、一致性約束、教師或輔助估計器;DMD 同時依賴固定擴散教師與在線生成分布的 score(對數密度梯度),擴展到較大模型時還需要更多穩定化技巧。

這些路線各有優勢,TBSM 并不是要簡單否定它們。它把問題改寫成了一句更直接的話:能不能訓練一個小模型,直接告訴每個生成樣本 “該往哪里走”?

  • 論文標題:THREE-BODY SCATTERING FOR GENERATIVE MODELING
  • 論文鏈接:https://arxiv.org/abs/2607.18198
  • 項目主頁與代碼:https://github.com/sp12138/TBSM

具體來說,TBSM 在線訓練一個輕量級 Tracker,學習從當前生成分布到真實分布(Fake-to-Real)的轉移場。對每個生成樣本,Tracker 都會獨立地給出一個移動方向,生成器只需回歸樣本沿該方向移動后的位置。

面對約 800M 的像素擴散 Transformer 模型 PixelDiT-XL/16,單個 Tracker 僅有 30M 參數不到,且只在訓練時使用。ImageNet-256 上,TBSM 的潛空間和像素空間模型在推理時前向次數(number of function evaluations,NFE)為 1 時,分別達到 Fréchet Inception Distance(FID,越低越好)1.63 和 2.23。

視頻鏈接:https://mp.weixin.qq.com/s/0MFfONowxYytCSTB7PQ9tA

TBSM 方法介紹視頻:三樣本散射事件產生 Fake-to-Real 局部方向,Tracker 學習這些方向的期望,引導生成器最終實現 NFE=1。

TBSM 一步生成樣例

從左到右依次為 MNIST、Fashion-MNIST、CIFAR-10、像素空間 ImageNet-1K,以及 20B 文生圖模型的生成結果。

Fake-to-Real 轉移場

(即 Tracker 的學習目標)從哪里來?

算法 1:基礎三體散射回歸

算法 1:三樣本事件現場給出移動方向,即瞬時三體散射方向,生成器回歸凍結后的目標位置。

不使用 Tracker 時,這就是瞬時散射(Instant Scattering)。嚴格來說,凍結回歸在當前參數處的期望梯度與能量距離梯度一致,但單個即時方向只是該條件期望的一個帶噪估計。使用 Tracker 的跟蹤散射(Tracked Scattering)則把瞬時散射方向作為在線標簽,學習更穩定的方向場。

Tracker 如何學習穩定的 Fake-to-Real 轉移場?

單個三樣本事件很便宜,但方差較大;換一組真實源和生成源,同一投射體可能收到不同方向。Tracker 學習的正是這些隨機觀測在給定位置和條件下的平均方向,而不是像 GAN 判別器那樣判斷真假。

算法 2:完整 TBSM 訓練循環

兩個參數組成的方法設計圖

TBSM 的 rho-lambda 設計圖

像素空間圖像 Transformer JiT(Just image Transformers)的 B 規模配置 JiT-B 短程實驗。Drift 是 Drifting Models 的圖中簡稱;圖中 Inception Score(IS)越高越好。四個角點依次對應類 Drift、Tracked Scattering、擴散相關和類 GAN 的結構聯系。擴散式訓練還需要配對噪聲輸入、時間條件和相應目標。

算法 3:一個直觀的視角去看 TBSM 能學到什么

算法 3:TBSM 的 “類 GAN” 位移類比

從算法 3 和傳統風格遷移的視角看,也可以把 Fake 和 Real 理解成兩種不同的 “風格”:Tracker 學習二者之間的轉移,再指導生成器產生新的 Fake;新的 Fake 又定義下一輪轉移場,形成迭代循環。這提供了一種直觀、與 GAN-like learned field 相近的理解視角。

從理論落到高維圖像

像素歐氏距離未必對應圖像語義距離,因此 TBSM 將散射搬到凍結的圖像表征空間:真實圖像、生成投射體和生成源經過凍結編碼器后計算方向與損失,梯度只沿投射體分支回到生成器,源特征保持停止梯度。多個表征空間分別形成損失后再聚合。

像素生成器的輸出可直接進入表征網絡;潛空間生成器則先通過凍結解碼器還原圖像。訓練結束后,Tracker 和額外表征分支都可移除,只保留生成器及潛空間模型原有的解碼器。

單步的 ImageNet 與文生圖結果

下表中的 FID 越低越好,Inception Score(IS)越高越好。所有 ImageNet 指標均由 50,000 張生成圖像計算,并使用訓練集參考統計量;TBSM 的訓練和推理均不使用 CFG(Classifier-Free Guidance)。擴散 Transformer(DiT)先生成潛空間表示再解碼,PixelDiT 和 JiT 則直接輸出圖像。

將原本為多步采樣訓練的 DiT-XL/4 直接限制為 NFE=1 時,FID 為 398.20;這只反映不適配的單步運行方式,不代表正常多步采樣的質量。經過 TBSM 訓練后,同一架構達到 1.92。

文生圖實驗從預訓練的 20B 參數 Qwen-Image 初始化,隨后只用 TBSM 更新生成器和 Tracker。

TBSM 后訓練的20B參數文生圖模型上的一步生成樣例

討論與展望

結語

TBSM 的核心是從能量距離得到 “真實吸引 — 生成自交互” 的局部方向,再讓 Tracker 學習其條件均值。訓練完成后,輔助網絡退出,生成器只需一次前向;它展示了把分布距離轉化為高維生成器可直接學習的樣本級運動監督的一條路徑。

項目狀態:目前已開放 MNIST 最小實現 和 ImageNet-1K 訓練、評測代碼;后續還計劃發布 Qwen-Image-20B 文生圖模型的權重和訓練代碼。

作者介紹:本文第一作者是西湖大學與浙江大學聯合培養的三年級博士生孫鵬,研究興趣是簡單有效的生成式AI的訓練與推理加速框架。未來希望能在世界模型和視頻生成上繼續找到合適的 合作者/Mentor 并做出更多有影響力的工作。

責任編輯:hn1007

主站蜘蛛池模板: 日本国产精品视频| 国产精品美女999| 国产欧美欧洲| 日韩av在线一区二区三区| 久久中文字幕视频| 日韩欧美亚洲天堂| 亚洲综合日韩中文字幕v在线| 久久精品国产成人| 欧洲精品久久| 日韩中文字幕在线不卡| 国产超级av在线| 国产精品欧美风情| 激情小说综合区| 久久亚洲私人国产精品va| 日韩免费av片在线观看| 丁香六月激情网| 国产精品观看在线亚洲人成网| 国产中文字幕91| 国产一区二区丝袜| 久久全国免费视频| 久久久久久久久久久视频| 久久久久久成人精品| 久久久这里只有精品视频| 久久亚洲欧美日韩精品专区| 欧美一区二区视频在线| 欧美一区二区视频在线播放| 欧美日韩高清免费| 欧美激情亚洲自拍| 久久久久久国产精品美女| 久热国产精品视频| 久久久久久久av| 久久99精品久久久久久噜噜| 欧美激情国产精品| 久久免费看av| 九九久久国产精品| 国产亚洲欧美在线视频| 国产精品视频26uuu| 国产成人a亚洲精品| 91久久国产综合久久91精品网站| 国产99在线播放| 91久久精品www人人做人人爽|