Video wird geladen...
Video konnte nicht geladen werden
🤔Want a principled way to RL your diffusion model? Check Data-regularized Reinforcement Learning (DDRL)! Post-train NVIDIA #Cosmos World Foundation models with a million GPU hours! 🤯 Novel formulation ➡️ Theoretically integrates SFT into RL ➡️ Robust to Reward Hacking 🛑 Details: #DDRL #Diffusion #RL #NVIDIA #Cosmos
78,317 Aufrufe • vor 9 Monaten •via X (Twitter)
7 Kommentare

Jiarui Liuvor 9 Monaten
@nvidia Nice work! In our recent paper on GRPO training for LLMs, we have a similar philosophy that unifies RL and SFT into a single objective:

Haotian Yevor 9 Monaten
@nvidia that's so cool!

Charlesvor 9 Monaten
@nvidia greate work! when will it be open sourced?

Haotian Yevor 9 Monaten
@nvidia very soon :)

Himanshu Kumarvor 9 Monaten
@nvidia Wow, Haotian, that DDRL approach sounds quite promising, especially for robust reward hacking, isn't it?

Haotian Yevor 9 Monaten
@nvidia yeah! reward hacking is a big motivation.

Yuanzhivor 9 Monaten
@nvidia Very cool work!!
