正在加载视频...
视频加载失败
🤔Want a principled way to RL your diffusion model? Check Data-regularized Reinforcement Learning (DDRL)! Post-train NVIDIA #Cosmos World Foundation models with a million GPU hours! 🤯 Novel formulation ➡️ Theoretically integrates SFT into RL ➡️ Robust to Reward Hacking 🛑 Details: #DDRL #Diffusion #RL #NVIDIA #Cosmos
78,317 次观看 • 9 个月前 •via X (Twitter)
7 条评论

Jiarui Liu9 个月前
@nvidia Nice work! In our recent paper on GRPO training for LLMs, we have a similar philosophy that unifies RL and SFT into a single objective:

Haotian Ye9 个月前
@nvidia that's so cool!

Charles9 个月前
@nvidia greate work! when will it be open sourced?

Haotian Ye9 个月前
@nvidia very soon :)

Himanshu Kumar9 个月前
@nvidia Wow, Haotian, that DDRL approach sounds quite promising, especially for robust reward hacking, isn't it?

Haotian Ye9 个月前
@nvidia yeah! reward hacking is a big motivation.

Yuanzhi9 个月前
@nvidia Very cool work!!
