Video wird geladen...
Video konnte nicht geladen werden
It's time to rethink RL. Translating real world use into model improvements requires redesigning post-training algorithms for non-verifiable, per token rewards. At AI Engineer 's World Fair, we share our insights into scaling algorithms like SDPO for continual learning.
65,434 Aufrufe • vor 11 Tagen •via X (Twitter)
0 Kommentare
Keine Kommentare verfügbar
Kommentare vom Original-Post werden hier angezeigt
