
Trajectory
@trajectorylabs • 4,419 subscribers
Building the platform for Continual Learning
Videos

It's time to rethink RL. Translating real world use into model improvements requires redesigning post-training algorithms for non-verifiable, per token rewards. At AI Engineer 's World Fair, we share our insights into scaling algorithms like SDPO for continual learning.
Trajectory65,434 Aufrufe • vor 11 Tagen
Keine weiteren Inhalte verfügbar
