Vai al contenuto
Whileresume
Classifica Crea il mio CV Assumere Accedi

Senior Research Scientist, Reward Models

Questa offerta fa per te?

Crea il tuo CV e scopri la tua percentuale di corrispondenza con questa posizione — e con tutte le altre.

Crea il mio CV
Segui le tue candidature da mobile L'app gratuita Whileresume, su iPhone e Android.

La posizione

Lead cutting-edge research on reward model architectures and RLHF training for large language models.
Develop rubric-based grading and evaluation methods to improve interpretability and consistency.
Study reward hacking, specification gaming, and robust alignment strategies.
Design large-scale experiments to assess generalization, robustness, and failure modes.
Collaborate with Finetuning and Alignment Science teams to translate insights into production improvements.
Mentor researchers, publish findings, and grow institutional knowledge around reward modeling.

Vedi l'annuncio completo

Mansioni, profilo, competenze e vantaggi — crea il tuo account gratuito.

Almeno 6 caratteri. Più è lunga, più è sicura.
o

Hai già un account?

Queste offerte potrebbero interessarti

Nessuna offerta davvero simile per ora — ecco le più recenti.

La tua località

Offerte e aziende saranno filtrate su questo paese.

Suggeriti

Tutti i paesi 68