Vai al contenuto

Senior Research Scientist, Reward Models

Questa offerta fa per te?

Crea il tuo CV e scopri la tua percentuale di corrispondenza con questa posizione — e con tutte le altre.

Crea il mio CV

La posizione

Lead cutting-edge research on reward model architectures and RLHF training for large language models.
Develop rubric-based grading and evaluation methods to improve interpretability and consistency.
Study reward hacking, specification gaming, and robust alignment strategies.
Design large-scale experiments to assess generalization, robustness, and failure modes.
Collaborate with Finetuning and Alignment Science teams to translate insights into production improvements.
Mentor researchers, publish findings, and grow institutional knowledge around reward modeling.

Vedi l'annuncio completo

Mansioni, profilo, competenze e vantaggi — crea il tuo account gratuito.

Almeno 6 caratteri. Più è lunga, più è sicura.
o

Hai già un account?

Offerte simili

Altre posizioni che potrebbero interessarti.

Vedi tutto →

La tua località

Offerte e aziende saranno filtrate su questo paese.

Suggeriti

Tutti i paesi 68