Vai al contenuto
Whileresume
Classifica Crea il mio CV Assumere Accedi

Senior Research Scientist, Reward Models

Questa offerta fa per te?

Crea il tuo CV e scopri la tua percentuale di corrispondenza con questa posizione — e con tutte le altre.

Crea il mio CV
Segui le tue candidature da mobile L'app gratuita Whileresume, su iPhone e Android.

La posizione

Lead research on novel reward model architectures and RLHF training approaches for large language models.
Develop and evaluate LLM-based grading and evaluation methods, including rubric-driven approaches that improve consistency and interpretability.
Research techniques to detect, characterize, and mitigate reward hacking and specification gaming.
Design experiments to understand reward model generalization, robustness, and failure modes.
Collaborate with the Finetuning team to translate research insights into improvements for production training pipelines.
Contribute to research publications, blog posts, and internal documentation; mentor other researchers and help build institutional knowledge around reward modeling.

Vedi l'annuncio completo

Mansioni, profilo, competenze e vantaggi — crea il tuo account gratuito.

Almeno 6 caratteri. Più è lunga, più è sicura.
o

Hai già un account?

Queste offerte potrebbero interessarti

Nessuna offerta davvero simile per ora — ecco le più recenti.

La tua località

Offerte e aziende saranno filtrate su questo paese.

Suggeriti

Tutti i paesi 68