Aller au contenu
Whileresume
Classement Créer mon CV Recruter Se connecter

Senior Research Scientist, Reward Models

Cette offre est-elle pour vous ?

Créez votre CV et découvrez votre pourcentage de correspondance avec ce poste — et avec tous les autres.

Créer mon CV
Suivez vos candidatures sur mobile L'application Whileresume, gratuite, sur iPhone et Android.

Le poste

Lead research on novel reward model architectures and RLHF training approaches for large language models.
Develop and evaluate LLM-based grading and evaluation methods, including rubric-driven approaches that improve consistency and interpretability.
Research techniques to detect, characterize, and mitigate reward hacking and specification gaming.
Design experiments to understand reward model generalization, robustness, and failure modes.
Collaborate with the Finetuning team to translate research insights into improvements for production training pipelines.
Contribute to research publications, blog posts, and internal documentation; mentor other researchers and help build institutional knowledge around reward modeling.

Voir l'offre en entier

Missions, profil recherché, compétences et avantages — en créant votre compte gratuitement.

6 caractères minimum. Plus il est long, plus il est sûr.
ou

Déjà un compte ?

Ces offres pourraient vous intéresser

Aucune offre vraiment proche pour l'instant — voici les plus récentes.

Votre lieu

Les offres et entreprises seront filtrées sur ce pays.

Suggérés

Tous les pays 65