Senior Research Scientist, Reward Models
职位介绍
Lead cutting-edge research on reward model architectures and RLHF training for large language models.
Develop rubric-based grading and evaluation methods to improve interpretability and consistency.
Study reward hacking, specification gaming, and robust alignment strategies.
Design large-scale experiments to assess generalization, robustness, and failure modes.
Collaborate with Finetuning and Alignment Science teams to translate insights into production improvements.
Mentor researchers, publish findings, and grow institutional knowledge around reward modeling.
Develop rubric-based grading and evaluation methods to improve interpretability and consistency.
Study reward hacking, specification gaming, and robust alignment strategies.
Design large-scale experiments to assess generalization, robustness, and failure modes.
Collaborate with Finetuning and Alignment Science teams to translate insights into production improvements.
Mentor researchers, publish findings, and grow institutional knowledge around reward modeling.
查看完整职位
工作职责、任职要求、技能与福利 — 免费创建账号即可查看。
或
已有账户?
登录相似职位
其他可能适合您的职位。
远程办公Partial
城市San Francisco, 美国