Aller au contenu

Principal ML Engineer - Large Scale Training Performance Optimization

Cette offre est-elle pour vous ?

Créez votre CV et découvrez votre pourcentage de correspondance avec ce poste — et avec tous les autres.

Créer mon CV

Le poste

Lead distributed training of large-scale models across multi-GPU systems to convergence.
Design and optimize end-to-end training pipelines, leveraging data, tensor, pipeline, and expert parallelism (including ZeRO) to scale out.
Implement algorithmic and kernel-level optimizations to improve training throughput and efficiency.
Stay current with the latest training methods and contribute changes to open-source projects.
Collaborate across teams and stakeholders to influence the direction of the AI platform while communicating results clearly.
Requires a master's or PhD in CS/AI with hybrid (partial on-site) work in San Jose, CA or Bellevue, WA.

Voir l'offre en entier

Missions, profil recherché, compétences et avantages — en créant votre compte gratuitement.

8 caractères minimum, dont une majuscule et un chiffre.

Déjà un compte ? Se connecter

Offres similaires

D'autres postes qui pourraient vous convenir.

Voir tout →

Votre lieu

Les offres et entreprises seront filtrées sur ce pays.

Suggérés

Tous les pays 65