Ir al contenido

Principal ML Engineer - Large Scale Training Performance Optimization

¿Es esta oferta para usted?

Cree su CV y descubra su porcentaje de coincidencia con este puesto — y con todos los demás.

Crear mi CV

El puesto

Lead distributed training of large-scale models across multi-GPU systems to convergence.
Design and optimize end-to-end training pipelines, leveraging data, tensor, pipeline, and expert parallelism (including ZeRO) to scale out.
Implement algorithmic and kernel-level optimizations to improve training throughput and efficiency.
Stay current with the latest training methods and contribute changes to open-source projects.
Collaborate across teams and stakeholders to influence the direction of the AI platform while communicating results clearly.
Requires a master's or PhD in CS/AI with hybrid (partial on-site) work in San Jose, CA or Bellevue, WA.

Ver la oferta completa

Funciones, perfil, competencias y ventajas — crea tu cuenta gratis.

Mínimo 8 caracteres, con una mayúscula y una cifra.

¿Ya tiene una cuenta? Iniciar sesión

Ofertas similares

Otros puestos que podrían encajar.

Ver todo →

Su ubicación

Las ofertas y empresas se filtrarán por este país.

Sugeridos

Todos los países 66