ML Platform Engineer (m/w) 100%
- Anstellung
- Vollzeit
- Ort
- Zürich
- Erstmals ausgeschrieben
Job Informationen ######
Standort: Zurich, hybrid Arbeitslast: Vollzeit Ihre Aufgaben: Aufbau und Betrieb der ML-Infrastruktur und -Plattformen, die die KI-Produkte von A1 antreiben Entwurf von Systemen für Modelltraining, Evaluierung, Deployment, Inferenz und Experimentierung Aufbau und Optimierung der Model-Serving- und Inferenz-Infrastruktur für High-Throughput- und Low-Latency-Workloads Verbesserung der Zuverlässigkeit, Skalierbarkeit, Latenz und Kosteneffizienz von KI-Systemen Entwicklung zuverlässiger Pipelines für Datenvorbereitung, Training, Evaluierung, Modellveröffentlichung und kontinuierliche Verbesserung Aufbau von Plattformen und Tools, die es KI-Ingenieuren und Forschern ermöglichen, Modelle schneller zu experimentieren, zu evaluieren und auszuliefern Entwicklung von Evaluierungs- und Benchmarking-Infrastrukturen zur Messung von Modellqualität, Performance und Regressionen Aufbau von Produktions-Observability, Monitoring, Tracing und Alerting für KI/ML-Workloads Verbesserung von KI-Systemen in Bezug auf Zuverlässigkeit, Skalierbarkeit, Latenz, Durchsatz und Kosten Identifizierung von Engpässen über den ML-Stack hinweg und kontinuierliche Verbesserung der Systemleistung Enge Zusammenarbeit mit KI-Ingenieuren, Forschern und Produktteams, um sich entwickelnde Modellanforderungen in produktionsreife Infrastruktur zu überführen Tech Stack Python PyTorch / JAX LLM- und ML-Serving-Infrastruktur wie vLLM, SGLang oder TensorRT-LLM Cloud-Infrastruktur Verteilte Systeme ML/Data-Pipelines und Workflow-Orchestrierung GPU-Infrastruktur und Performance-Tools Vektordatenbanken und Retrieval-Infrastruktur Ideale Erfahrung Fundierte Kenntnisse im Software Engineering und Erfahrung im Aufbau von Produktionssystemen Erfahrung im Aufbau von ML-Infrastrukturen, Plattformen oder produktionsreifen Machine-Learning-Systemen Erfahrung mit Modell-Deployment, Inferenz, Evaluierung oder Daten-Pipelines Starkes Verständnis von verteilten Systemen und Systemzuverlässigkeit Fähigkeit, sauberen, wartbaren Code in Produktionsqualität zu schreiben Komfortabler Umgang mit unklaren, sich schnell bewegenden Umgebungen Fokus auf Eigenverantwortung, Experimentierfreudigkeit und kontinuierliche Verbesserung
Benötigte Skills ######
• CLOUD
• Monitoring
• Python
• Machine Learning
Automatisch aus dem Original übersetzt.
Ausgeschrieben vor 2 Tagen