jobszurich.ch
← Tutte le offerte

Machine Learning Platform Engineer

BJAK

Tipo di contratto
Tempo pieno
Luogo
Zürich
Prima pubblicazione
Candidati ora
Informazioni su A1 Oggi ci sono oltre 5 miliardi di utenti che utilizzano applicazioni di base come email, note, task che non sono AI-native. La nostra missione è costruire un assistente intelligente proattivo per gli utenti quotidiani per portare intelligenza nelle conversazioni, nelle commissioni, nell'organizzazione e nei flussi di lavoro, con un prompting minimo. Il nostro prodotto si concentra sul raggiungimento di un'elevata affidabilità per workflow a lunga durata, contesto persistente e completamento di task nel mondo reale. Il sistema deve gestire il ragionamento multi-step, interagire con strumenti esterni e rimanere affidabile nonostante il comportamento non deterministico del modello. Il nostro obiettivo è aiutare gli utenti a completare i task quotidianamente in modo piacevole con un tempo ridotto di oltre ~90%*. Informazioni sul Ruolo In qualità di ML Platform Engineer, costruirai l'infrastruttura e i sistemi che alimentano le capacità AI di A1. Progetterai e gestirai i sistemi dietro lo stack AI, dall'addestramento e valutazione del modello al deployment, l'inferenza, l'osservabilità e il miglioramento continuo. Lavorerai a stretto contatto con ingegneri AI, ricercatori e ingegneri di prodotto per trasformare i modelli in sistemi di produzione affidabili, scalabili ed efficienti in termini di costi. Costruirai le piattaforme, gli strumenti e l'infrastruttura che consentono al team di sperimentare rapidamente e portare le capacità AI in produzione con fiducia. Focus - Costruire e gestire l'infrastruttura e le piattaforme ML che alimentano i prodotti AI di A1 - Progettare sistemi per l'addestramento, la valutazione, il deployment, l'inferenza e la sperimentazione del modello - Costruire e ottimizzare l'infrastruttura di model serving e inferenza per carichi di lavoro ad alto throughput e bassa latenza - Migliorare l'affidabilità, la scalabilità, la latenza e l'efficienza dei costi dei sistemi AI - Sviluppare pipeline affidabili per la preparazione dei dati, l'addestramento, la valutazione, il rilascio del modello e il miglioramento continuo - Costruire piattaforme e strumenti che consentano agli ingegneri AI e ai ricercatori di sperimentare, valutare e rilasciare modelli più velocemente - Sviluppare infrastrutture di valutazione e benchmarking per misurare la qualità, le prestazioni e le regressioni del modello - Costruire osservabilità, monitoraggio, tracing e alerting di produzione per carichi di lavoro AI/ML - Migliorare i sistemi AI in termini di affidabilità, scalabilità, latenza, throughput e costi - Identificare colli di bottiglia in tutto lo stack ML e migliorare continuamente le prestazioni del sistema - Lavorare a stretto contatto con ingegneri AI, ricercatori e team di prodotto per trasformare i requisiti dei modelli in evoluzione in infrastrutture pronte per la produzione Tech Stack - Python - PyTorch / JAX - Infrastruttura di servizio LLM e ML come vLLM, SGLang o TensorRT-LLM - Infrastruttura cloud - Sistemi distribuiti - Pipeline ML/dati e orchestrazione dei workflow - Infrastruttura GPU e strumenti di performance - Database vettoriali e infrastruttura di retrieval Esperienza Ideale - Solidi fondamenti di ingegneria del software ed esperienza nella costruzione di sistemi di produzione - Esperienza nella costruzione di infrastrutture ML, piattaforme o sistemi di machine learning di produzione - Esperienza con il deployment dei modelli, l'inferenza, la valutazione o le pipeline di dati - Forte comprensione dei sistemi distribuiti e dell'affidabilità del sistema - Capacità di scrivere codice pulito, manutenibile e di qualità per la produzione - Capacità di lavorare in ambienti ambigui e in rapida evoluzione - Propensione verso l'ownership, la sperimentazione e il miglioramento continuo Risultati - L'infrastruttura AI supporta in modo affidabile i carichi di lavoro di produzione su scala - I modelli possono essere addestrati, valutati, implementati e migliorati efficientemente - I sistemi di inferenza offrono prestazioni elevate di latenza, throughput, affidabilità ed efficienza dei costi - Le pipeline ML sono riproducibili, osservabili, manutenibili e robuste - Le regressioni del modello e dell'infrastruttura vengono rilevate rapidamente e diagnosticate efficientemente - Le capacità comuni dell'infrastruttura ML diventano primitive di piattaforma riutilizzabili piuttosto che essere ricostruite per ogni prodotto AI - Lo stack AI può evolversi rapidamente con l'emergere di nuovi modelli, architetture e tecniche di inferenza

Tradotto automaticamente dall’originale.

Pubblicato 1 settimana fa

Luogo

Vedi su Google Maps