jobszurich.ch
← Tutte le offerte

Machine Learning Platform Engineer

BJAK

Tipo di contratto
Tempo pieno
Luogo
Zürich
Prima pubblicazione
Candidati ora

Informazioni su A1

Oggi ci sono oltre 5 miliardi di utenti che utilizzano applicazioni di base come email, note, task che non sono AI-native. La nostra missione è costruire un assistente intelligente proattivo per gli utenti quotidiani per portare intelligenza nelle conversazioni, nelle commissioni, nell'organizzazione e nei flussi di lavoro, con un prompting minimo.

Il nostro prodotto si concentra sul raggiungimento di un'elevata affidabilità per workflow a lunga durata, contesto persistente e completamento di task nel mondo reale. Il sistema deve gestire il ragionamento multi-step, interagire con strumenti esterni e rimanere affidabile nonostante il comportamento non deterministico del modello. Il nostro obiettivo è aiutare gli utenti a completare i task quotidianamente in modo piacevole con un tempo ridotto di oltre ~90%*.

Informazioni sul Ruolo

In qualità di ML Platform Engineer, costruirai l'infrastruttura e i sistemi che alimentano le capacità AI di A1.

Progetterai e gestirai i sistemi dietro lo stack AI, dall'addestramento e valutazione del modello al deployment, l'inferenza, l'osservabilità e il miglioramento continuo.

Lavorerai a stretto contatto con ingegneri AI, ricercatori e ingegneri di prodotto per trasformare i modelli in sistemi di produzione affidabili, scalabili ed efficienti in termini di costi. Costruirai le piattaforme, gli strumenti e l'infrastruttura che consentono al team di sperimentare rapidamente e portare le capacità AI in produzione con fiducia.

Focus

  • Costruire e gestire l'infrastruttura e le piattaforme ML che alimentano i prodotti AI di A1
  • Progettare sistemi per l'addestramento, la valutazione, il deployment, l'inferenza e la sperimentazione del modello
  • Costruire e ottimizzare l'infrastruttura di model serving e inferenza per carichi di lavoro ad alto throughput e bassa latenza
  • Migliorare l'affidabilità, la scalabilità, la latenza e l'efficienza dei costi dei sistemi AI
  • Sviluppare pipeline affidabili per la preparazione dei dati, l'addestramento, la valutazione, il rilascio del modello e il miglioramento continuo
  • Costruire piattaforme e strumenti che consentano agli ingegneri AI e ai ricercatori di sperimentare, valutare e rilasciare modelli più velocemente
  • Sviluppare infrastrutture di valutazione e benchmarking per misurare la qualità, le prestazioni e le regressioni del modello
  • Costruire osservabilità, monitoraggio, tracing e alerting di produzione per carichi di lavoro AI/ML
  • Migliorare i sistemi AI in termini di affidabilità, scalabilità, latenza, throughput e costi
  • Identificare colli di bottiglia in tutto lo stack ML e migliorare continuamente le prestazioni del sistema
  • Lavorare a stretto contatto con ingegneri AI, ricercatori e team di prodotto per trasformare i requisiti dei modelli in evoluzione in infrastrutture pronte per la produzione

Tech Stack

  • Python
  • PyTorch / JAX
  • Infrastruttura di servizio LLM e ML come vLLM, SGLang o TensorRT-LLM
  • Infrastruttura cloud
  • Sistemi distribuiti
  • Pipeline ML/dati e orchestrazione dei workflow
  • Infrastruttura GPU e strumenti di performance
  • Database vettoriali e infrastruttura di retrieval

Esperienza Ideale

  • Solidi fondamenti di ingegneria del software ed esperienza nella costruzione di sistemi di produzione
  • Esperienza nella costruzione di infrastrutture ML, piattaforme o sistemi di machine learning di produzione
  • Esperienza con il deployment dei modelli, l'inferenza, la valutazione o le pipeline di dati
  • Forte comprensione dei sistemi distribuiti e dell'affidabilità del sistema
  • Capacità di scrivere codice pulito, manutenibile e di qualità per la produzione
  • Capacità di lavorare in ambienti ambigui e in rapida evoluzione
  • Propensione verso l'ownership, la sperimentazione e il miglioramento continuo

Risultati

  • L'infrastruttura AI supporta in modo affidabile i carichi di lavoro di produzione su scala
  • I modelli possono essere addestrati, valutati, implementati e migliorati efficientemente
  • I sistemi di inferenza offrono prestazioni elevate di latenza, throughput, affidabilità ed efficienza dei costi
  • Le pipeline ML sono riproducibili, osservabili, manutenibili e robuste
  • Le regressioni del modello e dell'infrastruttura vengono rilevate rapidamente e diagnosticate efficientemente
  • Le capacità comuni dell'infrastruttura ML diventano primitive di piattaforma riutilizzabili piuttosto che essere ricostruite per ogni prodotto AI
  • Lo stack AI può evolversi rapidamente con l'emergere di nuovi modelli, architetture e tecniche di inferenza

Tradotto automaticamente dall’originale.

Pubblicato 7 settimane fa

Luogo

Vedi su Google Maps