Site Reliability Engineer
- Anstellung
- Vollzeit
- Ort
- Zürich
- Erstmals ausgeschrieben
Über uns:
DeepJudge ist das führende KI- und ICT-Scale-up der Schweiz und transformiert die Art und Weise, wie Anwaltskanzleien und Rechtsabteilungen auf ihr Wissen zugreifen und dieses nutzen. Gegründet von ehemaligen Google Search Engineers mit PhDs in KI von der ETH Zürich und unterstützt von erstklassigen Silicon Valley Investoren, bauen wir die Intelligence-Schicht, die die Rechtsbranche antreibt.
Jede Kanzlei kann die gleichen KI-Modelle lizenzieren, aber keine zwei Kanzleien teilen das gleiche institutionelle Wissen. Jahrzehnte an Erfahrung, Arbeitsergebnissen und Präzedenzfällen sind oft über verschiedene Systeme verteilt, untergenutzt und unzugänglich. DeepJudge macht dieses Fachwissen durch erstklassige Enterprise-Search und KI-Infrastruktur sofort verfügbar und ermöglicht es Kanzleien, Workflows zu automatisieren, wissensgestützte Anwendungen zu erstellen und Erfahrung in einen dauerhaften Vorteil zu verwandeln.
Unsere Technologie wird von vielen der weltweit führenden Anwaltskanzleien genutzt, darunter Freshfields, Gunderson Dettmer, Holland & Knight, Arent Fox und Cozen O’Connor. Mit Hauptsitz in der Schweiz und einem wachsenden Team in Nordamerika expandieren wir schnell und gestalten die Zukunft der Art und Weise, wie professionelles Wissen entdeckt und angewendet wird.
Bei DeepJudge bewegen wir uns schnell, denken rigoros und legen großen Wert auf das, was wir bauen. Wir kombinieren modernste Forschung mit enger Zusammenarbeit mit unseren Kunden, um Lösungen zu liefern, die wirklich etwas bewirken. Wenn Sie Teil eines Teams sein möchten, das definiert, wie KI anspruchsvolle Wissensarbeit transformiert, dann ist dies der richtige Ort dafür.
Über die Rolle:
Als Site Reliability Engineer bei DeepJudge sind Sie verantwortlich für die Zuverlässigkeit der Systeme, auf die führende Anwaltskanzleien jeden Tag angewiesen sind. Wir betreiben unsere KI-Suchplattform in dedizierten Produktionsumgebungen, von denen jede ein groß angelegtes Such- und Abrufsystem ist, das mit sehr hohen Datenvolumina arbeitet, zusammen mit unseren Ingestion-Pipelines und Datenspeichern auf einer container-orchestrierten Infrastruktur über mehrere öffentliche und private Clouds hinweg. Diese Umgebungen schnell, verfügbar und vertrauenswürdig zu halten, ist eine echte Engineering-Herausforderung, und das ist Ihre Mission.
Dies ist eine technische, infrastrukturfokussierte Rolle: Sie werden Ihre Zeit mit Systemen, Code und Telemetrie verbringen. Sie werden die Plattform härten, damit Fehlerklassen nicht wiederkehren, Observability und SLOs aufbauen, um Probleme zu erkennen, bevor sie auftreten, die Kapazität angesichts des unaufhaltsamen Datenwachstums planen und den Aufwand (Toil) des sicheren Betriebs vieler Produktionsumgebungen durch Automatisierung eliminieren. Sie werden in unseren Bereichen Deployment und Infrastructure-as-Code arbeiten und eng mit dem Product Engineering zusammenarbeiten, um Erkenntnisse zur Zuverlässigkeit zurück in die Plattform zu spielen. Wenn Sie gerne ernsthafte verteilte Systeme in großem Maßstab betreiben und Brandbekämpfung in technisch fundierte Zuverlässigkeit verwandeln möchten, ist diese Rolle die richtige für Sie.
Ihre Aufgaben werden Folgendes umfassen:
- Verantwortlichkeit für die Verfügbarkeit, Latenz und Performance unserer Produktionsumgebungen: groß angelegte Such- und Abruf-Services, Ingestion und Datenspeicher auf container-orchestrierten Infrastrukturen über mehrere öffentliche und private Clouds hinweg
- Verantwortung für die Cloud-Infrastruktur über mehrere öffentliche und private Clouds, Networking, Identity und Access, Compute und Storage, sowie das Management von Cloud-Kapazität, Quotas und Kosten mit wachsender Flotte
- Verbesserung von Deployment und Infrastruktur durch Code: GitOps-basierte Konfiguration und Deployment sowie Infrastructure-as-Code über unsere öffentlichen und privaten Clouds, mit sicheren, vorgesehene und wiederherstellbaren Produktionsänderungen
- Definition und Implementierung von SLOs und Error Budgets sowie Aufbau von Dashboards, Metriken und Alerting, die die Produktion beobachtbar und handlungsfähig machen
- Reduzierung von operativen Aufwänden (Toil) durch Automatisierung und interne Tools, geschrieben in Python und / oder Go
- Bereitstellung und Standardisierung neuer Produktionsumgebungen nach einem definierten Zuverlässigkeitsstandard
Sie sind eine ideale Besetzung, wenn Sie:
- Über 3+ Jahre Erfahrung in SRE, Production / Platform Engineering oder infrastrukturintensiver Softwareentwicklung haben und echte Produktionssysteme unter Zuverlässigkeitserwartungen betrieben haben
- Stark in der Container-Orchestrierungs-Operation in der Produktion sind und sich auf mindestens einer großen Public Cloud sicher bewegen
- Solide Erfahrung mit Cloud-Infrastruktur auf einer großen Public Cloud und ein funktionierendes Verständnis von Cloud-Kapazität, Quotas und Kosten haben
- Observability hands-on mit Metriken, Logs und Traces praktizieren und diese zur Ursachenanalyse (Root-Cause) von Live-Vorfällen nutzen
- Sicher im Umgang mit Infrastructure-as-Code und GitOps sind
- In Python und / oder Go programmieren können für Automatisierung, Tooling sowie zum Lesen und Patchen von Service-Code
- Ein fundiertes Urteilsvermögen für den Produktionsbetrieb mitbringen und Ihre Arbeit für andere Ingenieure klar dokumentieren
- Bonus: Erfahrung im Betrieb von groß angelegten Such- oder verteilten Datensystemen, Datenbankbetrieb, dedizierter / Enterprise-deployter Software oder KI / Enterprise-Search-Infrastruktur in regulierten Bereichen
Was Sie erwartet:
- Die Verantwortung für die Zuverlässigkeit von Systemen, auf die sich die weltweit führenden Anwaltskanzleien verlassen: echte Skalierung, echte Wirkung
- Tiefe Hands-on-Arbeit mit moderner Infrastruktur: verteilte Suche in sehr großem Maßstab, Container-Orchestrierung über mehrere Clouds hinweg und ein ausgereifter Infrastructure-as-Code- und GitO
Automatisch aus dem Original übersetzt.
Ausgeschrieben heute