Senior DevOps / Platform Engineer, AI Infrastructure (m/w/d)
MAIAAbout the role
MAIA macht das Wissen von Unternehmen im Arbeitsalltag nutzbar. Unsere KI-Plattform verbindet komplexe Dokumente, Unternehmenswissen und agentische Workflows, damit Menschen verlässliche Antworten finden und anspruchsvolle Aufgaben effizienter erledigen können. Ausgehend von unseren Kunden in der Industrie entwickeln wir MAIA für eine breitere Zielgruppe weiter. Mit dem Produkt wachsen die Anforderungen an unsere Infrastruktur. Neue KI-Funktionen, mehr Kunden und ein größeres Engineering-Team brauchen eine Plattform, auf deren Zuverlässigkeit, Sicherheit und Performance sie sich verlassen können. Als unser erster dedizierter Senior DevOps / Platform Engineer übernimmst du die technische Verantwortung für Infrastruktur und Betrieb. Du entwickelst eine bestehende Plattform weiter und gestaltest ihre Architektur, Automatisierung und Betriebsstandards. Das ist eine hands-on Senior-Rolle ohne Personalverantwortung. Du bist zunächst die einzige dedizierte Person im Bereich und arbeitest eng mit Engineering und Geschäftsführung zusammen. Wenn du Infrastruktur bisher in einem kleinen Team mitverantwortet hast und jetzt einen eigenen Bereich gestalten möchtest, ist das ein passender nächster Schritt. Aufgaben Du entwickelst unsere Infrastruktur für den nächsten Wachstumsschritt weiter. Du betreibst selbst administrierte Linux-Systeme auf europäischen VMs und dedizierten Servern und integrierst Dienste von AWS, Azure und GCP. Dazu gehören Docker Compose, Netzwerke, Reverse Proxies und API Gateways. Du machst Änderungen sicher und reproduzierbar. Du entwickelst Infrastructure as Code, CI/CD und Deployment-Workflows weiter. Automatisierte Prüfungen, nachvollziehbare Konfigurationen und erprobte Rollbacks schaffen Vertrauen in jeden Release. Du verantwortest PostgreSQL im produktiven Betrieb. Du analysierst Performance, optimierst Connection Pooling und Kapazitäten und stellst durch getestete Backup- und Restore-Verfahren sicher, dass wir Daten zuverlässig wiederherstellen können. Du machst das Verhalten unserer Systeme verständlich. Du entwickelst unseren selbst betriebenen Observability-Stack weiter, verbindest Metriken, Logs und Traces und etablierst Alerting, das konkrete Handlungen ermöglicht. Du verankerst Sicherheit im Betrieb. Du setzt Least Privilege, Secrets Management, Vulnerability Scanning und Patch Management konsequent um. Für unser laufendes ISO-27001-Vorhaben implementierst du technische Maßnahmen und automatisierst prüfbare Nachweise. Du gestaltest unsere AI Infrastructure. Du bewertest Inferenzanbieter und Betriebsmodelle anhand von Latenz, Durchsatz, Kosten und Zuverlässigkeit. Perspektivisch erschließt du bei Bedarf eigenes LLM-Serving auf GPU-Infrastruktur. Europäische, souveräne Betriebsoptionen sind dabei ein Teil unserer zukünftigen Strategie. Du verbesserst den Betrieb für das gesamte Team. Du automatisierst wiederkehrende Aufgaben, dokumentierst Betriebsabläufe und untersuchst Störungen systematisch. Erkenntnisse fließen in dauerhaf
Apply for this role
Generate a tailored application kit with a matched cover letter, interview prep, and CV highlights — in under 60 seconds.
Apply Now →Generate Application KitFree account required — sign up in 30s