Site Reliability Engineer (m/w/d) - AI Healthcare Infrastructure

Mediform GmbH · Karlsruhe

hybrid mid healthcare
Apply through theHRkey →
kubernetesiso

Position

Über Mediform

Mediform ist ein Health-Tech-Startup aus Karlsruhe. Mit MediVoice entwickeln wir einen KI-basierten Telefonassistenten, der Anliegen in Arztpraxen und MVZ autonom bearbeitet - von der Terminvergabe bis zur Rezeptanfrage.

Hinter jedem Anruf steht ein verteiltes System aus Telefonie, Echtzeit-Audioverarbeitung, KI-Diensten und Schnittstellen zu Praxisverwaltungssystemen. Genau hier kommst du ins Spiel.

Warum wir diese Rolle schaffen

Bisher haben die Engineers, die unser Produkt entwickeln, auch Infrastruktur, Observability und operative Schutzmechanismen aufgebaut. Mit unserem Wachstum schaffen wir nun erstmals eine dedizierte Reliability-Rolle: für eine Person, die Probleme eigenständig untersucht, fundierte Optionen erarbeitet und die gewählte Lösung verlässlich in Produktion bringt.

Wir priorisieren Reliability-Themen gemeinsam. Du verantwortest Untersuchung, Entscheidungsgrundlage, Umsetzung und Follow-through. In den kommenden zwei bis drei Jahren kann dein Verantwortungsbereich mit wachsendem Kontext und Vertrauen bis zur übergreifenden Gestaltung der Reliability-Disziplin bei Mediform wachsen.

Aufgaben

Die Reihenfolge legen wir anhand von Wirkung, Risiko und Aufwand gemeinsam fest.

Qualifikation

Ein vollständiger Stack-Match ist nicht nötig. Entscheidend sind deine Arbeitsweise, echte Produktionserfahrung und die Fähigkeit, neue technische Domänen zuverlässig zu erschließen.

Unser technischer Kontext:

Unser Umfeld umfasst AWS, Kubernetes/EKS, EC2, RDS/PostgreSQL, Prometheus, Grafana, Loki, Sentry, Linux-Netzwerke und Infrastructure as Code. Hinzu kommen SIP/RTP-basierte Telefonie, Echtzeit-Audio, GPU-Workloads, externe KI-Dienste sowie Integrationen mit Termin- und Praxisverwaltungssystemen.

Erfahrung mit einzelnen Teilen davon ist ein Plus, aber keine Voraussetzung.

Wie wir arbeiten:

Wir treffen technische Entscheidungen in offener Diskussion statt über Hierarchie. Gut begründete Bedenken haben Gewicht, und wir ändern den Kurs, wenn die Evidenz dafür spricht.

Diese Rolle trägt echte Verantwortung, ist aber nicht der Ort, an den Produktionsprobleme oder Schuld weitergereicht werden. Bei Incidents verbessern wir Schutzmechanismen und klären Verantwortlichkeiten - ohne Sündenböcke oder Heldenkultur.

Unser Anrufvolumen beginnt gegen 07:00 Uhr und steigt ab 08:00 Uhr stark an. Ein früher Arbeitsbeginn ist praktisch, aber wir suchen keine dauerhaft verfügbare Frühschicht. Wir suchen jemanden, der mit uns sicherstellt, dass ein Ausfall um 07:00 Uhr eine entworfene und getestete Antwort hat - unabhängig vom persönlichen Tagesrhythmus.

Wir sind AI-native: KI gehört für uns zu Code, Untersuchung und Entscheidungsvorbereitung. Urteilsvermögen, Verifikation und Verantwortung bleiben menschlich.

Benefits

Bewerbungsprozess

  1. Remote-Kennenlernen (30 Minuten): Hintergrund, Erwartungen und Rolle.
  2. Technischer Deep Dive: Ein realistischer Reliability-Fall; uns interessieren deine Fragen, Hypothesen und Entscheidungen, nicht auswendig gelernte Tooldetails.
  3. Teamgespräch in Karlsruhe: Gegenseitiges Kennenlernen und Raum für offene Fragen.

Deine Bewerbung

Ein klassisches Anschreiben ist nicht nötig. Schick uns deinen Lebenslauf (Zeugnisse optional) und beantworte stattdessen kurz diese Frage:

Erzähle uns von einem Produktionsproblem, das dir selbst aufgefallen ist, ohne dass es als Ticket existierte. Wie hast du es untersucht, welche Optionen hast du vorgeschlagen und was wurde anschließend umgesetzt?

Wir freuen uns darauf, dich kennenzulernen.

Find Jobs in Germany on Arbeitnow

Posted 27 Jul 2026 · ref 215483