Grafana OnCall vs PagerDuty vs Opsgenie: Das richtige On-Call-Tool wählen
Wenn Dienste um 3 Uhr morgens ausfallen, entscheidet das On-Call-Management, wie schnell das Team reagiert. Grafana OnCall, PagerDuty und Opsgenie sind die drei meistgenutzten Plattformen für Alert-Routing und Bereitschaftsplanung – mit grundlegend unterschiedlichen Philosophien: Open-Source und Self-Hosted vs. SaaS-Fullservice.
Was ist On-Call-Management?
On-Call-Management regelt, wer bei welchem Alert wann benachrichtigt wird. Ein gutes System:
- Routet Alerts automatisch an die richtige Person
- Eskaliert bei fehlender Reaktion
- Verwaltet Bereitschaftspläne (Rotationen, Schichten)
- Integriert sich in Monitoring-Tools wie Grafana, Prometheus oder Datadog
- Protokolliert Incidents für Post-Mortems
Ohne klares On-Call-Management enden kritische Alerts unbemerkt im Slack-Kanal.
Grafana OnCall: Self-Hosted Incident Response
Grafana OnCall ist das Open-Source-On-Call-Tool aus dem Grafana-Ökosystem. Es lässt sich vollständig selbst hosten und integriert sich nahtlos in Grafana Alerting.
Stärken:
- Kostenlos und Open-Source (Apache 2.0)
- Native Grafana-Integration: Alerts direkt aus Grafana-Dashboards
- Flexible Routing-Regeln (nach Schwere, Quelle, Zeit)
- Web-Oberfläche und Mobil-App (iOS/Android)
- Telegram-, Slack-, PagerDuty-kompatible APIs
Docker-Compose Setup (minimal):
services:
oncall:
image: grafana/oncall:latest
environment:
- DATABASE_URL=postgresql://oncall:pass@db:5432/oncall
- BROKER_URL=redis://redis:6379/0
- BASE_URL=https://oncall.example.com
- SECRET_KEY=dein-geheimer-schluessel-hier
depends_on:
- db
- redis
celery:
image: grafana/oncall:latest
command: ./celery_with_exporter.sh
environment:
- DATABASE_URL=postgresql://oncall:pass@db:5432/oncall
- BROKER_URL=redis://redis:6379/0
db:
image: postgres:15
environment:
POSTGRES_DB: oncall
POSTGRES_USER: oncall
POSTGRES_PASSWORD: pass
redis:
image: redis:7
Schwächen:
- Komplexer Self-Hosted-Betrieb (PostgreSQL + Redis + Celery erforderlich)
- Weniger Integrationen als PagerDuty (Stand 2026: ~100 vs. 700+)
- Mobile App noch nicht so ausgereift wie Konkurrenten
- Kein eingebautes Status-Page-Feature
PagerDuty: Der SaaS-Standard im Enterprise-Bereich
PagerDuty ist seit 2009 auf dem Markt und gilt als Goldstandard im Incident-Management. Es läuft vollständig als SaaS und braucht kein eigenes Hosting.
Stärken:
- 700+ Integrationen out-of-the-box (AWS, Azure, Datadog, Splunk, New Relic, …)
- Ausgereiftes Eskalationsmanagement mit Auto-Remediation
- KI-gestützte Alert-Gruppierung (Intelligent Alert Grouping)
- Detailliertes Incident-Analytics und Reporting
- Eingebaute Status-Pages und Service Catalog
- SOC 2 Type II, ISO 27001, HIPAA-kompatibel
Schwächen:
- Teuer: ab 21 USD/User/Monat (Professional), Enterprise auf Anfrage
- Kein Self-Hosting möglich
- Daten liegen auf US-amerikanischen Servern (DSGVO-Bedenken)
- Für kleine Teams oft überdimensioniert
Opsgenie: Die Atlassian-Alternative
Opsgenie gehört seit 2018 zu Atlassian und integriert sich nahtlos in den Jira/Confluence-Stack. Es positioniert sich zwischen Grafana OnCall (günstig, self-hosted) und PagerDuty (enterprise-grade, teuer).
Stärken:
- Günstigste der drei SaaS-Optionen: ab 9 USD/User/Monat (Essentials)
- Tiefe Jira Service Management Integration
- 200+ Integrationen
- Gute Mobile App mit iOS/Android Support
- Alert-Korrelation und Deduplication
Schwächen:
- Atlassian-Ökosystem-Lock-in
- Weniger Integrationen als PagerDuty
- Reporting weniger detailliert als bei PagerDuty
- Kein Self-Hosting
Direkter Vergleich: Welches Tool für wen?
| Kriterium | Grafana OnCall | PagerDuty | Opsgenie |
|---|---|---|---|
| Kosten | Kostenlos (OSS) | Teuer ($21+/User/Mo) | Günstig ($9+/User/Mo) |
| Hosting | Self-Hosted | SaaS only | SaaS only |
| Integrationen | ~100 | 700+ | 200+ |
| Grafana-Integration | Nativ | Via API | Via API |
| DSGVO | ✅ (eigene Infrastruktur) | ⚠️ (US-Server) | ⚠️ (US-Server) |
| Mobile App | Vorhanden | Ausgereift | Gut |
| Bereitschaftspläne | Vorhanden | Erweitert | Gut |
| KI-Features | Gering | Hoch | Mittel |
| Jira-Integration | Via Webhook | Gut | Nativ |
Alert-Routing in der Praxis
Grafana OnCall Routing (YAML-Konfiguration):
routes:
- id: kritisch
order: 0
routing_regex: "severity=critical"
escalation_chain_id: critical_chain
- id: warnung
order: 1
routing_regex: "severity=warning"
escalation_chain_id: warning_chain
continue: false
PagerDuty Event Rules (JSON-Beispiel):
{
"conditions": [
{"expression": "event.severity matches critical"}
],
"actions": [
{"route": {"value": "P1234567"}},
{"priority": {"value": "P3Z7H8R"}}
]
}
Der Funktionsumfang ist bei PagerDuty deutlich umfangreicher — Time-Based Conditions, Event Transformation, Automatic Actions — aber all das ist bei OnCall oder Opsgenie nicht verfügbar.
Empfehlung: Was passt zu wem?
Grafana OnCall ist ideal für:
- Teams, die bereits Grafana für Monitoring nutzen
- Self-Hoster mit DSGVO-Anforderungen
- Startups und kleinere Teams mit begrenztem Budget
- Kubernetes-Umgebungen mit Helm-Chart-Deployment
PagerDuty ist ideal für:
- Enterprise-Teams mit komplexen Eskalationsketten
- Unternehmen mit vielen verschiedenen Monitoring-Tools
- Teams, die KI-gestützte Alert-Korrelation brauchen
- Wenn ein Status Page und Service Catalog wichtig sind
Opsgenie ist ideal für:
- Teams, die bereits den Atlassian-Stack nutzen (Jira, Confluence)
- Mittlere Unternehmen, die SaaS wollen, aber PagerDuty zu teuer ist
- DevOps-Teams mit Jira Service Management als ITSM-Tool
Migration zwischen den Tools
Ein Wechsel zwischen den Plattformen ist möglich, aber aufwändig:
- Eskalationspläne müssen manuell migriert werden
- Alert-Routing-Regeln sind nicht kompatibel
- Integrationen (Webhooks, APIs) müssen neu konfiguriert werden
Tipp: Beginne mit dem Exportieren aller Bereitschaftspläne und Teams aus dem alten System. Grafana OnCall bietet eine PagerDuty-kompatible API, die eine Migration erleichtern kann.
Fazit
Grafana OnCall ist die beste Wahl für Grafana-Nutzer und DSGVO-sensible Teams – vorausgesetzt, sie können den Betrieb von PostgreSQL + Redis + Celery stemmen. PagerDuty bleibt das Enterprise-Tool schlechthin, wenn Budget keine Rolle spielt und maximale Integration gefragt ist. Opsgenie schließt die Lücke für Atlassian-Teams, die SaaS wollen, aber nicht zu PagerDuty-Preisen.
Weiterführende Artikel
- Prometheus vs. Datadog: Monitoring-Stacks im Vergleich
- Grafana vs. Kibana: Observability im Vergleich
- Uptime Kuma vs. Beszel: Self-Hosted Monitoring
- Checkmk vs Nagios vs Icinga: Infrastructure-Monitoring