Vérifié chaque minute, avec 30 jours d'historique.
Le statut en direct est mesuré en dehors de notre propre plateforme, sur Cloudflare, afin qu'il réponde encore quand nous ne répondons plus. Cette page décrit ce que nous surveillons, les objectifs que nous nous fixons et notre gestion de la maintenance.
Ce que les sondes vérifient chaque minute, de bout en bout.
Dashboard Web
app.logpulse.io : UI de recherche, dashboards, alertes
API
api.logpulse.io : REST + WebSocket
Ingestion de logs
OTLP HTTP + endpoints JSON génériques
Moteur de requêtes
LPQL sur ClickHouse Cloud
AI Investigator
Recherche en langage naturel + enquête
Objectifs d'ingénierie que nous nous fixons. Les SLA contractuels sont disponibles avec le plan Enterprise.
Uptime de la plateforme
99.9%
Cible glissante sur 30 jours
Latence de requête (P95)
< 200ms
Tier chaud, requêtes simples
Latence d'ingestion (P99)
< 500ms
De l'API jusqu'à interrogeable
RPO de sauvegarde
< 1h
Restauration à un point dans le temps
Ces objectifs reflètent les SLO publiés sur la page sécurité & conformité. Tous les détails sécurité
Nous visons des déploiements zero-downtime, mais devons parfois mettre en pause l'ingestion ou mettre ClickHouse hors-ligne pour des migrations. Quand c'est le cas :
Incidents confirmés, avec cause racine et chronologie de résolution.
L'historique des incidents se trouve sur la page de statut
Les incidents en cours et leur chronologie y sont publiés au moment où ils se produisent. Pour chaque incident ayant touché des utilisateurs, nous publions ici une analyse post-mortem.
Ouvrir le statut en directAbonne-toi aux mises à jour de statut et nous t'enverrons un e-mail dès qu'un composant passe en dégradé ou en panne, ainsi qu'avant chaque fenêtre de maintenance planifiée.