Augmentation des taux de défaillance sur l'API de déclaration d'erreurs aux États-Unis
- resolved
Entre 19:54 et 20:07 UTC le 15 août, les demandes à notre API américaine de déclaration d'erreurs (api.honeybadger.io) ont connu un taux d'échec élevé. Au cours de cette fenêtre, la majorité des demandes de soumission d'erreurs et d'événements ont été reportées ou ont reçu 5xx réponses. Les rapports d'erreurs du navigateur (JavaScript), les téléchargements de cartes sources, l'application web Honeybadger, les tableaux de bord, la surveillance des heures de pointe et notre région de l'UE n'ont pas été touchés. Ce qui s'est passé : À partir de 19h54 UTC, une source unique a commencé à soumettre des rapports d'erreurs à environ 150 fois son taux normal, avec des charges utiles plusieurs fois plus grandes que la moyenne. Cela a plus que doublé le volume total de données arrivant à notre niveau d'ingestion, qui a saturé en une minute. Comme le service saturé n'arrêtait pas d'accepter des connexions plutôt que de renvoyer des erreurs, notre auto-scalage et notre alerte — qui surveillent les réponses aux erreurs — n'ont pas enregistré le problème rapidement, et la capacité a été ajoutée plus tard qu'elle n'aurait dû l'être. Service récupéré à 20:07 UTC une fois la capacité supplémentaire est venu en ligne. La plupart des rapports touchés ont été récupérés avec succès par nos bibliothèques clientes une fois l'API récupérée, de sorte que la grande majorité des données soumises pendant la fenêtre a finalement été reçue. Les rapports envoyés par les bibliothèques sans logique de réessayer n'ont pas été reçus et ne peuvent pas être récupérés. Ce que nous avons fait : notre niveau d'ingestion augmente maintenant la latence de réponse en plus des taux d'erreur, donc ce type de saturation est détecté en une minute ou deux plutôt qu'une seule fois. Nous avons également augmenté la capacité de base du niveau et élargi nos alertes de téléappel pour couvrir les défaillances qui ne font pas surface en tant qu'erreurs de serveur. Nous ajoutons également des limites sur la quantité de données qu'une seule source peut soumettre. Nous sommes désolés pour la perturbation, et pour les lacunes que cela a causé dans vos données d'erreur pendant la fenêtre.
Traduit automatiquement depuis la mise à jour officielle de l'incident.