Podwyższone wskaźniki błędów w raportowaniu błędów w USA API
- resolved
Między 19: 54 a 20: 07 UTC 15 sierpnia, prośby do naszego amerykańskiego raportowania błędów API (api.honedbadger.io) doświadczyły zwiększonego wskaźnika awarii. W tym oknie większość wniosków o złożenie błędów i zdarzeń została rozpatrzona w czasie lub otrzymała odpowiedzi 5xx. Przeglądarka (JavaScript) zgłaszania błędów, wysyłania map źródłowych, aplikacji internetowej Honeybadger, tablic rozdzielczych, monitorowania czasu pracy i naszego regionu UE nie zostały naruszone. Co się stało: Począwszy od 19: 54 UTC, pojedyncze źródło zaczęło składać raporty błędów z około 150 razy większą prędkością niż średnia. To ponad dwukrotnie więcej niż całkowita ilość danych przybywających do naszego poziomu spożycia, które nasycone w ciągu minuty. Ponieważ nasycona usługa akceptowała połączenia zamiast bezpośrednio zwracać błędy, nasze autoskalowanie i ostrzeganie - które obserwują odpowiedzi błędów - nie rejestruje problemu szybko, a pojemność została dodana później niż powinna. Usługa odzyskana o godzinie 20: 07 UTC po uruchomieniu dodatkowej przepustowości. Większość z nich została ponownie sprawdzona przez biblioteki naszych klientów po odzyskaniu API, więc znaczna większość danych przekazanych podczas okna została ostatecznie odebrana. Nie otrzymano raportów wysłanych przez biblioteki bez ponownego sprawdzenia logiki i nie można ich odzyskać. To, co zrobiliśmy: nasz poziom spożycia teraz skaluje się na opóźnieniu reakcji, oprócz poziomu błędów, więc ten rodzaj nasycenia jest wykrywany w ciągu minuty lub dwóch zamiast tylko raz pojawiają się błędy. Zwiększyliśmy również pojemność wyjściową poziomu i rozszerzyliśmy nasze alarmy wzywania, aby pokryć awarie, które nie pojawiają się jako błędy serwera. Dodatkowo dodajemy ograniczenia co do ilości danych, jakie może dostarczyć pojedyncze źródło. Przepraszamy za zakłócenia i za wszelkie luki w danych o błędach w oknie.
Automatyczne tłumaczenie oficjalnej aktualizacji incydentu.