Rate ridicate de eșec la API-ul american de raportare a erorilor
- resolved
Între 19:54 și 20:07 UTC pe 15 august cererile noastre de eroare de raportare API (api.honeybadger.io) a avut o rată de eșec ridicată. În timpul acestei ferestre, majoritatea cererilor de depunere a erorilor și evenimentelor au expirat sau au primit răspunsuri 5xx. Raportarea erorilor browser-ului (JavaScript), încărcarea hărților sursă, aplicația web Honeybadger, tabloul de bord, monitorizarea în timp util și regiunea UE nu au fost afectate. Ce s-a întâmplat: Începând de la 19:54 UTC, o singură sursă a început să transmită rapoarte de eroare de aproximativ 150 de ori mai mari decât media, cu sarcini utile de mai multe ori mai mari decât media. Acest lucru a dublat volumul total de date care sosesc la nivelul nostru de ingestie, care saturat într-un minut. Deoarece serviciul saturate a continuat să accepte conexiuni, mai degrabă decât să se întoarcă erori pur și simplu, nostru autoscalare și alertare Serviciul recuperat la 20:07 UTC odată ce capacitatea suplimentară a venit on-line. Cele mai multe rapoarte afectate au fost rejudecate cu succes de către bibliotecile noastre client după recuperarea API, astfel încât marea majoritate a datelor transmise în timpul ferestrei a fost în cele din urmă primită. Rapoartele trimise de biblioteci fără a rejudeca logica nu au fost primite și nu pot fi recuperate. Ceea ce am făcut: nivelul nostru de ingerare acum scale pe latență de răspuns în plus față de ratele de eroare, astfel încât acest tip de saturare este detectat într-un minut sau două, mai degrabă decât o singură dată apar erori. Am ridicat, de asemenea, capacitatea de bază a nivelului și a lărgit alertele noastre paging pentru a acoperi eșecuri care nu suprafață ca erori de server. În plus, adăugăm limite cu privire la cât de multe date poate transmite o singură sursă. Ne pare rău pentru întrerupere, și pentru orice lacune acest cauzat în datele de eroare în timpul ferestrei.
Traducere automată din actualizarea oficială a incidentului.