Suntem complet în jos pentru un subset de clienți. Investigăm problema şi ne retragem.
- investigating
În prezent investigăm această problemă.
- investigating
Continuăm să investigăm această problemă.
- investigating
Revenirea pare să fi rezolvat complet erorile. Monitorizăm îndeaproape, dar utilizatorii ar trebui să aibă acces la Asana din nou.
- monitoring
A fost implementată o soluţie şi monitorizăm rezultatele.
- resolved
Acest incident a fost rezolvat.
- postmortem
Incident: Un sistem intern responsabil pentru scalarea automată a capacității serverului backend într-una dintre clusterele noastre de calcul a încetat să mai înlocuiască capacitatea care a fost blocată în timpul întreținerii de rutină. Aceasta a determinat o reducere treptată a capacității disponibile pe parcursul a câteva ore. O implementare ulterioară a fost activată cu o capacitate insuficientă, ceea ce a dus la eșecul tuturor noilor cereri pentru acest grup de calcul. Pentru a atenua impactul, am revenit la o revizie anterioară de lansare, care încă mai avea suficientă capacitate. Impact: Timp de aproximativ 30 de minute, clienţii al căror trafic a fost gestionat de acest grup de calcul au văzut timp liber complet; alţi clienţi nu au fost afectaţi. Nu s-au pierdut date despre clienţi. Mergând mai departe: Am adăugat o monitorizare suplimentară pentru a detecta acest tip de eșec de scalare a capacităților mult mai devreme și am adăugat garanții pentru a preveni mutarea traficului înainte de confirmarea capacității suficiente de sănătate. Metoda noastră consideră o medie ponderată de uptime experimentată de utilizatori la fiecare centru de date. Numărul de minute de downtime indicate reflectă această medie ponderată.
Traducere automată din actualizarea oficială a incidentului.