Query Degradat API Performance impact US Proiecte
- investigating
Mixpanel se confruntă cu o performanță de Query API degradată, rezultând răspunsuri HTTP 500 atunci când interogarea rapoartelor pentru proiecte cu RESidency de date SUA. Proiectele UE și IN Data Residency rămân neafectate. Apreciem răbdarea dumneavoastră în timp ce inginerii noștri lucrează pentru a restabili funcționalitatea normală. Vom posta actualizări de progres pe pagina noastră de stare. Dacă aveți întrebări, vă rugăm să contactați sprijinul.
- identified
Problema a fost identificată și se pune în aplicare o soluție.
- monitoring
Un fix a fost implementat, și vedem rate de succes îmbunătățite pentru API Query. Vom continua monitorizarea pentru a asigura stabilitatea.
- resolved
Acest incident a fost rezolvat.
- postmortem
Mixpanel RCA: Serviciul de interogare temporară disrupţie pentru proiectele SUA 26 august 2026 Sumarul Între aproximativ **2:02 PM și 3:19 PM PT pe 26 august 2026**, proiectele din regiunea SUA au experimentat rapoarte de încărcare a defecțiunilor și au rulat întrebări prin intermediul Mixpanel UI și Query API. În timpul acestei ferestre, unele întrebări din regiune au eșuat sau au returnat erori. **Nu s- au pierdut date despre clienţi, iar ingerarea datelor nu a fost afectată.** Toate evenimentele au continuat să fie colectate și stocate în mod normal de-a lungul incidentului; odată ce serviciul de interogare a fost restaurat, toate rapoartele au reflectat date complete și exacte, fără nicio acțiune a clientului necesară. Cauza a fost identificată ca un instrument intern recent implementat pentru reluarea interogării diagnostice, o capacitate pe care inginerii noștri o folosesc pentru a rerula copii ale interogărilor anterioare pentru a depana performanța, care a scris în mod neașteptat cantități mari de date pe discurile serverelor noastre de interogare, consumând capacitatea de stocare necesară pentru funcționarea serverelor. Când acele discuri s-au umplut, serverele afectate s-au scos din funcţiune. Serviciul a fost restaurat, serverele afectate au fost readuse online, iar sculele interne au fost dezactivate. Remedierile de mai jos adaugă garanții de stocare pentru a elimina capacitatea instrumentare internă de a consuma resurse pe servere de interogare, și sunt concepute pentru a preveni această clasă de eșec să se întâmple din nou în viitor. Ce s-a întâmplat Motorul de interogare Mixpanel rulează pe o flotă de servere care folosesc fiecare un set de volume de stocare locale pentru a stoca datele necesare pentru a răspunde rapid la întrebări. Separat, inginerii nostri folosesc replay-ul de interogare diagnostica, o capacitate pe care inginerii nostri o folosesc pentru a reproduce si depana performanta interogarii. În timp ce aplicaţi replay-ul de interogare diagnostică la o interogare mare, complexă, un bug software a cauzat replay-uri de interogare să se răspândească în întreaga flotă în loc de a rămâne limitată la un singur server. În plus, a cauzat mult mai multe date decât ar fi trebuit salvate fără evacuarea la timp pe un singur server. Doi factori au lărgit apoi impactul problemei: * Un singur volum complet de stocare a luat un server complet din serviciu. Fiecare server își tratează cache-ul ca nesănătos dacă unul dintre volumele sale de stocare depășește un prag de utilizare, chiar și atunci când toate celelalte volume sunt sănătoase. Datele de reluare au fost scrise la un volum specific pe fiecare server, astfel încât serverele din regiune nu și-au verificat sănătatea aproape simultan. * Limitele de curățare nu au reprezentat mărimea datelor. Siguranța care limitează reluarea datelor pe disk a numărat elemente la nivelul de aplicare mai degrabă decât octeți la nivelul sistemului de fișiere, astfel încât un număr mic de capturi neașteptat de mari au trecut verificarea în timp ce consumul de cea mai mare parte a capacității de volum. Împreună, acestea au permis un singur flux de lucru de depanare care, în mod normal, are o amprentă neglijabilă pentru a întrerupe interogarea producției care servește în întreaga regiune a SUA. Cronologie \ (Ora Pacificului, 26 august 2026\) * ** 2:00 PM** * **2:17 PM** * **2:39 PM** * **2:53 PM** * **3:19 PM** * **3:45 PM** Reluarea diagnosticului care a declanșat problema a fost complet dezactivată în aceeași seară. Cauza rădăcină 1. ** Un bug software în reluarea interogării noastre a cauzat scrieri nelegate la stocarea producției.** O capacitate recent utilizată pentru reproducerea interogărilor a manipulat greșit o anumită clasă de interogări complexe, ceea ce a dus la răspândirea capturilor către fiecare server de interogare din regiune și a scris mult mai multe date către volumele afectate decât proiectul presupus. 2. ** Redarea fișierelor consumate capacitatea discului care interogare de servire depinde de.** Replay-ul a scris fișierele sale pe discurile locale ale serverelor de interogare, astfel încât reluarea datelor fugite a epuizat capacitatea de stocare a serverelor necesare pentru a răspunde la întrebări. 3. ** Safeguards doar parțial a reprezentat pentru comportamentul.** Politica de curăţare a datelor de diagnosticare a limitat numărul de articole de pe disc, dar nu mărimea lor totală, aşa că nu s-a angajat. Alerta asupra volumului de stocare a marcat creșterea, dar nu a fost escaladată ca fiind critică pe bază de per-server, care a întârziat detectarea până când au început eșecurile de interogare. Ce schimbăm Starea finală pe care o construim către: interogarea interogării interne a diagnosticului redă datele stocate în stocarea obiectelor dedicate, punând nici o sarcină pe serverele de interogare a producției. Deja implementat: * **Disabled the intern tooling** that cause the incident, and remediated the countain issue so diagnostic captures are limited to a single server and the specific interogare class is manipulated just. * ** Întocmit procedura de recuperare ţintită** folosită în timpul incidentului, adică de compensare numai volumul de stocare afectate, mai degrabă decât repornirea grupuri de servere complete, în runbook-urile noastre operaţionale, scurtarea timpului de recuperare în cazul în care orice volum de capacitate se termină în viitor. În curs: * **Filesystem-nivel, dimensiuni-based limite on diagnostic replay data**, plafonarea octeților totale pe disc mai degrabă decât numărul de elemente, astfel încât capturi supradimensionate sunt respinse sau evacuate înainte ca acestea să poată afecta capacitatea de volum. * **Stricter de stocare alertare**, escaladarea saturarea volumului per-server ca critică înainte de a putea afecta interogarea controale de sănătate. * **Moving interogare replay data to dedicate object storage,** so it consums no resources on production interogare servers. Întrebări comune * ** A fost orice date pierdute? ** Nu. Ingestia de date nu a fost afectată pe tot parcursul incidentului: evenimentele au continuat să fie colectate, la coadă şi depozitate în mod normal. Doar capacitatea de a interoga a fost întreruptă. Odată ce serviciul a fost restabilit, toate rapoartele au reflectat date complete. * ** Au fost salvate rapoarte, borduri, sau setările de proiect afectate?** Nu. Incidentul a afectat doar executarea interogării. Nimic stocat în proiectul tău nu s-a schimbat. * ** De ce a afectat mai multe proiecte americane deodată?** Datele de diagnosticare supradimensionate replay scrise pe discurile fiecărui server de interogare în aproape același timp, și fiecare server se elimină din serviciu atunci când se umple un volum. Prevenirea instrumentelor interne de a consuma de stocare interogare-server este o parte centrală a activității noastre de remediere. Cum este prevenit acest lucru merge mai departe? Problema instrumentelor este rezolvată, iar instrumentele rămân dezactivate până când există limite bazate pe dimensiuni. Alerta de păstrare este în curs de înăsprire, astfel saturarea este prins înainte de a afecta serviciul de interogare. Structural, mutăm date de diagnosticare de pe serverele de interogare de producție în întregime, astfel încât datele de depanare interne nu vor consuma nicio stocare pe serverele responsabile pentru procesarea interogărilor. Ne cerem scuze pentru întrerupere și pentru rapoartele de timp nu au fost disponibile. Vă rugăm să contactați prin intermediul echipei de cont sau suport cu orice întrebări.
Traducere automată din actualizarea oficială a incidentului.