Έναρξη 2 Σεπτεμβρίου 2026 στις 4:24 μ.μ. UTC · 5h 35m
Pending
Επηρεαζόμενα στοιχεία
FedEx Web Services
monitoring
FedEx web services σήμερα βιώνουν υποβαθμισμένη απόδοση, και μερικοί πελάτες έχουν αναφέρει θέματα κράτησης FedEx αποστολές. Θα συνεχίσουμε να παρακολουθούμε την κατάσταση ενώ η FedEx εργάζεται για την επίλυση του ζητήματος.
Οι τρέχοντες χρόνοι απόκρισης FedEx είναι διαθέσιμοι εδώ: https://www.shippingapimonitor.com/history.html?api=fedex
resolved
Επιλύθηκε από την πλευρά της FedEx.
Αυτόματη μετάφραση από την επίσημη ενημέρωση του συμβάντος.
Επιβράδυνση WMS
Έναρξη 25 Αυγούστου 2026 στις 2:10 μ.μ. UTC · 3h 30m
Pending
Επηρεαζόμενα στοιχεία
WMS
investigating
Μερικοί πελάτες βιώνουν βραδύτητα με την πρόσβαση WMS. Η ομάδα μας ερευνά ενεργά το θέμα.
monitoring
Εφαρμόστηκε μια ρύθμιση και παρακολουθούμε τα αποτελέσματα.
resolved
Το περιστατικό λύθηκε. Θα μοιραστούμε περισσότερες λεπτομέρειες μόλις είναι διαθέσιμες.
postmortem
. . . Μετά-έκθεση συστατικού: WMS Αργότητα και λάθη για αποθήκες σε ένα Database Court - 25 Αυγούστου 2026
** Στάτους: ** Επίλυση
** Παράθυρο εισόδου: ** 25 Αυγούστου 2026, ~04:30 - 08:45 PDT \(07:30 - 11:45 ET\)
** Επηρεάστηκε: ** Πελάτες των οποίων οι βάσεις δεδομένων φιλοξενούνται σε μια WMS περίπτωση βάσης δεδομένων στην ομάδα μας US-East αποθήκη: χρόνοι φόρτωσης σελίδων έως 20x κανονική, και διαλείποντα σφάλματα στον σαρωτή και οθόνες admin κατά τη διάρκεια της χειρότερης περιόδου.
** Δεν έχει επηρεαστεί: ** Όλες οι άλλες περιπτώσεις της βάσης δεδομένων WMS και ομάδες αποθηκών, η πλατφόρμα TMS, ακεραιότητα δεδομένων \ (καμία συναλλαγή δεν χάθηκε, επαναλήφθηκε, ή μερικώς εφαρμόστηκε\), και όλες οι ολοκληρωμένες εργασίες - κάθε συναλλαγή που έγινε αποδεκτή επεξεργαστεί σωστά.
Σε επηρέασε;
Ο αντίκτυπος περιορίστηκε στους πελάτες των οποίων οι βάσεις δεδομένων WMS φιλοξενούνται σε μια συγκεκριμένη περίπτωση βάσης δεδομένων στην ομάδα αποθηκών ΗΠΑ-Ανατολής, και μόνο κατά τη διάρκεια του πρωινού της 25ης Αυγούστου (περίπου 04:30 - 08:45 PDT / 07:30 - 11:45 ET\).
Εάν δεν είδατε αργά φορτία σελίδας στο WMS κατά τη διάρκεια αυτού του παραθύρου, το περιβάλλον σας δεν ήταν εμπλέκονται. Όλες οι άλλες περιπτώσεις βάσεων δεδομένων WMS και ομάδες αποθηκών, καθώς και ολόκληρη η πλατφόρμα TMS, λειτουργούσαν κανονικά σε όλη.
Περίληψη
Το βράδυ της 24ης Αυγούστου, μια υπηρεσία ETL τρίτου μέρους που αντιγράφει τα δεδομένα ShipHawk στην αποθήκη δεδομένων μας επανεκκίνησε μια μεγάλη παρτίδα από τις εργασίες συγχρονισμού του ταυτόχρονα έναντι μιας από τις βάσεις δεδομένων παραγωγής μας. Κάθε επανεκκινημένη εργασία άρχισε να ξαναδιαβάζει ένα backlog ιστορικών δεδομένων αλλαγών με πλήρη ταχύτητα, παράλληλα και χωρίς κανένα περιορισμό. Ο όγκος ανάγνωσης σκαρφάλωσε περίπου πέντε φορές την αναμενόμενη κορυφή και κατανάλωνε το μεγαλύτερο μέρος του εύρους ζώνης δίσκων που ήταν διαθέσιμο σε αυτό το παράδειγμα της βάσης δεδομένων.
Αυτό άρχισε μέσα σε μια νύχτα, όταν η δραστηριότητα της αποθήκης είναι ελαφριά, έτσι δεν είχε καμία επίδραση στις λειτουργίες εκείνη την εποχή. Όταν οι πρωινές βάρδιες ΗΠΑ-Ανατολής ξεκίνησαν στις 25 Αυγούστου, η κανονική δραστηριότητα WMS προστέθηκε πάνω από το ήδη κορεσμένο κανάλι και το περιστατικό έφτασε στο όριο εύρους ζώνης του. Από την άποψη της εφαρμογής αυτό εμφανίστηκε ως αργή απάντηση βάσης δεδομένων: ερωτήματα που κανονικά επιστρέφουν σε χιλιοστά του δευτερολέπτου πήρε πολύ περισσότερο, εργασία ουρά πίσω τους, και σελίδες φορτώνονται αργά. Όταν μια απάντηση στη βάση δεδομένων υπερέβη το χρονικό όριο της εφαρμογής, η σελίδα επέστρεψε ένα σφάλμα αντί της φόρτωσης.
Η υπηρεσία παρέμεινε λειτουργική καθ' όλη τη διάρκεια της λειτουργίας της. Σε όλη την επηρεαζόμενη περίπτωση, οι πελάτες επεξεργάζονταν περίπου το 70% του όγκου που κανονικά χειρίζονταν σε αυτό το παράθυρο \(διαλέγουν, συσκευάζουν και κινήσεις απογραφής\), αν και η εμπειρία ήταν αργή και μερικές φορές δύσκολη, και ο βαθμός των επιπτώσεων ποικίλει μεταξύ των πελατών.
Η κατάσταση επιλύεται με την ανάκληση των διαπιστευτηρίων της βάσης δεδομένων υπηρεσιών ETL εξ ολοκλήρου στις 08:37 PDT. Η βάση δεδομένων ανακτήθηκε μέσα σε οκτώ λεπτά. Καθυστερημένη εργασία ξεπλύνετε μέσα στις επόμενες δύο ώρες, και όλες οι πληγείσες αποθήκες ήταν πίσω στο κανονικό ρυθμό.
Δεν απαιτείται ή δεν απαιτείται καμία δράση του πελάτη και δεν επηρεάστηκαν δεδομένα. Καμία συναλλαγή δεν χάθηκε, αντιγράφτηκε, ή εν μέρει εφαρμόστηκε - το επαληθεύσαμε αυτό σε αρχεία καταγραφής ενσωμάτωσης που καλύπτουν το πλήρες παράθυρο συμβάντων. Έργο που υποβλήθηκε είτε ολοκληρώθηκε σωστά είτε απέτυχε καθαρά πριν κάνει οποιαδήποτε αλλαγή. Αυτό καλύπτεται με περισσότερες λεπτομέρειες παρακάτω.
Αυτό που επηρεάστηκε
Ο αντίκτυπος περιοριζόταν στους πελάτες των οποίων οι βάσεις δεδομένων φιλοξενούνται στην πληγείσα περίπτωση βάσης δεδομένων WMS στην ομάδα αποθηκών ΗΠΑ-Ανατολής.
Σε όλο το παράθυρο του συμβάντος το σύστημα ήταν αργό σε όλο τον πίνακα - σαρωτή και admin σελίδες που κανονικά φορτώνουν σε καλά κάτω από ένα δευτερόλεπτο πήρε πολλές φορές περισσότερο - και όπου μια απάντηση της βάσης δεδομένων ξεπέρασε το χρονικό όριο της εφαρμογής, η σελίδα επέστρεψε ένα σφάλμα και όχι φόρτωση.
Πώς έμοιαζε αυτό στην πράξη:
**Warehouse πάτωμα: ** σελίδες σαρωτή \ (διάλεξη, κίνηση, προσαρμογή απογραφή\) φορτώθηκε πολύ αργά? ένας εργαζόμενος που ξαναδοκίμασε ενώ μια σελίδα είχε κολλήσει θα μπορούσε να λάβει μια σελίδα λάθους και πρέπει να πάει πίσω και να επαναλάβει την ενέργεια.
** Τα λάθη ήταν συγκεντρωμένα σε μια μόνο έκρηξη αντί να εξαπλωθούν σε όλο το περιστατικό. ** Οι περισσότεροι από αυτούς έπεσαν μέσα σε ένα παράθυρο 15 λεπτών στην κορυφή της συμφόρησης \(06:15 - 06:30 PDT\). Μετρώντας σελίδες επιβεβαιωμένων σφαλμάτων στο web-server μας και αρχεία καταγραφής εφαρμογών, η πιο επηρεασμένη αποθήκη είδε 71 σε αυτό το παράθυρο.
**Το σύστημα παρέμεινε σε όλη την. ** Κάθε υποβαλλόμενη συναλλαγή είτε ολοκληρώθηκε σωστά είτε απέτυχε καθαρά πριν από οποιαδήποτε αλλαγή. Κατά τη διάρκεια του βαθύτερου παραθύρου επιβράδυνσης μπορούμε να δείξουμε εκατοντάδες συναλλαγές ολοκληρώνοντας με επιτυχία για τους χρήστες που συνέχισαν να εργάζονται.
Αυτό που δεν επηρεάστηκε
** ακεραιότητα δεδομένων. ** Τα σφάλματα συνέβησαν κατά την έναρξη της επεξεργασίας αίτησης, πριν γίνει οποιαδήποτε αλλαγή. Καμία συναλλαγή δεν χάθηκε, αντιγράφτηκε ή εφαρμόστηκε μερικώς. Κάθε εκπλήρωση, κίνηση απογραφής, και αποστολή απόσπαση που ολοκληρώθηκε το έκανε σωστά - επαληθεύσαμε τα αρχεία καταγραφής ενσωμάτωσης για το παράθυρο περιστατικό.
**Η εντολή και η αποστολή συγχρονισμού σε ERPs και αγορές ** ολοκληρώθηκε σωστά σε όλη; δημοσιεύσεις που τέθηκαν σε αναμονή κατά τη διάρκεια της επιβράδυνσης παραδόθηκαν στο πλήρες κατά τη διάρκεια της catch-up \ (επιβεβαιώθηκε στα αρχεία καταγραφής ενσωμάτωση - δεν απέτυχε δημοσιεύσεις\).
** Όλα τα άλλα περιβάλλοντα. ** Αποθήκες σε άλλες περιπτώσεις της βάσης δεδομένων μας, και ολόκληρη η πλατφόρμα TMS, λειτουργούσαν κανονικά.
**Ασφάλεια και διάρκεια** Κανένα όριο ασφαλείας δεν είχε εμπλακεί σε κανένα σημείο. Η εν λόγω υπηρεσία τρίτου μέρους είναι ένας πωλητής ενσωμάτωσης δεδομένων που λειτουργεί με διαπιστευτήρια που εκδώσαμε· το θέμα ήταν ο όγκος των αναγνώσεών της, όχι οποιαδήποτε μη εξουσιοδοτημένη πρόσβαση.
Χρόνος \ (όλες τις φορές PDT; προσθέστε 3 ώρες για ET\)
Κάθε ένα αρχίζει να ξαναδιαβάζει τα ιστορικά δεδομένα αλλαγών με πλήρη ταχύτητα.
Διανυκτερεύουσα κίνηση αποθήκη είναι φως, έτσι δεν υπάρχει καμία πελάτη-ορατό αποτέλεσμα ακόμα.
25 Αυγ, ~04:30 Η συνδυασμένη ζήτηση υπερβαίνει την επιτρεπόμενη ταχύτητα του δικτύου.
Η έρευνα αρχίζει.
07:00
07:20 - 08:30 Κατά τη διάρκεια αυτής της περιόδου ξεκινά επιπλέον θέσεις εργασίας.
Η απήχηση του πελάτη τελειώνει.
Γιατί το ψήφισμα πήρε 3 ώρες από τις πρώτες αναφορές
Τρεις παράγοντες επέκτειναν το χρονοδιάγραμμα. Πρώτον, η σκανδάλη συνέβη επτά ώρες πριν από τα συμπτώματα. Το re-read της υπηρεσίας ETL λειτούργησε μέσα σε μια νύχτα και είχε ήδη καταναλώσει το διαθέσιμο εύρος ζώνης, αλλά με το φως της δραστηριότητας της αποθήκης εκείνη την ώρα ο περιορισμός παρήγαγε μόνο μια μικρή αλλαγή στους χρόνους απόκρισης του συστήματος - κάτω από τα όρια συναγερμού μας - έτσι πήγε απαρατήρητο. Η αυτοματοποιημένη παρακολούθησή μας ειδοποιήθηκε μόλις η δραστηριότητα της αποθήκης ξεκίνησε το πρωί, αλλά μέχρι τότε η υποκείμενη αλλαγή ήταν επτά ωρών και δεν υπήρχε πρόσφατη ανάπτυξη ή αλλαγή διαμόρφωσης σε σημείο. Δεύτερον, οι αναγνώσεις αντιγραφής της υπηρεσίας ETL είναι αόρατες στις τυποποιημένες καταχωρήσεις ερωτημάτων της βάσης δεδομένων - χρησιμοποιούν ένα πρωτόκολλο αντιγραφής και όχι ερωτήματα - οπότε αναγνωρίζοντάς τες ως τον καταναλωτή που απαιτείται συσχετίζοντας δίσκο, δίκτυο, και στοιχεία επιπέδου σύνδεσης. Τρίτον, η υπηρεσία ETL είναι κατασκευασμένη για να επιβιώνει από τις διακοπές: παύση των εργασιών της και τερματισμός των συνδέσεων της τόσο απέτυχε ως μετριασμούς, επειδή επανασυνδέεται αυτόματα μέσα σε δευτερόλεπτα, και επανεκκίνησε επιπλέον θέσεις εργασίας ενώ εμείς σταματούσαμε άλλους. Μόνο η ανάκληση των διαπιστευτηρίων του το σταμάτησε.
Αυτό που αλλάζουμε
**Γυρίζοντας τα όρια προειδοποίησης χρόνου απόκρισης WMS. ** Η κατάσταση πίσω από αυτό το περιστατικό ήταν παρούσα για επτά ώρες μέσα σε μια νύχτα, αλλά με ελαφρύ φορτίο κινήθηκε χρόνους απόκρισης πολύ λίγο για να διασχίσει τα όρια συναγερμού μας - έτσι η πρώτη ειδοποίηση ήρθε μόνο μόλις δραστηριότητα αποθήκης και οι πελάτες είχαν ήδη επηρεαστεί. Συντονίζουμε αυτά τα κατώφλια για να είμαστε ευαίσθητοι σε μικρότερες βάρδιες στο χρόνο απόκρισης WMS, συμπεριλαμβανομένου του χαμηλού φορτίου, έτσι ώστε γεγονότα όπως αυτό να πιαστούν και να ενεργήσουν πριν φτάσουν στους πελάτες. Αυτό περιλαμβάνει ειδοποίηση σχετικά με τους συγκεκριμένους κύριους δείκτες αυτού του περιστατικού - την κατανάλωση εύρους ζώνης δίσκων και το βάθος ουράς δίσκων.
**Η βάση δεδομένων έχει μεταναστεύσει σε έναν τύπο περίπτωση με σημαντικά περισσότερο εύρος ζώνης δίσκων **, δίνοντας σημαντική αίθουσα πάνω από την αιχμή ζήτηση για την απορρόφηση αιχμές αυτού του είδους.
** Συνεχίζουμε την έρευνά μας με τον πωλητή ETL.** Έχουμε μια ανοιχτή υπόθεση με αυτούς που αναζητούν μια εξήγηση για την ταυτόχρονη επανεκκίνηση της εργασίας, και απαιτούν περιορισμό των τιμών και τα ανώτατα όρια σύγκλισης για επαναδιαβάσεις έναντι των πηγών των πελατών. Αυτή η δουλειά συνεχίζεται.
Αυτόματη μετάφραση από την επίσημη ενημέρωση του συμβάντος.
Σφάλματα TMS WebPortal που επηρεάζουν ορισμένους πελάτες
Έναρξη 20 Αυγούστου 2026 στις 2:06 μ.μ. UTC · 4h 0m
OutageΣοβαρό περιστατικό
Επηρεαζόμενα στοιχεία
TMS
investigating
Λάβαμε αναφορές ότι το TMS WebPortal επιστρέφει λάθη ή δεν φορτώνει για κάποιους πελάτες. Ερευνούμε ενεργά το θέμα και θα παρέχουμε ενημερώσεις καθώς θα γίνονται διαθέσιμες περισσότερες πληροφορίες.
identified
Το θέμα έχει εντοπιστεί και υλοποιείται μια λύση.
monitoring
Εφαρμόστηκε μια ρύθμιση και παρακολουθούμε τα αποτελέσματα.
resolved
Το περιστατικό λύθηκε.
postmortem
# Post-Incident Report: Αυξημένα σφάλματα API και σύνδεσης - 20 Αυγούστου 2026
** Στάτους: ** Επίλυση
**Παράθυρο εισόδου: ** 20 Αυγούστου 2026, 06:31 - 08:11 PDT \ (13:31 - 15:11 UTC\)
** Επηρεασμένο: ** ShipHawk API και αιτήματα ταμπλό σε κοινόχρηστα περιβάλλοντα παραγωγής, συν την υπηρεσία σύνδεσης. Ο αντίκτυπος ήταν μερικός και όχι πλήρης διακοπή: περίπου το 25% της συνολικής κίνησης API στο [shiphawk.com] (http://shiphawk.com) απέτυχε κατά τη διάρκεια του θιγόμενου παραθύρου του.
**Δεν επηρεάζεται: ** In-Cart rating \ (και όλα /api/v4/rates αιτήματα\), επεξεργασία φόντου \ (όλες οι προγραμματισμένες εργασίες, γράψτε backs, webhooks, async label generation, tracking and carrier communications τρέχει κανονικά\), ακεραιότητα δεδομένων.
Περίληψη
Το πρωί της 20ης Αυγούστου, μια κρίσιμη ενημέρωση για την ασφάλεια του λειτουργικού συστήματος που δημοσιεύθηκε από το Ubuntu - και εφαρμόστηκε αυτόματα από την τυπική διαδικασία patching μας - περιείχε ένα ελάττωμα στο συστατικό web server \(nginx\) που βρίσκεται μπροστά από την εφαρμογή ShipHawk. Το πακέτο που επηρεάστηκε δημοσιεύθηκε στις 19 Αυγούστου ως [USN-8563-3](https://ubuntu.com/security/notices/USN-8563-3). Το Ubuntu επιβεβαίωσε ότι η ενημέρωση αυτή εισήγαγε μια παλινδρόμηση και δημοσίευσε [USN-8563-4](https://ubuntu.com/security/notices/USN-8563-4) την ίδια ημέρα, επαναφέροντας την προβληματική αλλαγή εν αναμονή περαιτέρω έρευνας.
Ενώ η ελαττωματική έκδοση έτρεχε, το στρώμα μεσολάβησης διέφθειρε το URL πολλών εισερχόμενων αιτημάτων πριν τα παραδώσει στην εφαρμογή. Η εφαρμογή δεν μπόρεσε να ταιριάξει τα αλλοιωμένα URL με κάποιο γνωστό τελικό σημείο και απάντησε **404 Not Found**. Οι αποτυχίες ήταν άμεσες, καθαρές απορρίψεις: καμία αίτηση δεν υποβλήθηκε σε μερική επεξεργασία, δρομολογήθηκε σε λάθος λογαριασμό, ή χάθηκε μετά την αποδοχή.
Οι διακομιστές μας δεν κατεβάζουν και δεν εγκαθιστούν όλες τις ενημερώσεις ασφαλείας του λειτουργικού συστήματος ταυτόχρονα. Ως αποτέλεσμα, ορισμένοι servers κατέβασαν το ελαττωματικό nginx build πριν το Ubuntu δημοσιεύσει το διορθωμένο πακέτο, ενώ άλλοι έλεγξαν αργότερα και κατέβασαν απευθείας το διορθωμένο build. Μόνο οι servers που είχαν ήδη κατεβάσει το ελαττωματικό πακέτο επηρεάστηκαν όταν η προγραμματισμένη εγκατάστασή τους έτρεξε. Αυτός είναι ο λόγος για τον οποίο το ζήτημα εμφανίστηκε διακοπτόμενο: κατά τα άλλα ταυτόσημες αιτήσεις θα μπορούσαν να αποτύχουν ή να επιτύχουν ανάλογα με το ποιος διακομιστής τις χειρίστηκε.
Ακόμα και σε servers που τρέχουν το ελαττωματικό πακέτο nginx, μόνο ένα υποσύνολο των αιτήσεων απέτυχε. Η παλινδρόμηση επηρέασε συγκεκριμένους κανόνες δρομολόγησης nginx και όχι ολόκληρη τη διαμόρφωση διαμεσολαβητή, τόσα πολλά πρότυπα URL συνέχισαν να λειτουργούν κανονικά σε έναν επηρεασμένο εξυπηρετητή.
Το περιστατικό λύθηκε πλήρως μέχρι τις 08:11 PDT μετά από κάθε επηρεασμένο διακομιστή αναβαθμίστηκε στο διορθωμένο πακέτο και επαληθεύτηκε υγιής. Καμία ενέργεια πελατών δεν ήταν ή απαιτείται.
Αυτό που επηρεάστηκε . . . .
Οι αριθμοί παρακάτω μετρούν ** μόνο αποτυχίες που προκαλούνται από αυτό το περιστατικό **. Συνηθισμένες 404 απαντήσεις \ (αναζητήσεις αρχείων που πραγματικά δεν υπάρχουν, άκυρες διευθύνσεις URL, κυκλοφορία bot\) αναγνωρίστηκαν με την διακριτή υπογραφή απόκρισης τους και αποκλείστηκαν.
Πώς έμοιαζε αυτό στην πράξη:
* **API ενσωμάτωση ** έλαβε HTTP 404 απαντήσεις για έγκυρες αιτήσεις. Επειδή οι αποτυχίες ήταν άμεσες και ανιθαγενείς, οι οπισθοδρομίες των πελατών μπορούσαν να επιτύχουν όταν προσγειώθηκαν σε έναν ανεπηρέαστο διακομιστή.
* **Πίνακας και σύνδεση ** σελίδες απέτυχε να φορτώσει ή να υπογράψει σε διαλείμματα.
* Αποτυχίες εξαρτώνται από την ακριβή διεύθυνση URL: ορισμένοι τύποι αιτήσεων πέρασαν μέσα από ανεπηρέαστο ακόμη και από ελαττωματικούς διακομιστές, προσθέτοντας στη διαλείπουσα εμφάνιση.
Τι δεν επηρεάστηκε
* * * * * Στο καρτ αιτήματα αξιολόγησης. ** Όλα τα αιτήματα αξιολόγησης από την διαδικτυακή πύλη, τις πλατφόρμες ηλεκτρονικού εμπορίου, τις πλατφόρμες ERP και τα τακτικά αιτήματα API για `/api/v4/rates` λειτουργούσαν ως συνήθως.
* * * * Υποδομές θέσεις εργασίας δεν επηρεάστηκαν καθόλου. ** Όλες οι ασύγχρονες εργασίες επεξεργασίας - προγραμματισμένες εργασίες, γράψτε πίσω, συγχρονισμός απογραφής, παραδόσεις webhook, παραγωγή εγγράφων και ετικέτας, μεταφορές και επικοινωνίες ERP - τρέχει πίσω από το στρώμα μεσολάβησης και συνεχίζεται κανονικά σε όλη τη διάρκεια του συμβάντος. Καμία εργασία σε ουρά δεν χάθηκε ή καθυστέρησε.
* * ** ακεραιότητα δεδομένων. ** Κανένα στοιχείο δεν χάθηκε, αλλοιώθηκε ή αλλοιώθηκε. Οι αιτήσεις είτε ολοκληρώθηκαν κανονικά είτε απορρίφθηκαν οριστικά.
* ** Ασφάλεια και διάρκεια ** Κανένα αίτημα δεν δρομολογήθηκε σε άλλο λογαριασμό και κανένα όριο ασφαλείας δεν διασχίστηκε. Η διαφθορά συνέβη μετά την εφαρμογή όλων των ελέγχων πρόσβασης. Η υποκείμενη ενημέρωση του Ubuntu ήταν ένα προστατευτικό κάλυμμα ασφαλείας· η ευπάθεια που αντιμετώπισε δεν αξιοποιήθηκε στα συστήματά μας.
Χρονολόγιο \(πάντα PDT, 20 Αυγούστου 2026\)
* **Aug 19 \(ημέρα\) ** - Ubuntu δημοσιεύει μια ενημέρωση της ασφάλειας για nginx; ένα ελάττωμα αναφέρεται, και Ubuntu δημοσιεύει ένα διορθωμένο πακέτο την ίδια ημέρα. Η διορθωμένη έκδοση διαδίδεται σε δημόσιους καθρέφτες ενημέρωσης σε μια νύχτα.
* **Aug 19, 18:24 - 23:09** - Οι νυχτερινοί έλεγχοι ενημέρωσης για τους μεταγενέστερους συνδεδεμένους διακομιστές κατεβάζουν την ενημέρωση Nginx της ημέρας. Σε αυτές τις στιγμές, η ελαττωματική κατασκευή είναι ακόμα το νεότερο διαθέσιμο στους καθρέφτες. Αυτό το βήμα κατεβάζει μόνο το πακέτο? εγκατάσταση συμβαίνει κατά τη διάρκεια του παραθύρου patch του επόμενου πρωινού.
* **Aug 20, 04:12 - 05:05** - Μια άλλη ομάδα servers τρέχει νυχτερινό έλεγχο αναπροσαρμογών μετά τη διόρθωση κατασκευής έχει φτάσει στους καθρέφτες. Αυτοί οι διακομιστές κατεβάζουν τη σταθερή έκδοση και παραμένουν υγιείς καθ' όλη τη διάρκεια του περιστατικού.
* **~06:00 ** - Μια ρουτίνα, μη σχετική ενημέρωση ρυθμίσεων εφαρμογών εφαρμόζεται για επερχόμενες κυκλοφορίες. Δεν έχει καμία επίδραση στην τρέχουσα απελευθερωμένη λειτουργικότητα και ** δεν παίζει ρόλο στο περιστατικό **, αλλά επειδή είναι η μόνη γνωστή αλλαγή εκείνο το πρωί, γίνεται ο πρώτος ύποπτος μόλις εμφανιστούν λάθη.
* **06:00** - Το νυχτερινό παράθυρο αυτόματης patching αρχίζει κυλώντας nginx ενημερώσεις σε όλα τα περιβάλλοντα. Μερικοί διακομιστές έχουν ήδη κατεβάσει το διορθωμένο πακέτο, ενώ άλλοι έχουν το ελαττωματικό πακέτο.
* * **06:31 - 06:34 - INCIDENT START. ** Καθώς το τροχαίο αυτοματοποιημένο παράθυρο patch προχωρά, το προηγουμένως κατεβασμένο ελαττωματικό πακέτο nginx εγκαθίσταται σε πολλαπλούς διακομιστές ιστού και σύνδεσης σε κοινόχρηστα περιβάλλοντα παραγωγής. Επειδή τα προγράμματα patch είναι συγκλονιστικά, δεν ενημερώνονται όλοι οι servers ταυτόχρονα, και μερικοί servers παραμένουν υγιείς. Οι πρώτες αποτυχημένες αιτήσεις πελατών ξεκινούν στις **06:31**.
* **06:35** - Αυτοματοποιημένες εξωτερικές ειδοποιήσεις παρακολούθησης για αυξημένα σφάλματα. ** Η έρευνα αρχίζει αμέσως. **
* **06:36 - 07:15** - Οι μηχανικοί πρώτα διερευνούν την ενημέρωση διαμόρφωσης ~06:00, η μόνη γνωστή αλλαγή επιπέδου εφαρμογής με στενά ταιριαστό συγχρονισμό. Αποκλείεται, και η προσοχή στρέφεται στο στρώμα ιστού/προσέγγισης.
* **06:52** - Το παράθυρο κύλισης patch συνεχίζεται και το ελαττωματικό πακέτο ενεργοποιείται σε επιπλέον servers. Ο αντίκτυπος αυξάνεται καθώς οι πιο επηρεασμένοι διακομιστές επανεκκινούν στην ελαττωματική έκδοση nginx, ενώ οι διακομιστές που κατέβασαν το διορθωμένο πακέτο του Ubuntu παραμένουν υγιείς.
* **06:55** - Ένα υπόλοιπο web server ενημερώσεις χρησιμοποιώντας το διορθωμένο πακέτο Ubuntu του και παραμένει υγιής σε όλη, συνεχίζοντας να εξυπηρετούν το μερίδιό του στην κυκλοφορία σωστά.
* **07:18 - 07:19** - Οι συνδεδεμένοι διακομιστές ιστού επανεκκινούνται ως προσπάθεια μετριασμού. Αυτό δεν έχει καμία επίδραση επειδή το ελαττωματικό πακέτο nginx παραμένει εγκατεστημένο.
* **07:20 - 07:55 ** - Ύποπτοι servers αφαιρούνται από την περιστροφή φορτίων-ισορροπητή. Τα συμπτώματα επιμένουν επειδή η υπηρεσία σύνδεσης και τα περιβάλλοντα εφαρμογής επηρεάζονται ανεξάρτητα, γεγονός που διευρύνει υλικά την αναζήτηση.
* **07:41** - Το πρότυπο URL-διαφθορά αναγνωρίζεται σε αρχεία καταγραφής εφαρμογών.
* **07:45 - 08:00** - Η δοκιμή ανά υπηρέτη απομονώνει τους ελαττωματικούς διακομιστές. Η μόνη διαφορά από υγιείς διακομιστές είναι η έκδοση πακέτων nginx. Η ελαττωματική κατασκευή ταιριάζει με τη δημοσιευμένη ειδοποίηση παλινδρόμησης του Ubuntu και διορθωμένο πακέτο.
* **08:02 - 08:11** - Το διορθωμένο πακέτο είναι εγκατεστημένο σε όλους τους διακομιστές που επηρεάζονται. Τα ποσοστά σφάλματος επιστρέφουν στο κανονικό αμέσως σε κάθε διακομιστή καθώς επανεκκινεί στη σταθερή έκδοση. Το τελικό περιβάλλον που επηρεάζεται επανέρχεται στο φυσιολογικό στα **08:11 - INCIDENT FULLY RESOLVED **.
* **08:11\+** - Ολοκληρώνεται η πλήρης επαλήθευση: κάθε διακομιστής ελέγχεται ξεχωριστά, και API, ταμπλό, σύνδεση, και περιβάλλοντα παραγωγής επιβεβαιώνονται υγιή.
. . . Γιατί η επίλυση πήρε ~95 λεπτά από την επιφυλακή
Η ανίχνευση ήταν γρήγορη, αλλά τρεις παράγοντες επιβραδύνουν τη διάγνωση. Πρώτον, μια αλλαγή διαμόρφωσης ρουτίνας νωρίτερα εκείνο το πρωί ήταν η μόνη γνωστή αλλαγή στο περιβάλλον και έπρεπε να αποκλειστεί - αυτόματη επιδιόρθωση OS δεν εμφανίζεται σε κανένα αρχείο καταγραφής αλλαγών σε επίπεδο εφαρμογής. Δεύτερον, η αποτυχία ήταν διαλείπουσα από τη φύση: ανεπηρέαστοι διακομιστές συνέχισαν να εξυπηρετούν κανονικά, και ακόμα και επηρεασμένοι διακομιστές χειρίστηκαν επιτυχώς τύπους αιτήσεων των οποίων οι κανόνες δρομολόγησης δεν επηρεάστηκαν. Τρίτον, η αφαίρεση των υπόπτων διακομιστών από την περιστροφή δεν εμπόδισε τα λάθη -επειδή και άλλες βαθμίδες επηρεάστηκαν ανεξάρτητα- κάτι που αρχικά έστρεψε την έρευνα μακριά από αυτούς τους διακομιστές.
Τι αλλάζουμε
**1. Επιθέματα ασφάλειας λειτουργικών συστημάτων πριν από την παραγωγή. ** Αυτοματοποιημένες ενημερώσεις ασφαλείας OS- και nginx-επίπεδο, συμπεριλαμβανομένων κρίσιμων patches, θα εγκατασταθούν πρώτα σε διακομιστές μη παραγωγής. Αυτοματοποιημένη επικύρωση επιπέδου εφαρμογής θα ασκήσει αντιπροσωπευτικό API, ταμπλό, και διαδρομές σύνδεσης ενάντια στους ενημερωμένους διακομιστές πριν από τις ίδιες εκδόσεις πακέτου επιτρέπεται να κυλήσει στην παραγωγή. Η παραγωγή rollout θα ξεκινήσει μόνο μετά από αυτές τις εξετάσεις περάσει.
**2. Ταχύτερη διάγνωση σε επίπεδο έκδοσης. ** Τα περιστατικά μας runbooks περιλαμβάνουν τώρα άμεση σύγκριση των εκδόσεων πακέτων και επανεκκινήστε το ιστορικό σε διακομιστές όποτε οι πανομοιότυπα διαμορφωμένοι διακομιστές συμπεριφέρονται διαφορετικά.
Αυτόματη μετάφραση από την επίσημη ενημέρωση του συμβάντος.
FedEx API degraded performance
Έναρξη 26 Ιουνίου 2026 στις 3:47 μ.μ. UTC · 5h 2m
IssuesΜικρό περιστατικό
Επηρεαζόμενα στοιχεία
FedEx Web Services
monitoring
We are seeing a degraded performance with FedEx API, some customers reported issues with booking FedEx shipments. We are actively monitoring the situation and will provide updates as soon as more information becomes available or the issue is resolved.
resolved
Resolved by FedEx
Partial USPS Endicia Web Services outage
Έναρξη 19 Ιουνίου 2026 στις 3:38 μ.μ. UTC · 10h 39m
IssuesΜικρό περιστατικό
Επηρεαζόμενα στοιχεία
USPS via Endicia
monitoring
We are seeing a degraded performance with USPS Endicia web services. We will continue to monitor as USPS Endicia works to resolve this.
https://status.endicia.com
resolved
This incident has been resolved.
Degraded performance with PrintNode
Έναρξη 18 Μαΐου 2026 στις 6:21 μ.μ. UTC · 3h 21m
Pending
identified
PrintNode is currently experiencing issues. Some regions may be experiencing degraded performance when attempting to print.
See https://www.printnode.com/en/status for details.
resolved
Resolved by PrintNode.
FedEx Web Services degraded performance
Έναρξη 23 Φεβρουαρίου 2026 στις 8:12 μ.μ. UTC · 1d 2h
IssuesΜικρό περιστατικό
Επηρεαζόμενα στοιχεία
FedEx Web Services
identified
We are seeing a degraded performance with FedEx web services, some customers reported issues with booking shipments. FedEx has acknowledged an issue on their end. We are actively monitoring the situation and will provide updates as soon as more information becomes available or the issue is resolved.
resolved
Resolved by FedEx.
Major AWS service outage
Έναρξη 20 Οκτωβρίου 2025 στις 8:37 μ.μ. UTC · 2h 51m
Pending
investigating
Amazon Web Services had a major outage today that effected a large number software services across the internet, including ShipHawk. While ShipHawk's software did not go down, the outage has led to intermittent reliability for many parcel and LTL carriers regarding rating and label generation. We are working with AWS to resolve these issues as soon as possible.
https://health.aws.amazon.com/health/status
monitoring
Amazon Web Services had a major outage today that effected a large number software services across the internet, including ShipHawk. While ShipHawk's software did not go down, the outage has intermittently affected some carriers regarding rating and label generation. Everything is working currently and we are working with AWS to ensure system responsiveness.
https://health.aws.amazon.com/health/status
resolved
The AWS issue affecting carriers has been resolved.
Partial USPS Endicia Web Services outage
Έναρξη 10 Οκτωβρίου 2025 στις 5:51 μ.μ. UTC · 27m
Pending
Επηρεαζόμενα στοιχεία
USPS via Endicia
investigating
We are seeing a degraded performance with USPS Endicia web services. We will continue to monitor as USPS Endicia works to resolve this.
https://status.endicia.com
resolved
Resolved by USPS Endicia
WWEX / SpeedShip services outage
Έναρξη 29 Σεπτεμβρίου 2025 στις 6:05 μ.μ. UTC · 4h 35m
Pending
identified
Customers using WWEX / SpeedShip integrations may experience issues with rating and booking shipments due to an outage of the WWEX / SpeedShip API. The provider has notified us that they are actively working on a resolution. We will continue monitoring and provide updates as they become available.
resolved
Confirmed as resolved by WWEX.
Degraded performance with PrintNode
Έναρξη 20 Ιουνίου 2025 στις 1:30 μ.μ. UTC · 14h 37m
IssuesΜικρό περιστατικό
Επηρεαζόμενα στοιχεία
WMSTMS
identified
PrintNode is currently experiencing connectivity issues. Some regions may be experiencing degraded performance when attempting to print.
See https://www.printnode.com/en/status for details.
identified
Connectivity was restored to normal approximately 7 minutes ago; we are monitoring the situation and will post further information if and when it becomes available.
monitoring
A fix has been implemented and we are monitoring the results.
Pitney Bowes has notified us they are experiencing technical issues with PB Expedited Delivery Services. Customers who use Pitney Bowes may experience slowness or unavailability of Pitney Bowes shipping rates or printing labels. We will continue to monitor their progress as they resolve this issue.
For additional information use Pitney Bowes status page - https://status.pitneybowes.com
resolved
This incident has been resolved.
Partial WMS Access Issue – Investigation Underway
Έναρξη 14 Απριλίου 2025 στις 8:24 μ.μ. UTC · 24m
IssuesΜικρό περιστατικό
Επηρεαζόμενα στοιχεία
WMSWMS APIs
investigating
We are currently investigating an issue affecting one of our WMS environments. A subset of customers may be unable to access the system. Our team is actively working to identify the root cause and restore full access as soon as possible.
We will continue to provide updates as we make progress. Thank you for your understanding and patience.
monitoring
The affected WMS environment is now back online, and system access has been restored for impacted customers. We are currently monitoring the environment to ensure stability.
resolved
This incident has been resolved.
Rating API slowness
Έναρξη 11 Μαρτίου 2025 στις 11:52 π.μ. UTC · 10h 41m
Pending
Επηρεαζόμενα στοιχεία
Shipping APIssh-default
investigating
Some customers are experiencing slowness with the rating API. Our team is actively investigating the issue. We will provide updates as we learn more.
monitoring
The issue causing slowness in the rating API has been identified and resolved.
Έναρξη 30 Ιανουαρίου 2025 στις 1:42 μ.μ. UTC · 2h 17m
IssuesΜικρό περιστατικό
Επηρεαζόμενα στοιχεία
USPS via Pitney Bowes
identified
Pitney Bowes has notified us they are experiencing technical issues with PB Expedited Delivery Services. Customers who use Pitney Bowes may experience slowness or unavailability of Pitney Bowes shipping rates or printing labels. We will continue to monitor their progress as they resolve this issue.
For additional information use Pitney Bowes status page - https://status.pitneybowes.com
resolved
Resolved by Pitney Bowes
UPS Web Services outage
Έναρξη 25 Ιουλίου 2024 στις 5:53 μ.μ. UTC · 6h 22m
IssuesΜικρό περιστατικό
Επηρεαζόμενα στοιχεία
UPS Web Services
identified
We are seeing a degraded performance with UPS web services. We will continue to monitor as UPS works to resolve this.
To see current response times from UPS you can check:
- https://downdetector.com/status/ups/
- https://www.shippingapimonitor.com/history.html?api=ups
monitoring
UPS resolved the issue on their side, we will continue to monitor it.
resolved
This incident has been resolved.
USPS Endicia is experiencing issues with printing postage
Έναρξη 18 Ιουνίου 2024 στις 5:03 μ.μ. UTC · 6h 16m
IssuesΜικρό περιστατικό
Επηρεαζόμενα στοιχεία
USPS via Endicia
identified
USPS Endicia has noted that they have fixed the postage printing issue.
See USPS Endicia status page for more details: https://status.endicia.com/
resolved
Resolved by Endicia.
FedEx Web Services outage
Έναρξη 17 Ιουνίου 2024 στις 4:01 μ.μ. UTC · 1d 1h
IssuesΜικρό περιστατικό
Επηρεαζόμενα στοιχεία
FedEx Web Services
identified
We are seeing a degraded performance with FedEx web services. We will continue to monitor as FedEx works to resolve this.
To see current response times from FedEx you can check: https://www.shippingapimonitor.com/history.html?api=fedex
resolved
Resolved by FedEx.
FedEx Web Services outage
Έναρξη 22 Μαΐου 2024 στις 5:46 μ.μ. UTC · 2h 33m
Pending
Επηρεαζόμενα στοιχεία
FedEx Web Services
identified
We are seeing a degraded performance with FedEx web services. We will continue to monitor as FedEx works to resolve this.
To see current response times from FedEx you can check: https://www.shippingapimonitor.com/history.html?api=fedex
resolved
Resolved by FedEx team.
UPS Web Services outage
Έναρξη 17 Μαΐου 2024 στις 7:18 μ.μ. UTC · 3h 23m
IssuesΜικρό περιστατικό
Επηρεαζόμενα στοιχεία
UPS Web Services
identified
We are seeing a degraded performance with UPS web services. We will continue to monitor as UPS works to resolve this.
To see current response times from UPS you can check:
- https://downdetector.com/status/ups/
- https://www.shippingapimonitor.com/history.html?api=ups