GitHub incident can affect Cycode
- investigating
GitHub component: Pull Requests Original GitHub incident: https://stspg.io/ssd9z8l2g46v
- resolved
GitHub component: Pull Requests Original GitHub incident: https://stspg.io/ssd9z8l2g46v
46 Cycode incidents · Φεβρουάριος 2026 — official updates, affected components, duration and resolution details.
GitHub component: Pull Requests Original GitHub incident: https://stspg.io/ssd9z8l2g46v
GitHub component: Pull Requests Original GitHub incident: https://stspg.io/ssd9z8l2g46v
GitHub component: API Requests Original GitHub incident: https://stspg.io/3xn46bst0bjh
GitHub component: API Requests Original GitHub incident: https://stspg.io/3xn46bst0bjh
GitHub component: API Requests Original GitHub incident: https://stspg.io/3xn46bst0bjh
Οι πελάτες μπορεί να βιώσουν υποβαθμισμένη απόδοση στις σαρώσεις. Αίτηση τραβήγματος και σαρώσεις CLI μπορεί να επηρεαστούν.
The team has identified the root cause of the issue and is working on the solution.
The root cause has been resolved. The system began to stabilize itself, and all the scans are starting to get processed with regular performance.
All scan types except for SAST are fully operational. SAST continues to stabilize and will soon be fully stable.
System should be back to being fully operational.
**Root Cause** The incident was caused by a deployment of one service that ran a database index creation. The team has identified an issue with the way we perform index creations as database migrations. During a deployment the pods with newest image of the service attempted to create an index on a big table. The team has identified that the index creation took 7 minutes. However, during index creation pods were not responsive, and as a result, Kubernetes deemed them as unhealthy pods and attempted to retry those pods after 5 minutes. As a result, because the pod got killed before the index creation was fully completed, the database transaction was rolled back. Then, subsequent pods attempted to create the index again, dying after 5 minutes. This lead to the database being in unhealthy state, and the service was down. The team has rolled back the deployment, and killed all replicas that attempted to create the index. Thanks to that, the service and the database was in healthy state again. **Why safety measures did not help** Cycode provides a safety mechanism that unblocks all Pull Request scans after a specific period of time, giving each scan a maximum duration before the Pull Request is unblocked. However, because the service that is responsible for triggering and completing scans, as well as this safety net, was down, the process couldn't behave as expected. We acknowledge this gap and are working on strengthening this area of our system. **Action items** • The team is actively investigating enhancements and new safety protocols that can be put in place in order to have another safety net preventing Pull Request scans being stuck in case of any incident. • The team is investigating changes to the index creation process.
Αυτόματη μετάφραση από την επίσημη ενημέρωση του συμβάντος.
Ερευνούμε ένα θέμα που προκαλεί παλαιότερες εκδηλώσεις να επανεξεταστούν. ** Impact: ** Μερικές ροές εργασίας μπορεί να ξανατρέξουν, πράγμα που θα μπορούσε να οδηγήσει σε διπλές καταχωρίσεις. Οι σαρώσεις δημοσίων σχέσεων μπορεί επίσης να καθυστερήσουν.
Έχουμε επιλύσει το ιστορικό της επεξεργασίας που προκλήθηκε από ένα θέμα κατά τη διάρκεια της μετανάστευσης Kafka. Το θέμα είχε ως αποτέλεσμα την επεξεργασία παλαιότερων γεγονότων παράλληλα με νέα γεγονότα, τα οποία προκάλεσαν καθυστερήσεις και ενδέχεται να έχουν ενημερώσει ορισμένες παραβιάσεις με ξεπερασμένο καθεστώς. Η κανονική επεξεργασία έχει αποκατασταθεί. Ωστόσο, οι πελάτες μπορεί ακόμα να δουν κάποιες παραβιάσεις με ξεπερασμένη κατάσταση, ενώ εμείς εντοπίζουμε και διορθώνουμε τα επηρεαζόμενα αρχεία. Οι σαρώσεις PR δεν καθυστέρησαν ή επανεπεξεργασία, και οι ροές εργασίας δεν επηρεάστηκαν. Συνεχίζουμε την αποκατάσταση και παρακολουθούμε στενά το σύστημα.
Η κανονική επεξεργασία έχει αποκατασταθεί, και το περιστατικό είναι τώρα υπό παρακολούθηση. Ένας μικρός αριθμός πελατών μπορεί να δει ακόμη περιορισμένο αριθμό παραβιάσεων με απαρχαιωμένο καθεστώς ως αποτέλεσμα του συμβάντος. Εντοπίσαμε τα περιβάλλοντα που ενδεχομένως έχουν επηρεαστεί και εργαζόμαστε για να διορθώσουμε τα αρχεία που έχουν επηρεαστεί.
Το σύστημα είναι πλήρως λειτουργικό. Ένας μικρός αριθμός πελατών μπορεί να δει ακόμη περιορισμένο αριθμό παραβιάσεων με απαρχαιωμένο καθεστώς ως αποτέλεσμα του συμβάντος. Εντοπίσαμε τα περιβάλλοντα που ενδεχομένως έχουν επηρεαστεί και εργαζόμαστε για να διορθώσουμε τα αρχεία που έχουν επηρεαστεί.
The platform is now fully operational and processing normally
Αυτόματη μετάφραση από την επίσημη ενημέρωση του συμβάντος.
Η ομάδα προσδιόρισε ένα θέμα με υποβαθμισμένες επιδόσεις με σάρωση. Μπορεί να υπάρξουν καθυστερήσεις στην εκκίνηση, εκτέλεση και ολοκλήρωση των σαρώσεων. Όλοι οι τύποι σάρωσης μπορεί να επηρεαστούν (Αίτηση Pull και σαρώσεις CLI). Η ομάδα έχει εντοπίσει ένα πρόβλημα με μια δυσλειτουργία στην ανάπτυξη, και το ζήτημα θα πρέπει να επιλυθεί σύντομα.
Η ομάδα έχει αναγνωρίσει τη βασική αιτία και την επιλύσει. Βλέπουμε το σύστημα να επιστρέφει στη σταθερότητα.
Το σύστημα έχει πλέον αρχίσει να λειτουργεί πλήρως.
** Αιτία Root ** Το περιστατικό προκλήθηκε από την ανάπτυξη μιας υπηρεσίας που διηύθυνε μια μετανάστευση βάσης δεδομένων. Η ομάδα έχει εντοπίσει ότι αυτή η μετανάστευση περιείχε ελαττωματικό κώδικα και ως αποτέλεσμα να οδηγήσει σε υπερφόρτωση βάσεων δεδομένων κατά την προσπάθεια ανάπτυξης της υπηρεσίας. Ως αποτέλεσμα, η υπηρεσία μειώθηκε εν μέρει μέχρι την επαναφορά της εγκατάστασης. Κατά τη διάρκεια αυτού του διαστήματος, όλες οι σαρώσεις επεξεργάστηκαν με χαμηλότερες από τις αναμενόμενες επιδόσεις.
Αυτόματη μετάφραση από την επίσημη ενημέρωση του συμβάντος.
Συστατικό GitHub: Αιτήματα API Αρχικό περιστατικό GitHub: https://stspg.io/vr201n49yl53
Συστατικό GitHub: Αιτήματα API Αρχικό περιστατικό GitHub: https://stspg.io/vr201n49yl53
Αυτόματη μετάφραση από την επίσημη ενημέρωση του συμβάντος.
GitHub συστατικό: Αιτήματα έλξης Πρωτότυπο περιστατικό GitHub: https://stspg.io/sm1tp7kfm4vj
GitHub συστατικό: Αιτήματα έλξης Πρωτότυπο περιστατικό GitHub: https://stspg.io/sm1tp7kfm4vj
GitHub συστατικό: Αιτήματα έλξης Πρωτότυπο περιστατικό GitHub: https://stspg.io/sm1tp7kfm4vj
Αυτόματη μετάφραση από την επίσημη ενημέρωση του συμβάντος.
Παρατηρήσαμε υποβαθμισμένη απόδοση στις σαρώσεις IaC Pull Request. Αντιμετωπίζουμε το πρόβλημα.
Αναγνωρίσαμε τη βασική αιτία των βραδειών και εφαρμόζουμε αντίμετρα.
Η καθυστέρηση που οδήγησε σε αργούς ρυθμούς έχει σχεδόν τελειώσει. Παρακολουθούμε την κατάσταση.
Το ζήτημα έχει επιλυθεί και συνεχίζουμε να παρακολουθούμε την κατάσταση.
Αυτόματη μετάφραση από την επίσημη ενημέρωση του συμβάντος.
Συστατικό GitHub: Αιτήματα API, αιτήματα τραβήγματος Αρχικό περιστατικό GitHub: https://stspg.io/j5c80shxqm53
GitHub component: API Requests, Pull Requests Original GitHub incident: https://stspg.io/j5c80shxqm53
Αυτόματη μετάφραση από την επίσημη ενημέρωση του συμβάντος.
Συστατικό GitHub: Webhooks Αρχικό περιστατικό GitHub: https://stspg.io/syhr80rth84z
GitHub συστατικό: Webhooks, αιτήματα έλξης Αρχικό περιστατικό GitHub: https://stspg.io/syhr80rth84z
GitHub συστατικό: Webhooks, αιτήματα έλξης Αρχικό περιστατικό GitHub: https://stspg.io/syhr80rth84z
Αυτόματη μετάφραση από την επίσημη ενημέρωση του συμβάντος.
Στο **1:41** PM EDT, εντοπίσαμε ένα θέμα που προκάλεσε αυξημένα ποσοστά σφάλματος κατά την επεξεργασία αίτησης στην Πλατφόρμα UI. Το θέμα μετριάστηκε άμεσα και η πλατφόρμα λειτουργεί κανονικά. Η ομάδα μας συνεχίζει να παρακολουθεί ενεργά την πλατφόρμα για να εξασφαλίσει σταθερότητα των υπηρεσιών.
Το περιστατικό έχει επιλυθεί και η πλατφόρμα λειτουργεί κανονικά.
Αυτόματη μετάφραση από την επίσημη ενημέρωση του συμβάντος.
Παρατηρήσαμε ότι ένα μέρος από μυστικά της CLI αποτυγχάνει. Είμαστε ενεργά triaging το πρόβλημα.
Αναγνωρίσαμε ότι η έκδοση 3.17.1 του CLI εισήγαγε την ελαττωματική συμπεριφορά. Η υποβάθμιση της έκδοσης CLI σε 3.17.0 θα πρέπει να επιλύσει προσωρινά το ζήτημα, ενώ συνεχίζουμε να κατανοούμε και να επιλύουμε τη βασική αιτία.
Μια διόρθωση έχει εφαρμοστεί και η λειτουργικότητα έχει αποκατασταθεί πλήρως· συνεχίζουμε να παρακολουθούμε για να διασφαλίσουμε ότι όλα παραμένουν σταθερά.
Αυτόματη μετάφραση από την επίσημη ενημέρωση του συμβάντος.
Λόγω αυξημένων φορτίων σάρωσης, παρατηρήσαμε καθυστερήσεις στις ενημερώσεις κατάστασης παραβίασης που περιλαμβάνουν αυτόματη επίλυση των παραβιάσεων. Η πηγή της ξαφνικής αύξησης έχει μετριαστεί και η καθυστέρηση έχει ήδη μειωθεί. Θα συνεχίσουμε να παρακολουθούμε την κατάσταση μέχρι να επιστρέψουμε στο φυσιολογικό
Συνεχίζουμε να παρακολουθούμε την επεξεργασία ανίχνευσης και τις σχετικές καθυστερήσεις στις ενημερώσεις κατάστασης παραβίασης (συμπεριλαμβανομένης της αυτόματης ανάλυσης)
Αυτόματη μετάφραση από την επίσημη ενημέρωση του συμβάντος.
Παρατηρήσαμε υποβαθμισμένη απόδοση σε πολλαπλά εξαρτήματα συστήματος. Εντοπίζουμε όλα τα επηρεαζόμενα συστατικά και αναγνωρίζουμε τη βασική αιτία.
Έχουμε παρατηρήσει υποβαθμισμένη απόδοση σε πολλαπλά συστατικά της εφαρμογής UI. Οι σαρώσεις, καθώς και η αίτηση έλξης και οι σαρώσεις CLI μπορεί επίσης να επηρεαστούν.
Παρατηρούμε αυξημένα χρονικά όρια Redis. Είμαστε κλιμάκωση Redis cluster ικανότητα να μετριάσει την επίδραση και να αποκαταστήσει τη σταθερή απόδοση υπηρεσιών
Η περιοχή έχει ανακάμψει και λειτουργεί κανονικά. Παρακολουθούμε στενά τις επιδόσεις του συστήματος για να διασφαλίσουμε συνεχή σταθερότητα
Το σύστημα είναι πλέον πλήρως λειτουργικό. Δεν πρέπει να υπάρχει πλέον υποβαθμισμένη απόδοση. **Περίληψη ** Παρατηρήσαμε μια περίοδο βραδύτητας και διαλείπων χρονικών διαλειμμάτων που επηρεάζουν διάφορες λειτουργίες του συστήματος στην περιοχή της ΕΕ, συμπεριλαμβανομένης της διεπαφής εφαρμογής και της αίτησης έλξης (PR) σαρώσεις. Το ζήτημα προκλήθηκε κυρίως από ένα σύστημα επεξεργασίας που έφτανε στα όρια χωρητικότητας δικτύου και μνήμης του, επιδεινούμενο από υψηλό όγκο αυτοματοποιημένης δραστηριότητας από μία μόνο πηγή. Από τότε αναβαθμίσαμε την υποκείμενη υποδομή και εφαρμόσαμε διασφαλίσεις για να αποτρέψουμε παρόμοιες δραστηριότητες υψηλού όγκου από το να επηρεάσουν το σύστημα. Το θέμα έχει πλέον επιλυθεί πλήρως και όλες οι υπηρεσίες έχουν επιστρέψει στα αναμενόμενα επίπεδα απόδοσης. ** Βασικό χρονοδιάγραμμα (IDT) ** • ** 13 Ιουλίου 2026, 11:44 IDT**: Περιστατικά που εντοπίστηκαν μετά από αναφορές βραδείας και PR σάρωσης. • ** 13 Ιουλίου 2026, 12:19 IDT**: Εντοπίστηκε συμφόρηση στην υποδομή· αποφασίστηκε η αναβάθμιση του συμπλέγματος επεξεργασίας. • ** 13 Ιουλίου 2026, 12:26 IDT**: Εντοπίστηκε και απενεργοποιήθηκε μια αυτοματοποιημένη διαδικασία υψηλού όγκου για τη μείωση του άμεσου φορτίου. • ** 13 Ιουλίου 2026, 13:09 IDT**: Η αναβάθμιση της υποδομής ολοκληρώθηκε. • ** 13 Ιουλίου 2026, 15:35 IDT**: Όλα τα αρχεία ακυρώθηκαν, και το περιστατικό λύθηκε επίσημα. ** Αιτία Root ** Το περιστατικό πυροδοτήθηκε από έναν συνδυασμό παραγόντων: μια συστάδα επεξεργασίας έφτασε το μέγιστο εύρος ζώνης δικτύου και την ικανότητα μνήμης λόγω μιας υπομεγέθους διαμόρφωσης για τον τρέχοντα φόρτο εργασίας. Αυτό καταπονήθηκε περαιτέρω από μια συγκεκριμένη αυτοματοποιημένη ροή εργασίας που προκάλεσε ασυνήθιστα υψηλό όγκο αιτήσεων ενημέρωσης. Επιπλέον, μια διαφορά διαμόρφωσης στον αγωγό επεξεργασίας μηνυμάτων στην περιοχή της ΕΕ εμπόδισε το σύστημα να διαχειριστεί αποτελεσματικά την καθυστέρηση που προέκυψε. **Δράσεις που λήφθηκαν ** • ** Αναβαθμισμένη Υποδομή **: Η συστάδα επεξεργασίας αναβαθμίστηκε σε μια υψηλότερης χωρητικότητας περίπτωση τύπου για να παρέχει περισσότερο εύρος ζώνης δικτύου και μνήμης. • **Disabled High-Volume Source**: Ένα συγκεκριμένο αναγνωριστικό πελάτη υπεύθυνο για την υπερβολική κυκλοφορία απενεργοποιήθηκε προσωρινά για την αποκατάσταση της σταθερότητας του συστήματος. • **Επανακατεστημένη Συνδεσιμότητα**: Επηρεαζόμενα εξαρτήματα υπηρεσιών επανεκκινήθηκαν για να εξασφαλίσουν ότι επανίδρυσαν καθαρές συνδέσεις με την αναβαθμισμένη υποδομή. • ** Αυξημένος Παραλληλισμός Επεξεργασίας **: Ο αριθμός των κατατμήσεων στην επηρεαζόμενη ουρά μηνυμάτων αυξήθηκε για να επιτρέψει στο σύστημα να επεξεργαστεί το backlog πιο γρήγορα. ** Στοιχεία δράσης ** • ** Παρακολούθηση επιπτώσεων **: Εφαρμογή νέων ειδοποιήσεων για τη χρήση του δικτύου και της μνήμης για τον εντοπισμό ζητημάτων δυναμικότητας πριν να επηρεάσουν τους πελάτες. • ** Βελτιστοποιήστε την ενημέρωση Ροή εργασίας **: Επαναπροσδιορισμός της διαδικασίας ενημέρωσης κατάστασης σε αιτήματα παρτίδας, μειώνοντας σημαντικά το φορτίο στο σύστημα επεξεργασίας. • **Εφαρμογή Περιορισμός Ρυθμού **: Παρουσιάστε διασφαλίσεις για να αποτρέψει οποιαδήποτε πηγή από την κατανάλωση δυσανάλογων πόρων συστήματος. • ** Σταθεροποίηση Περιφερειακών Διαμορφώσεων **: Διεξαγωγή ελέγχου για τη διασφάλιση ότι οι ρυθμίσεις της ουράς δεδομένων και της υποδομής είναι συνεπείς σε όλες τις περιφέρειες.
Αυτόματη μετάφραση από την επίσημη ενημέρωση του συμβάντος.
Έχουμε εντοπίσει ένα θέμα που μπορεί να προκαλέσει ** ανακρίβεια καταμέτρησης παραβίαση ** σε ** μερικά ταμπλό προϊόντων ** και προσαρμοσμένα ταμπλό πάνελ που βασίζονται σε δεδομένα παραβίασης (δεν επηρεάζονται όλα τα ταμπλό). Έχουμε ήδη ξεκινήσει διορθωτικές εργασίες, αλλά θα χρειαστεί χρόνος για να ολοκληρωθεί πλήρως, και μπορείτε να δείτε τις αλλαγές των αριθμών καθώς τα δεδομένα διορθώνονται. Θα μοιραστούμε μια άλλη ενημέρωση μόλις το fix έχει τελειώσει την εκτέλεση και η ακρίβεια των δεδομένων έχει αποκατασταθεί πλήρως.
Έχουμε σημειώσει σημαντική πρόοδο στη διόρθωση των ανακριβών στοιχείων παραβίασης που επηρεάζουν ορισμένα ταμπλό προϊόντων και προσαρμοσμένων. • **Παρούσα κατάσταση: ** Η απόφαση έχει ολοκληρωθεί με επιτυχία για τη συντριπτική πλειοψηφία των λογαριασμών, και η πλήρης ακρίβεια των δεδομένων έχει αποκατασταθεί. • **Επόμενα βήματα: ** Επιλύουμε ενεργά το ζήτημα για τον μικρό αριθμό των λογαριασμών που εξακολουθούν να επηρεάζονται.
Η λειτουργικότητα αποκαθίσταται πλήρως· συνεχίζουμε να παρακολουθούμε για να διασφαλίσουμε ότι όλα παραμένουν σταθερά.
Αυτόματη μετάφραση από την επίσημη ενημέρωση του συμβάντος.
Ερευνούμε επί του παρόντος ένα θέμα που επηρεάζει Maestro Risk Explorability, Risk AI Remeditation, Maestro Remeditation, και Graph AI υπηρεσίες.
Αναγνωρίσαμε ένα θέμα διαμόρφωσης του τείχους προστασίας που είχε αντίκτυπο στις υπηρεσίες του Maestro AI. Η διαμόρφωση έχει ενημερωθεί και οι πληγείσες υπηρεσίες έχουν ανακτηθεί. Συνεχίζουμε να παρακολουθούμε την κατάσταση και εργαζόμαστε για περαιτέρω σταθεροποίηση. Μερικές υποβαθμισμένες επιδόσεις μπορεί ακόμα να παρατηρηθεί, ενώ ολοκληρώνουμε πρόσθετες βελτιώσεις.
Το θέμα που αφορά τις υπηρεσίες του Maestro AI έχει επιλυθεί. Maestro Risk Explorability, Risk AI Remeditation, Maestro Remeditation, και γράφημα AI είναι τώρα διαθέσιμα και λειτουργούν κανονικά. **Περίληψη ** Στις 9 Ιουλίου 2026, οι πελάτες που χρησιμοποίησαν την υπηρεσία Maestro στο ευρωπαϊκό περιβάλλον παραγωγής γνώρισαν μια περίοδο μη διαθεσιμότητας υπηρεσιών. Το θέμα ξεκίνησε μετά από μια ενημέρωση ρύθμισης που άλλαξε ακούσια την περιφερειακή δρομολόγηση της υπηρεσίας. Αυτό προκάλεσε το σύστημα να επιχειρήσει συνδέσεις μέσω μιας διαδρομής δικτύου που στερούνταν των απαραίτητων αδειών και σε μια περιοχή όπου συγκεκριμένα μοντέλα επεξεργασίας δεν ήταν διαθέσιμα. Το θέμα έχει επιλυθεί πλήρως, και η υπηρεσία έχει αποκατασταθεί σε όλους τους πληγέντες πελάτες. ** Βασικό χρονοδιάγραμμα (IDT) ** • ** 9 Ιουλίου 2026, 12:02 IDT: ** Το περιστατικό αναγνωρίστηκε και ξεκίνησε έρευνα. • ** 9 Ιουλίου 2026, 12:07 IDT: ** Δημόσια κοινοποίηση εκδόθηκε σχετικά με τη διακοπή της υπηρεσίας. • ** 9 Ιουλίου 2026, 13:00 IDT: ** Εφαρμόστηκε μια ρύθμιση του δικτύου, αποκαθιστώντας την κύρια συνδεσιμότητα. • ** 9 Ιουλίου 2026, 13:39 IDT: ** Η υπηρεσία αποκαταστάθηκε πλήρως μετά την εφαρμογή υποτροπών μοντέλων, και το περιστατικό σημαδεύτηκε ως επιλυμένο. ** Αιτία Root ** Η διακοπή της υπηρεσίας πυροδοτήθηκε από μια πρόσφατη ενημέρωση στη διαδικασία ταυτοποίησης και διαμόρφωσης. Η ενημέρωση αυτή εισήγαγε μια σύγκρουση στον τρόπο με τον οποίο το σύστημα προσδιόρισε τη λειτουργική του περιοχή. Συγκεκριμένα, μια αυτοματοποιημένη διαδικασία ενημέρωσης υπερβαίνει τις χειροκίνητες ρυθμίσεις, δρομολογώντας την κυκλοφορία σε διαφορετικό περιφερειακό τελικό σημείο. Αυτή η νέα διαδρομή μπλοκαρίστηκε από έναν κανόνα ασφαλείας του δικτύου που έλειπε και επιχείρησε να χρησιμοποιήσει ένα μοντέλο επεξεργασίας που δεν υποστηρίχθηκε στη συγκεκριμένη περιοχή, οδηγώντας σε αποτυχία της υπηρεσίας. **Δράσεις που λήφθηκαν ** • ** Επανακατεστημένη συνδεσιμότητα δικτύου: ** Χειροκίνητα ενημερωμένοι κανόνες ασφαλείας δικτύου για την ασφαλή κυκλοφορία μέσω του νέου περιφερειακού τελικού σημείου. • ** Ολοκληρωμένο μοντέλο Fallbacks: ** Configure του συστήματος για τη χρήση εναλλακτικών μοντέλων επεξεργασίας για τη διασφάλιση της άμεσης διαθεσιμότητας των υπηρεσιών, ενώ ρυθμίστηκαν οι μακροπρόθεσμες περιφερειακές διαμορφώσεις. • ** Ενημερωμένες επικοινωνίες κατάστασης: ** Διατήρηση ενημερώσεων σε πραγματικό χρόνο για τα ενδιαφερόμενα μέρη και τους πελάτες κατά τη διάρκεια της διαδικασίας ανάκαμψης. ** Στοιχεία δράσης ** • ** Σταθεροποίηση Προτίμηση ρυθμίσεων: ** Ενημέρωση της ροής εργασίας για την ανάπτυξη ώστε να αποφευχθούν οι αυτοματοποιημένες διαδικασίες από σιωπηλά υπερισχύουσες κρίσιμες ρυθμίσεις περιβάλλοντος. • ** Έλεγχος υποδομής: ** Διεξαγωγή συνολικής αναθεώρησης των κανόνων ασφάλειας του δικτύου σε όλες τις περιφέρειες, προκειμένου να διασφαλιστεί η συνοχή και να αποφευχθούν παρόμοια κενά συνδεσιμότητας. • ** Εντολή αυτόματης παρακολούθησης: ** Εφαρμογή end-to-end health checks και συνθετικοί καθετήρες για τον εντοπισμό περιφερειακών θεμάτων συνδεσιμότητας αυτόματα πριν να επηρεάσουν τους χρήστες. • **Έλεγχος πολιτικών ανάπτυξης: ** Καθιέρωση νέων κατευθυντήριων γραμμών για να διασφαλιστεί ότι οι αλλαγές της διαμόρφωσης αναπτύσσονται και επικυρώνονται σε περιβάλλοντα που μοιάζουν με την παραγωγή συχνότερα, ώστε να μειωθεί ο κίνδυνος των αναπροσαρμογών " ενδεικτικών".
Αυτόματη μετάφραση από την επίσημη ενημέρωση του συμβάντος.
We are experiencing delays in infrastructure provisioning caused by cloud provider API rate limiting. We are actively investigating the issue with our cloud provider.
Please refer to the AWS Health Status page for details on the related incident: [https://health.aws.amazon.com/health/status](https://health.aws.amazon.com/health/status "https://health.aws.amazon.com/health/status")
Mitigation: We temporarily scaled up the managed node group to get pods scheduled while we wait for AWS to fully resolve the underlying issue.
We are starting to see stabilization and a reduction in API errors. However, we continue to closely monitor the situation.
AWS has confirmed that the issue has been fully mitigated and we are currently not observing any related issues.
**Ερευνώντας - Θέματα με Παραβιάσεις και προσαρμοσμένες πίνακες (Prod-US) ** Αυτή τη στιγμή ερευνούμε ένα θέμα στο περιβάλλον μας **Prod-US** όπου οι παραβιάσεις αποτυγχάνουν να φορτώσουν. Ως αποτέλεσμα, προσαρμοσμένες πίνακες ταμπλό που βασίζονται σε δεδομένα παραβίασης μπορεί επίσης να αποτύχει να αποδώσει ή να εμφανίσει σφάλματα. Η ομάδα μηχανικών μας εξετάζει ενεργά τη βασική αιτία, και θα παρέχουμε ενημερώσεις εδώ καθώς μαθαίνουμε περισσότερα. Ζητάμε συγγνώμη για την αναστάτωση.
Έχει αναπτυχθεί μια ρύθμιση για τα ζητήματα που επηρεάζουν τις παραβιάσεις και τα προσαρμοσμένα ταμπλό στο Prod-US. Παρακολουθούμε ενεργά το περιβάλλον για να διασφαλίσουμε την πλήρη αποκατάσταση των υπηρεσιών.
Το βασικό ζήτημα έχει επιλυθεί, και οι παραβιάσεις και τα προσαρμοσμένα ταμπλό θα πρέπει τώρα να λειτουργούν κανονικά. Η ομάδα μας παρακολουθεί ενεργά τον συγχρονισμό των δεδομένων για να επιλύσει τυχόν εναπομείνασες διαφορές με νεότερες παραβιάσεις. Θα παρέχουμε μια τελική ενημέρωση μόλις ολοκληρωθεί ο συγχρονισμός.
Συνεχίζουμε να παρακολουθούμε τη διαδικασία συγχρονισμού δεδομένων για νέες παραβιάσεις στο UI. Ενώ η λειτουργικότητα έχει αποκατασταθεί, μπορεί να χρειαστεί μέχρι και **6 ώρες ** για όλα τα πρόσφατα δεδομένα για να προφθάσουν πλήρως και να αντανακλούν με ακρίβεια. Θα παρέχουμε μια τελική ενημέρωση μόλις ολοκληρωθεί ο συγχρονισμός.
Ο συγχρονισμός των δεδομένων ολοκληρώθηκε, και όλες οι πρόσφατες παραβιάσεις έχουν κατοικηθεί επιτυχώς στο UI. Παραβάσεις και προσαρμοσμένα ταμπλό λειτουργούν κανονικά, και το περιστατικό έχει επιλυθεί πλήρως. Εκτιμούμε την υπομονή σας καθώς εργαστήκαμε για να αποκαταστήσουμε την πλήρη υπηρεσία.
Η λειτουργικότητα αποκαθίσταται πλήρως· συνεχίζουμε να παρακολουθούμε για να διασφαλίσουμε ότι όλα παραμένουν σταθερά.
Αυτόματη μετάφραση από την επίσημη ενημέρωση του συμβάντος.
We have identified the source of an issue and currently deploying the fix. At the same time we scaled our scanning platform up to accelerate scanning
The fix was deployed. The queue is decreasing and we're monitoring it
The system has processed all jobs with higher priorities. There is a queue of lower priority jobs that should not impact overall Cycode scanning performance
**Summary** During the incident, customers experienced significant delays and temporary disruptions across SAST, SCA, CCA, and Secret repository scans and push events. The issue was caused by a surge in reachability scanner jobs that overwhelmed the processing queue, compounded by scanner pods requesting excessive CPU and memory, infrastructure resource limits being reached, and inefficiencies in job prioritization and retry logic. As a result, processing capacity was improperly consumed and a large job backlog accumulated. A series of corrective updates were deployed to stabilize the environment, and the processing environment has since returned to expected performance levels. **Impact** Customers experienced delays for SAST, SCA, CCA, and Secret repository scans and push events, with some requests delayed by several hours and a peak queue size of over 64,000 jobs. Lower priority scans such as Trivy, Syft, and CCA were most affected, though high-priority jobs were eventually processed without further delay. **Key Timeline (IDT)** • **21.06.2026, 17:16 IDT**: A surge in reachability scanner jobs caused the CycodeX queue to grow rapidly. • **22.06.2026, 10:07 IDT**: The issue was identified by an on-call engineer. • **22.06.2026, 12:55 IDT**: We increased the scanning platform resources to process more jobs. • **22.06.2026, 14:10 IDT**: A fix that lowered new reachability scanners was deployed to production. • **22.06.2026, 18:43 IDT**: Existing reachability scanners' priority was lowered. • **23.06.2026, 09:12 IDT**: Scans with higher priority were processed. Only lower priority scans remained, including CCA. • **23.06.2026, 13:51 IDT**: A fix that reduced communication overload to Kubernetes was deployed. The scanning platform started processing scan jobs much faster. • **23.06.2026, 17:34 IDT**: The queue was fully processed. **Root Cause** The issue was triggered by a combination of factors: 1. **Reachability scanner job surge** -- A surge in reachability scanner jobs caused the CycodeX queue to grow rapidly, which led to resource bottlenecks in the cluster and a peak queue size of over 64,000 jobs. 2. **Excessive pod resource requests** -- Due to configuration bugs, scanner pods requested excessive CPU and memory, which prevented efficient scheduling and amplified the resource bottlenecks in the cluster. 3. **Infrastructure resource limits** -- AWS VPC subnet IP and EKS API limits were reached, restricting the cluster's ability to scale and schedule new work. 4. **Job prioritization and retry inefficiencies** -- Inefficiencies in job prioritization and retry logic meant lower priority scans (Trivy, Syft, CCA) competed for capacity and were most affected, while the backlog continued to grow. **Actions Taken** • Increased cluster and node pool capacity. • Fixed job prioritization to deprioritize reachability scans. • Capped resource requests for scanner pods to enable efficient scheduling. • Deployed additional fixes to the scanning platform. • Opened AWS support tickets to address resource limits. • Restored monitoring and logging. • Cleared the job backlog; the queue now processes new jobs as they arrive. **Action Items** • Improve monitoring to better understand the behavior of the processing environment. • Improve scanning optimization and prioritization for all scan types.
**Problem**: SAST (Static Application Security Testing) scans for pull requests were running slowly **Impact**: Some users experienced slow pull request scans potentially delaying code reviews and deployments.
The issue was resolved. The system is fully stable now