Το Prod2 ήταν διαλείπτως μη διαθέσιμο
- investigating
Αυτή τη στιγμή ερευνούμε αυτό το ζήτημα.
- resolved
Το περιστατικό λύθηκε.
Αυτόματη μετάφραση από την επίσημη ενημέρωση του συμβάντος.
82 Split incidents · Απρίλιος 2026 — official updates, affected components, duration and resolution details.
Αυτή τη στιγμή ερευνούμε αυτό το ζήτημα.
Το περιστατικό λύθηκε.
Αυτόματη μετάφραση από την επίσημη ενημέρωση του συμβάντος.
Η εκτέλεση του αγωγού κόλλησε στο Prod1. Ερευνούμε το θέμα.
Εφαρμόστηκε μια ρύθμιση και παρακολουθούμε τα αποτελέσματα.
Το περιστατικό λύθηκε.
Αυτόματη μετάφραση από την επίσημη ενημέρωση του συμβάντος.
Αυτή τη στιγμή ερευνούμε αυτό το ζήτημα.
Το θέμα έχει εντοπιστεί και υλοποιείται μια λύση.
Εφαρμόστηκε μια ρύθμιση και παρακολουθούμε τα αποτελέσματα.
Το περιστατικό λύθηκε.
Περίληψη Μεταξύ 27 Αυγούστου και 28 Αυγούστου 2026, οι πελάτες αντιμετώπισαν ένα θέμα όπου εμφανίστηκαν ορισμένοι αγωγοί, εγκαταστάσεις και συναφείς πόροι, όπως δεν βρέθηκαν στο Harness UI και API, παρόλο που τα υποκείμενα δεδομένα παρέμειναν άθικτα. Το ζήτημα προέκυψε κατά τη διάρκεια μιας προγραμματισμένης επικαιροποίησης της εσωτερικής υποδομής που επηρέασε την επικοινωνία μεταξύ των υπηρεσιών εσωτερικής πλατφόρμας. Ως αποτέλεσμα, τα αιτήματα που εξαρτιόνταν από το λογαριασμό, την οργάνωση και την επίλυση του πεδίου εφαρμογής του έργου δεν ήταν σε θέση να ολοκληρώσουν επιτυχώς, γεγονός που οδήγησε σε λανθασμένη μη διαπίστωση ότι οι απαντήσεις επιστρέφονται σε πελάτες για υφιστάμενες οντότητες. Το μηχανοστάσιο αναγνώρισε το θέμα, γύρισε πίσω την αλλαγή, και αποκατέστησε την κανονική υπηρεσία. Δεν χάθηκαν ή διαγράφηκαν δεδομένα πελατών κατά τη διάρκεια του συμβάντος. Αιτία ρίζας Το θέμα προκλήθηκε από σφάλμα ρύθμισης που εισήχθη κατά τη διάρκεια προγραμματισμένης ενημέρωσης δρομολόγησης εσωτερικής υπηρεσίας στην Παραγωγή. Μια εσωτερική υπηρεσία πλατφόρμας που είναι υπεύθυνη για την επίλυση του λογαριασμού, της οργάνωσης και του πλαισίου του έργου δεν μπόρεσε να επικυρώσει αιτήματα από άλλες υπηρεσίες Harness μετά την εφαρμογή της αλλαγής. Επειδή αυτό το βήμα επικύρωσης απαιτείται πριν από πολλές ενδείξεις της οντότητας και ενέργειες που σχετίζονται με αγωγούς μπορούν να προχωρήσουν, τα αποτυχημένα αιτήματα εμφανίστηκαν στους πελάτες καθώς δεν βρέθηκαν σφάλματα για πόρους που συνέχισαν να υπάρχουν κανονικά. Το θέμα περιορίστηκε στο περιβάλλον παραγωγής που επηρεάστηκε και επιλύθηκε επαναφέροντας την αλλαγή και επαναφέροντας την προηγούμενη πορεία επικοινωνίας υπηρεσιών. Σύγκρουση * Μερικοί πελάτες είδαν υπάρχοντες αγωγούς, ανάπτυξη, και συναφείς οντότητες εμφανίζονται ως δεν βρέθηκαν στο UI και API. * Μερικές λειτουργίες που σχετίζονται με αγωγούς, συμπεριλαμβανομένης της εξέλιξης της εκτέλεσης, webhook- ενεργοποιηθεί ξεκινά, προγραμματισμένη αξιολόγηση σκανδάλης, και λίστα οντοτήτων, προσωρινά διαταράχθηκαν. * Το θέμα επηρέασε τη διαθεσιμότητα και την προβολή των υπαρχουσών οντοτήτων, αλλά δεν αφαίρεσε τα δεδομένα ούτε άλλαξε τις διαμορφώσεις των πελατών. * Δεν εμφανίστηκε μη εξουσιοδοτημένη πρόσβαση, και δεν παρατηρήθηκε απώλεια δεδομένων πελατών. . . . Αποκατάσταση * * * * Άμεση: ** Επανέστρεψε την επικαιροποίηση της διαμόρφωσης της υποδομής και αποκατέστησε την ήδη λειτουργική διαδρομή επικοινωνίας υπηρεσιών. * * **Επικύρωση ανάκτησης: ** Επαληθεύτηκε ότι οι θιγόμενες αναζητήσεις οντοτήτων, οι λειτουργίες αγωγών και τα εξαρτώμενα API λειτουργούσαν κανονικά μετά την αναστροφή. * * * * Μόνιμη ** Διορθώθηκε ο χειρισμός ρυθμίσεων που σχετίζεται με την ενημέρωση, ώστε παρόμοια ζητήματα να μην παρεμβαίνουν στην ταυτοποίηση από υπηρεσία σε υπηρεσία στο μέλλον. . . . Στοιχεία δράσης Για να αποτρέψουν τέτοια ζητήματα από το να συμβούν ξανά, ο Harness θα 1. Βελτίωση της επικύρωσης της διαμόρφωσης με την ενίσχυση των δοκιμών πριν από την ανάπτυξη για την επαλήθευση της εσωτερικής επικοινωνίας υπηρεσιών πριν από τη μετατόπιση της κυκλοφορίας παραγωγής. 2. Ενισχύστε την παρακολούθηση και την ειδοποίηση για εσωτερικές αποτυχίες ταυτοποίησης, έτσι ώστε τα ζητήματα μπορούν να ανιχνευθούν νωρίτερα. 3. Βελτίωση του χειρισμού σφαλμάτων έτσι ώστε οι αποτυχίες εξάρτησης είναι λιγότερο πιθανό να εμφανιστούν στους πελάτες ως πόρος που δεν βρέθηκαν σφάλματα.
Αυτόματη μετάφραση από την επίσημη ενημέρωση του συμβάντος.
Αυτή τη στιγμή διερευνούμε ένα θέμα που αναφέρεται στους αγωγούς IACM σε συστάδες αγωγών Prod-1 , Prod-2 , Prod-4 και EU1.
Συνεχίζουμε να ερευνούμε αυτό το ζήτημα.
Επιστρέψαμε την αλλαγή που προκάλεσε αυτό το ζήτημα σε όλες τις ομάδες.
Το περιστατικό λύθηκε.
Αυτόματη μετάφραση από την επίσημη ενημέρωση του συμβάντος.
Αυτή τη στιγμή ερευνούμε αυτό το ζήτημα.
Αυτή τη στιγμή ερευνούμε αναφορές ότι η διεπαφή χρήστη Διαχείρισης & Πειραματισμού Χαρακτηριστικών (FME) αποτυγχάνει να φορτώσει. Οι πελάτες που προσπαθούν να έχουν πρόσβαση στην κονσόλα FME μπορεί να αντιμετωπίσουν λάθη ή σελίδες που δεν ανταποκρίνονται. Αξιολόγηση της σήμανσης και η κυκλοφορία SDK δεν πιστεύεται ότι επηρεάζονται. Μια περαιτέρω ενημέρωση θα ακολουθήσει σύντομα.
Εφαρμόστηκε μια ρύθμιση και παρακολουθούμε τα αποτελέσματα.
Το περιστατικό λύθηκε.
Περίληψη * Ξεκινώντας από **23:42 UTC** στις 23 Αυγούστου 2026, αρκετοί πελάτες FME ανέφεραν αποτυχίες φόρτωσης του FME UI. * FME UI Artifacts που εξυπηρετούνται από το CDN έληξε λόγω μιας πολιτικής διατήρησης, προκαλώντας FME UI να αποτύχει να φορτώσει. * Κάθε αίτημα σημαίας αλλάζει μέσω του API, αλλαγή παράδοσης, και ο αγωγός δεδομένων συνέχισε να λειτουργεί χωρίς διακοπή. Αιτία ρίζας * Το FME UI σερβίρεται από ένα CDN. Τα τεχνουργήματα του UI εκδιώχθηκαν λόγω μιας πολιτικής διατήρησης, προκαλώντας την αποτυχία του UI να φορτώσει για όλους τους χρήστες. Σύγκρουση * Το FME UI δεν μπόρεσε να φορτώσει για όλους τους χρήστες σε όλα τα περιβάλλοντα παραγωγής. Τι δεν επηρεάστηκε; * SDK λειτουργικότητα και αξιολόγηση runtime σημαία * Admin API κλήσεις * Δεδομένα διαμόρφωσης της σημαίας πελατών * Δεν παρουσιάστηκε απώλεια δεδομένων . . . Αποκατάσταση * FME UI αποκαταστάθηκε στο CDN μέσω μιας ανάπτυξης * Η ανάκτηση επιβεβαιώθηκε σε όλα τα περιβάλλοντα παραγωγής πριν από το κλείσιμο του συμβάντος. . . . Στοιχεία δράσης * Βελτίωση της πολιτικής διατήρησης περιουσιακών στοιχείων έτσι ώστε η τρέχουσα ενεργή έκδοση δεν υπόκειται ποτέ σε έξωση.
Αυτόματη μετάφραση από την επίσημη ενημέρωση του συμβάντος.
Αυτή τη στιγμή ερευνούμε αυτό το ζήτημα.
Η βραδύτητα μπορεί να προκαλέσει κάποιο από τα παρακάτω συμπτώματα: - Οι σωλήνες δεν ξεκινούν - Καθυστέρηση στην εκτέλεση - Σωλήνες που ακυρώνονται λόγω των χρονικών ορίων
Το cloud provider μας αντιμετωπίζει ένα ενεργό περιστατικό και παρακολουθούμε.
Συνεχίζουμε να ερευνούμε αυτό το ζήτημα.
Ο πάροχος cloud μας επιβεβαίωσε ένα συνεχιζόμενο περιστατικό που επηρεάζει πολλαπλές περιοχές. Οι αγωγοί Harness δεν έχουν παρουσιάσει αποτυχίες ως αποτέλεσμα, αν και ορισμένοι χρήστες μπορεί να συνεχίσουν να βιώνουν βραδύτητα. Παρακολουθούμε στενά την κατάσταση και θα παράσχουμε ενημερώσεις καθώς θα γίνονται διαθέσιμες περισσότερες πληροφορίες.
Παρατηρούμε βελτιωμένες κενές λειτουργίες σε όλο το διοικητικό συμβούλιο μετά τη διόρθωση που υλοποιείται από τον πάροχο cloud μας. Συνεχίζουμε να παρακολουθούμε στενά την κατάσταση και θα παράσχουμε περαιτέρω ενημερώσεις, όπως δικαιολογείται. Παρατηρήσαμε κάποιες κολλημένες εκτελέσεις για CI για δύο πελάτες, τις οποίες ερευνούμε
Το περιστατικό λύθηκε.
# Περίληψη Στις 20 Αυγούστου 2026, αρχίζοντας περίπου στις 15:00 UTC, η πλατφόρμα Harness γνώρισε εκτεταμένη υποβάθμιση των επιδόσεων σε όλα τα περιβάλλοντα παραγωγής. Οι εκτελέσεις αγωγών που κανονικά ολοκληρώνουν σε περίπου δύο λεπτά χρειάστηκαν επτά με δέκα λεπτά. Η συνεχής παράδοση, η συνεχής ολοκλήρωση, η ενορχήστρωση των αγωγών και η Διαχείριση και Πειραματισμός Χαρακτηριστικών επηρεάστηκαν. Το Google Cloud Platform γνώρισε ένα επεισόδιο πολλαπλών προϊόντων στην περιοχή us-west1 που επηρεάζει Bigtable, Compute Engine, Google Kubernetes Engine, και επίμονη-δίσκο I/O. Η υποδομή παραγωγής Harness λειτουργεί σε επίμονους δίσκους σε αυτή την περιοχή. Η υποβάθμιση αύξησε τη λανθάνουσα λειτουργία της βάσης δεδομένων από περίπου 2 ms σε πάνω από 10 ms στο 95ο εκατοστημόριο, το οποίο με τη σειρά του προκάλεσε καθυστέρηση στην επεξεργασία μηνυμάτων-queue και πολλαπλασιάζεται σε κάθε υπηρεσία που εξαρτάται από την έγκαιρη πρόσβαση στη βάση δεδομένων. # Σύγκρουση Αυτό ήταν μια υποβάθμιση, όχι μια διακοπή. Οι αγωγοί συνέχισαν να εκτελούν και να ολοκληρώνουν επιτυχώς σε όλη τη διάρκεια · ήταν αργοί αντί να αποτύχουν. Κανένα στοιχείο δεν χάθηκε, και καμία εργασία του πελάτη δεν έπεσε ως αποτέλεσμα αυτού του συμβάντος. # ** Αιτίες για τα σκουπίδια ** Η υποδομή παραγωγής Harness στα επηρεαζόμενα περιβάλλοντα λειτουργεί σε επίμονους δίσκους Google Cloud Platform στην περιοχή us-west1. Όταν αυτό το στρώμα αποθήκευσης υποβαθμίστηκε, το αποτέλεσμα εξαπλώθηκε μέσω της πλατφόρμας σε μια προβλέψιμη αλυσίδα: ** Επίμονη αποδόμηση του δίσκου I/O σε εμάς-δυτικά1.** Το Google Cloud Platform γνώρισε ένα επεισόδιο πολλαπλών προϊόντων που επηρέασε το Bigtable, το Compute Engine, το Google Kubernetes Engine και την επίμονη απόδοση του δίσκου. Αυτό ήταν μια αποτυχία της υποδομής στο περιβάλλον του παρόχου, έξω από τον έλεγχο του Harness. ** Προληπτικές ενέργειες ** Αν και Harness δεν μπορεί να αποτρέψει μια βλάβη υποδομής πάροχο σύννεφο. Οι ενέργειες που ακολουθούν έχουν ως στόχο να ανιχνεύσουν ένα πιο γρήγορο και να είναι καλύτερα τοποθετημένα για να δράσουν σε αυτό. \"Δράση\"
Αυτόματη μετάφραση από την επίσημη ενημέρωση του συμβάντος.
Αυτή τη στιγμή ερευνούμε αυτό το ζήτημα.
Το θέμα έχει εντοπιστεί και υλοποιείται μια λύση.
Εφαρμόστηκε μια ρύθμιση και παρακολουθούμε τα αποτελέσματα.
Το περιστατικό λύθηκε.
Περίληψη Στις 20 Αυγούστου 2026, μεταξύ 10:24 και 14:55 UTC, ένα υποσύνολο του FME γράφει απέτυχε. Γράμματα από το FME UI και γράφει με Harness πρόσβαση tokens \(PATs και SATS\) δεν επηρεάστηκαν. Η αξιολόγηση της σημαίας συνέχισε να λειτουργεί κανονικά. Το ζήτημα μετριάστηκε με την επαναφορά μιας πρόσφατης αλλαγής ταυτοποίησης σε μια υπηρεσία κοινής διακυβέρνησης, και επηρεάζεται γράφει επέστρεψε στο κανονικό από 14:55 UTC. Κατάσταση: [https://status.harness.io/incidents/rhthgm7d5dkz] (https://status.harness.io/incidents/rhthgm7d5dkz) Αιτία ρίζας Μια αλλαγή στον τρόπο με τον οποίο μια υπηρεσία κοινής διακυβέρνησης πιστοποίησε τις εισερχόμενες κλήσεις είχε ως αποτέλεσμα να απορριφθεί κάποια FME. Αυτές οι εγγραφές χρησιμοποιούσαν διαπιστευτήρια υπηρεσίας προς υπηρεσία που η υπηρεσία διακυβέρνησης δεν μπορούσε πλέον να επαληθεύσει μετά την αλλαγή. Η FME αντιμετωπίζει μια αποτυχία διακυβέρνησης στον πελάτη με HTTP 499, την ίδια κατάσταση που χρησιμοποιείται όταν μια πολιτική διακυβέρνησης αρνείται εκ προθέσεως μια αλλαγή. Επειδή το 499 είναι μια έγκυρη, αναμενόμενη απάντηση σε αυτή την πορεία άρνησης, οι αποτυχίες δεν έμοιαζαν με διακοπή στις ειδοποιήσεις μας, και το περιστατικό εντοπίστηκε από αναφορές πελατών και όχι με εσωτερική ανίχνευση. Σύγκρουση * Ένα υποσύνολο του FME γράφει απέτυχε κατά τη διάρκεια του παραθύρου, κυρίως αυτά που γίνονται χρησιμοποιώντας τα κληροδοτημένα πλήκτρα Split API ή τον προγραμματισμό της αίτησης αλλαγής. * Οι εγγραφές που έγιναν από το FME UI δεν επηρεάστηκαν. * Γράφει χρησιμοποιώντας Harness πρόσβαση tokens - (PATs και SATs\) δεν επηρεάστηκαν. * Runtime σημαία αξιολόγηση συνεχίστηκε κανονικά. * Δεν παρατηρήθηκε απώλεια δεδομένων. Οι αποτυχημένες εγγραφές δεν ισχύουν. Αποκατάσταση Επανέστρεψε την αλλαγή ταυτότητας διακυβέρνησης-υπηρεσίας. Επηρεασμένος γράφει επέστρεψε στο κανονικό αμέσως. Αντικείμενα δράσης Για να αποτραπεί η επανάληψη τέτοιων θεμάτων, * Harness θα επιστρέψει ένα διακριτό σφάλμα \(όχι 499\) όταν μια γραφή αποτυγχάνει, επειδή η διακυβέρνηση δεν μπορούσε να αξιολογηθεί, έτσι δεν συγχέεται με μια εσκεμμένη άρνηση πολιτικής. * Προσθήκη ειδοποίησης σχετικά με την ίδια την αξιολόγηση διακυβέρνησης, αντί να βασίζεται στον κωδικό κατάστασης που αντιμετωπίζει ο πελάτης. * Επέκταση υποστήριξης ταυτοποίησης για αξιολογήσεις πολιτικής. * Επέκταση αυτοματοποιημένης κάλυψης για πρόσθετα σενάρια εγγραφής.
Αυτόματη μετάφραση από την επίσημη ενημέρωση του συμβάντος.
Αυτή τη στιγμή ερευνούμε αυτό το ζήτημα.
Συνεχίζουμε να ερευνούμε αυτό το ζήτημα.
Το θέμα έχει εντοπιστεί και υλοποιείται μια λύση.
Εφαρμόστηκε μια ρύθμιση και παρακολουθούμε τα αποτελέσματα.
Συνεχίζουμε να παρακολουθούμε για τυχόν περαιτέρω ζητήματα.
Το περιστατικό λύθηκε.
**Περίληψη ** Στις 19 Αυγούστου 2026 μεταξύ 12:35 και 17:29 UTC, η υπηρεσία ασφάλειας εφαρμογών Harness παρουσίασε σημαντική διαταραχή που επηρέασε τόσο την κονσόλα που αντιμετωπίζει ο πελάτης όσο και τον αγωγό κατάποσης δεδομένων στις περιοχές παραγωγής SaaS και US1. ** Αιτία Root ** Η εσωτερική υπηρεσία διαμόρφωσης που παρέχει ρυθμίσεις χρόνου λειτουργίας σχεδόν σε κάθε άλλο συστατικό υπερφορτώθηκε και μπήκε σε έναν επαναλαμβανόμενο κύκλο επανεκκίνησης. Επειδή τόσες πολλές υπηρεσίες εξαρτώνται από αυτό, τα αποτελέσματα ήταν ευρεία: σελίδες κονσόλας, όπως πολιτικές προστασίας, απόψεις στάσης, αρχεία καταγραφής δραστηριοτήτων, API απογραφή, και προσαρμοσμένη πολιτική απέτυχε να φορτώσει ή χρονομέτρηση, και κατάντη επεξεργασία σταματήσει, ενώ περιμένει για τη διαμόρφωση δεν θα μπορούσε να αποκτήσει. # ** Επιπτώσεις πελατών ** Η υστέρηση των καταναλωτών αυξήθηκε κατά την ομαλοποίηση, την ομαδοποίηση, την ανίχνευση ανωμαλιών, την παραγωγή και τα σχετικά στάδια επεξεργασίας. ** Απαγόρευση ** Αρκετοί ενδιάμεσοι μετριασμοί επιπλέον ΚΜΕ και μνήμη, χαλαροί υγειονομικοί έλεγχοι κατώτατα όρια, μια επανεκκίνηση της βάσης δεδομένων, και μια μεγαλύτερη πισίνα σύνδεσης βελτιώθηκε το ζήτημα. Απενεργοποιώντας το νέο χαρακτηριστικό και στις δύο πληγείσες περιοχές, αποκαταστάθηκε απότομα και επισφαλώς. Το περιστατικό επιλύθηκε στις 17:29 UTC. ** Προληπτικές ενέργειες ** Οι ακόλουθες ενέργειες δεσμεύονται και εντοπίζονται εσωτερικά μέχρι την ολοκλήρωση. Το χαρακτηριστικό που πυροδότησε αυτό το περιστατικό παραμένει απενεργοποιημένο και δεν θα ενεργοποιηθεί εκ νέου έως ότου ολοκληρωθεί και επικυρωθεί η παρακάτω εργασία. \"Δράση\"
Αυτόματη μετάφραση από την επίσημη ενημέρωση του συμβάντος.
We are currently investigating a Harness component that is experiencing issues. We are working to identify the cause and restore normal operations as soon as possible.
We are continuing to investigate this issue.
The issue has been identified and a fix is being implemented.
This incident has been resolved.
## Summary Customers on Prod1, Prod2, and Prod3 \(US\) clusters experienced failures when loading SEI 2.0 dashboards on August 6, 2026, from 7:22 AM PDT to 9:03 AM PDT. Customers calling the SEI 2.0 API also experienced similar failures. No customer data was lost, and ingestion of all integration data continued to work uninterrupted. SEI customers using 1.0 were not impacted. ## Root Cause The incident was caused by resource exhaustion on the nodes serving queries. This resource degradation developed in a pattern that did not cross our existing alerting thresholds early enough to provide sufficient warning or allow mitigation before customer impact occurred. ## Impact Customers on Prod1, Prod2, and Prod3 \(US\) clusters were unable to load SEI 2.0 dashboards during the incident window. **Duration:** August 6, 2026, 7:22 AM PDT – 9:03 AM PDT \(~1 hour 41 minutes\) ### What was not impacted? * Data ingestion and processing * SEI 1.0 customers * Integrations and metadata flows No customer data was lost. ## Remediation Upon identifying the root cause, our team took immediate corrective action by adding capacity to restore the affected systems. Services were fully recovered, and all dashboards resumed normal operation at 9:03 AM PDT. ## Action Items To prevent from such issues happening again, Harness is/has Proactively added capacity updates have been applied to prevent this issue from recurring #### Enhanced Monitoring and Alerting Additional monitoring and alerting have been put in place to detect anomalies early, focused on a leading indicator, which in this case was thread pool exhaustion, before they can impact dashboard availability and data rendering. #### System Patch in Progress We are working with our vendor to apply a patch to remediate this and similar issues completely.
Παρακολουθούμε τους εγκλωβισμένους αγωγούς στο προϊόν 2. Οι νέες εκτελέσεις περνούν καθώς παρακολουθούμε συνεχώς τις υπηρεσίες.
Παρακολουθούμε τους εγκλωβισμένους αγωγούς στο προϊόν 2. Για τους πελάτες που βλέπουν ακόμα κολλημένους αγωγούς, σας ζητάμε να ματαιώσετε και να ενεργοποιήσετε εκ νέου.
Το περιστατικό λύθηκε.
\"Περίληψη\" Στις 6 Αυγούστου 2026 \(πρωί PDT\), ορισμένοι πελάτες που εκτελούσαν αγωγούς στο περιβάλλον παραγωγής Prod2 παρατήρησαν εκτελέσεις αγωγών που σταμάτησαν να σημειώνουν πρόοδο — στάδια που δεν προχώρησαν και δεν παρήγαγαν περαιτέρω ενημερώσεις για την παραγωγή ή την κατάσταση. Το ζήτημα αναφέρθηκε από επηρεαζόμενους πελάτες. Οι μηχανικοί του Harness εντόπισαν την αιτία, μείωσαν την πρόσκρουση και οι εκτελέσεις των αγωγών επέστρεψαν στην κανονική λειτουργία. Το ζήτημα προκλήθηκε από μια έκφραση αυτοαναφορικού αγωγού. Ένα webhook Git ενεργοποίησε έναν αγωγό που αναφερόταν στο περιεχόμενο του ωφέλιμου φορτίου webhook, και το ίδιο το ωφέλιμο φορτίο περιείχε περαιτέρω αντίγραφα της ίδιας έκφρασης. Κατά συνέπεια, κάθε γύρος ψηφίσματος έκφρασης παρήγαγε περισσότερες εκφράσεις για την επίλυση, διπλασιάζοντας το ποσό της εργασίας κάθε φορά. Το γεγονός αυτό εξάντλησε τους πόρους του σεμιναρίου για την επεξεργασία αυτής της εκτέλεσης, καθώς και άλλες εκτελέσεις που είχαν ανατεθεί στην ίδια περίπτωση δεν ήταν σε θέση να προοδεύσουν όσο βρισκόταν σε αυτή την κατάσταση. Impact ** Impact ** Κατά τη διάρκεια του παραθύρου συμβάντος \ (περίπου 6:11 ΠΜ έως 11:23 ΠΜ PDT στις 6 Αυγούστου 2026\): * Ορισμένες εκτελέσεις αγωγών πελατών στο Prod2 καθυστέρησαν τη μέση εκτέλεση και δεν σημείωσαν περαιτέρω πρόοδο. * Οι επηρεαζόμενες εκτελέσεις δεν παρήγαγαν κανένα νέο βήμα εξόδου ή ενημερώσεις κατάστασης, και έπρεπε να ματαιωθεί και να επαναληφθεί μετά τον μετριασμό. * Η συμπεριφορά περιοριζόταν σε εκτελέσεις που διεκπεραιώθηκαν από την θιγόμενη περίπτωση παροχής υπηρεσιών — οι αγωγοί που χειρίζονταν άλλες περιπτώσεις εξακολούθησαν να εκτελούνται κανονικά. Δεν υπήρξε ** απώλεια δεδομένων **. Οι ορισμοί των αγωγών, το ιστορικό εκτέλεσης και η αποθηκευμένη κατάσταση δεν επηρεάστηκαν. Η πλειοψηφία των αγωγών στο Prod2 συνέχισε να εκτελεί επιτυχώς καθ' όλη τη διάρκεια του συμβάντος· ο πρωταρχικός αντίκτυπος ήταν ότι ορισμένες εκτελέσεις κατά την πτήση δεν μπορούσαν να ολοκληρωθούν και έπρεπε να επαναλειτουργήσουν μόλις μετριαστεί το ζήτημα. Αιτίες για τα σκουπίδια Οι αγωγοί Harness υποστηρίζουν εκφράσεις που επιλύονται στο χρόνο λειτουργίας — για παράδειγμα, μια έκφραση που εισάγει το περιεχόμενο του ωφέλιμου φορτίου ζεύξης Git που ενεργοποίησε τον αγωγό. Στην περίπτωση αυτή, ένα μήνυμα δέσμευσης Git περιείχε το κυριολεκτικό κείμενο της ίδιας της έκφρασης ωφέλιμο φορτίο, δύο φορές, και ο αγωγός ανέφερε την ίδια έκφραση ωφέλιμου φορτίου. Επειδή το μήνυμα της δέσμευσης αποτελεί μέρος του ωφέλιμου φορτίου του webhook, η επίλυση της έκφρασης εισήγαγε ολόκληρο το ωφέλιμο φορτίο — περιλαμβανομένων και των δύο κυριολεκτικών αντιγράφων της έκφρασης που μεταφέρει το μήνυμα της δέσμευσης. Στη συνέχεια, τα νέα αυτά αντίγραφα αντιμετωπίστηκαν ως εκφράσεις προς επίλυση, και κάθε πέρασμα εισήγαγε δύο ακόμη πλήρη αντίγραφα του ωφέλιμου φορτίου. Το μέγεθος της αξίας που επεξεργάζεται, και το έργο που απαιτείται για την επεξεργασία της, ως εκ τούτου διπλασιάστηκε σε κάθε πάσα και αυξήθηκε εκθετικά παρά συγκλίνει. Harness έχει μια προστασία που προορίζεται να σταματήσει ακριβώς αυτό: ανάλυση έκφρασης οριοθετείται από ένα μέγιστο βάθος φωλιάσματος, πέρα από το οποίο η ανάλυση σταματά και ο αγωγός αποτυγχάνει με ένα σαφές λάθος. Ένα ελάττωμα αυτής της διασφάλισης σήμαινε ότι το όριο δεν εφαρμοζόταν σε αυτή τη συγκεκριμένη περίπτωση αυτοαναφοράς, οπότε η επίλυση συνεχίστηκε ανεξέλεγκτη. Η ανάλυση της έκφρασης συνδέεται με τα νήματα που ξεκινούν τα βήματα του αγωγού. Καθώς κάθε πέρασμα κατανάλωνε προοδευτικά περισσότερη μνήμη και CPU χωρίς ποτέ να ολοκληρωθεί, η περίπτωση υπηρεσίας που εκτελούσε αυτή την εργασία σταμάτησε να κάνει πρόοδο, και κάθε εκτέλεση που είχε ανατεθεί σε αυτή την περίπτωση καθυστέρησε — κάτι που ανέφεραν οι πελάτες. ¶ ¶ ¶ ¶ Η Harness ολοκλήρωσε τα ακόλουθα άμεσα βήματα μετριασμού: * Αναγνωρίστηκε ο αγωγός και το πρότυπο έκφρασης που είναι υπεύθυνο για το δραπέτη ψήφισμα. * Σταμάτησε την επηρεαζόμενη περίπτωση υπηρεσίας ώστε να μην χρειαστεί περαιτέρω εργασία. Οι εναπομείναντες υγιείς περιπτώσεις μάζευαν και επεξεργάζονταν εκτελέσεις σε ουρές κανονικά. * Επιβεβαιώθηκε ότι οι εκτελέσεις του αγωγού επέστρεψαν στο φυσιολογικό και έκλεισαν το περιστατικό. Αυτές οι ενέργειες αποκατέστησαν την κανονική συμπεριφορά εκτέλεσης του αγωγού και διέλυσαν τον αντίκτυπο που αντιμετώπιζε ο πελάτης. ** Στοιχεία δράσης ** Για να μειωθεί ο κίνδυνος επανεμφάνισης και να βελτιωθεί η ανίχνευση, οι ακόλουθες δράσεις βρίσκονται σε διάφορα στάδια υλοποίησης: * Καθορίστε το ελάττωμα στην έκφραση βάθος και ανίχνευση βρόχου-προφύλαξη έτσι ώστε αυτο-αναφορικές εκφράσεις πιάνονται και αποτυγχάνουν γρήγορα με ένα σαφές λάθος αντί της κατανάλωσης πόρων χωρίς δέσμευση. * Αποτρέπουμε τις εκφράσεις payload να επιλυθούν από το περιεχόμενο του payload ενεργοποίησης, αφαιρώντας εντελώς την αυτοαναφορική διαδρομή. * Σφίξε το μέγιστο βάθος φωλεοποίησης έκφρασης και αξιολόγησε σαφή ανίχνευση βρόχου εκτός από το υπάρχον όριο βάθους. * Ενισχύστε τις αυτοματοποιημένες δοκιμές σε περιβάλλοντα προ-παραγωγής που αναπαράγουν μοτίβα αυτο-αναφορικής έκφρασης και επαληθεύστε ότι η προστασία τους ανιχνεύει και τους σταματά. * Προσθέστε την παρακολούθηση για αυτό το μοτίβο σε εκτελέσεις αγωγών, έτσι ώστε να ανιχνεύεται προληπτικά.
Αυτόματη μετάφραση από την επίσημη ενημέρωση του συμβάντος.
We are currently investigating this issue.
We are continuing to investigate this issue.
We have identified the issue and started to implement the fix , prod2 is restored.
We are continuously rolling out fixes to all Clusters, Prod EU1 has been resolved.
We are continuously rolling out fixes to all Clusters, Prod3 has been resolved.
This incident has been resolved.
# Executive Summary On August 4, 2026, between approximately 3:36 PM and 9:00 PM IST, customers using Infrastructure as Code Management \(IaCM\) on Prod0 and Prod1 were unable to access the Variable Sets settings page. The page rendered blank with no error message, and customers with Variable Sets attached to their workspaces could not view or manage them for the duration of the incident. Prod2, Prod3, and EU1 were not affected. Separately, during the same window, a scheduled maintenance action caused the IaCM settings tab to temporarily disappear across all environments. This was identified and reversed within the incident bridge call before significant customer impact occurred. We deployed a hotfix that restored full access to the Variable Sets page on Prod0 and Prod1 the same evening, and we are implementing permanent safeguards described below to prevent this class of issue from recurring. # Impact * Customers with the Variable Sets feature enabled on Prod0 and Prod1 were unable to view or manage Variable Sets for approximately 5–6 hours. * No data was lost or corrupted, this was a UI routing failure only; underlying Variable Sets data and configuration were not affected. * Prod2, Prod3, and EU1 were not affected by this issue. * A secondary issue, a scheduled feature flag operation caused the IaCM settings tab to temporarily disappear across all environments during the incident bridge call. This was identified and reversed within minutes. External customer exposure for this secondary issue is still being confirmed. # Root Cause A platform routing change released on July 18, 2026 updated how IaCM settings pages are resolved in the user interface. As part of that change, any settings page that had not been explicitly re-registered in the new routing structure became unreachable. The Variable Sets page had not been re-registered under the new routing structure, making it inaccessible in the environments where the routing change had been deployed — Prod0 and Prod1. Because the failure occurred at the routing layer rather than within the page itself, the page rendered blank with no visible error rather than showing a clear failure message. # Remediation ## Immediate We deployed a hotfix that re-registered the Variable Sets page in the updated routing structure, restoring access for all affected customers on Prod0 and Prod1. ## Permanent We are adding automated end-to-end tests that navigate to settings pages with relevant feature flags enabled, configured as a required gate in our release pipeline. We are also documenting and enforcing the routing constraint through static analysis so that settings pages are never inadvertently left out of the routing structure during future platform changes. # Action Items To prevent such issues from happening again, 1. Enhance automated tests, that navigate to settings pages with relevant feature flags enabled, configured as a blocking gate in the release pipeline, so this class of regression is caught before it reaches production. 2. Establish an explicit checklist step for future platform-wide architectural changes that verifies all existing settings pages remain accessible in the updated routing structure before the change is promoted to production.
Αυτή τη στιγμή ερευνούμε αυτό το ζήτημα.
Εφαρμόστηκε μια ρύθμιση και παρακολουθούμε τα αποτελέσματα.
Το περιστατικό λύθηκε.
Αυτόματη μετάφραση από την επίσημη ενημέρωση του συμβάντος.
Αυτή τη στιγμή ερευνούμε αυτό το ζήτημα.
Το θέμα έχει εντοπιστεί και υλοποιείται μια λύση.
Εφαρμόστηκε μια ρύθμιση και παρακολουθούμε τα αποτελέσματα.
Το περιστατικό λύθηκε.
# **Περίληψη ** Μεταξύ 25 Ιουλίου και 4 Αυγούστου 2026, ταμπλό εκτέλεσης αγωγών και σελίδες επισκόπησης στο Harness Prod 2 και Prod 3 συστάδες παρουσίαζε δεδομένα που ήταν μεταξύ πίσω από πραγματικό χρόνο. Οι ίδιοι οι αγωγοί συνέχισαν να κατασκευάζουν, να αναπτύσσουν και να εκτελούν κανονικά καθ' όλη τη διάρκεια· το ζήτημα περιορίστηκε στο πόσο γρήγορα αντιγράφονταν τα αρχεία εκτέλεσης στη βάση δεδομένων που εξυπηρετεί την αναφορά και τις απόψεις του ταμπλό. ** Δεν χάθηκαν δεδομένα πελατών. ** Κάθε προσβεβλημένη εγγραφή παρέμεινε αποθηκευμένη και επαναπροβλήθηκε στο datastore ανάλυσης μόλις αφαιρέθηκε ο υποκείμενος περιορισμός. Η Harness μετανάστευσε τις πληγείσες συστάδες σε μια οριζόντια κλιμακούμενη, υποστηριζόμενη από την ουρά έκδοση του συστατικού αντιγραφής την 1η Αυγούστου 2026 και ολοκλήρωσε στοχευμένες ανακλάσεις δεδομένων για όλους τους θιγόμενους λογαριασμούς. # ** Αιτίες για τα σκουπίδια ** Η Harness διατηρεί ένα στοιχείο δέσμευσης δεδομένων αλλαγής που αναπαράγει συνεχώς αρχεία εκτέλεσης αγωγών από το κύριο επιχειρησιακό datastore σε ένα ξεχωριστό datastore χρονοσειρών βελτιστοποιημένο για ταμπλό και ερωτήματα αναφοράς. Οι πίνακες διαβάζονται αποκλειστικά από το datastore της αναλυτικής. Όταν η αντιγραφή πέφτει πίσω, τα ταμπλό καθιστούν μια ακριβή αλλά παλαιότερη άποψη του κόσμου, ενώ η ίδια η εκτέλεση δεν επηρεάζεται. Αυτό προκλήθηκε από απότομη, συνεχή αύξηση του όγκου της βάσης δεδομένων γράψτε από μια άλλη μονάδα πλατφόρμα Harness μοιράζονται την ίδια διαδρομή αντιγραφής ξεπέρασε το ανώτατο όριο διέλευσης της παλαιότερης, ενιαία έκδοση του εν λόγω συστατικού που λειτουργεί ακόμα σε Prod 2 και Prod 3. Ένα backlog σχηματίστηκε και μεγάλωσε. ** Προληπτικές ενέργειες ** Ο Harness έχει ολοκληρώσει ή δεσμευτεί στις ακόλουθες ενέργειες για την πρόληψη τέτοιων θεμάτων. \"Δράση\"
Αυτόματη μετάφραση από την επίσημη ενημέρωση του συμβάντος.
Αυτή τη στιγμή ερευνούμε αυτό το ζήτημα.
Το θέμα έχει εντοπιστεί και υλοποιείται μια λύση.
Εφαρμόστηκε μια ρύθμιση και παρακολουθούμε τα αποτελέσματα.
Το περιστατικό λύθηκε.
# **Περίληψη ** Στις 31 Ιουλίου 2026, τα ανεβάσματα τεχνουργημάτων που πραγματοποιήθηκαν μέσω αγωγού στη συστάδα EU1 άρχισαν να αποτυγχάνουν με σφάλμα ταυτοποίησης. Οι μεταφορτώσεις που ξεκίνησαν χειροκίνητα \(έξω από έναν αγωγό\) δεν επηρεάστηκαν, και η δυνατότητα ανάκτησης των υπαρχόντων τεχνουργημάτων \(κατεβάσματα\) δεν επηρεάστηκε επίσης — αυτό απομονώθηκε στην συγκεκριμένη διαδρομή αποστολής του αγωγού σε ένα σμήνος. # * * * Impact * * * Τα uploads Artifact πραγματοποιήθηκαν μέσω αγωγών στη συστάδα EU1 απέτυχαν με σφάλμα ταυτοποίησης για περίπου 4 ώρες και 34 λεπτά. * Η ανάκτηση των υπαρχόντων τεχνουργημάτων \(downloads\) δεν επηρεάστηκε. * Η χειροκίνητη αποστολή τεχνουργημάτων εκτός αγωγού δεν επηρεάστηκε. * Άλλες συστάδες/περιφέρειες δεν επηρεάστηκαν από αυτό το θέμα. # ** Αιτία Root ** Το κατασκευαστικό στοιχείο που είναι υπεύθυνο για τη διαχείριση των ανεβάσεων τεχνουργημάτων με βάση αγωγού διανέμεται ως εικόνα εμπορευματοκιβωτίου. Στη συστάδα EU1, η εικόνα αυτή ανακτάται από ένα εσωτερικό μητρώο που καθρεφτίζει μια δημόσια πηγή εικόνας· σε άλλες συστάδες, η ίδια εικόνα ανακτάται απευθείας από τη δημόσια πηγή. Ένα σφάλμα δημοσίευσης στη διαδικασία κυκλοφορίας μας προκάλεσε μια νέα κατασκευή αυτού του συστατικού να δημοσιευθεί χρησιμοποιώντας μια ετικέτα έκδοσης που ήταν ήδη σε χρήση, αντί να ανατεθεί μια νέα, μοναδική έκδοση. Ως αποτέλεσμα, δύο διαφορετικές εικόνες κατέληξαν να συνδέονται με την ίδια ετικέτα έκδοσης στη δημόσια πηγή. Το εσωτερικό μας μητρώο καθρεφτίζει εικόνες από τη δημόσια πηγή μέσω μιας αυτοματοποιημένης διαδικασίας αντιγραφής. Λόγω του τρόπου με τον οποίο ενεργοποιήθηκε αυτή η αντιγραφή, αντέγραψε την αρχική εικόνα \(earlier\) που σχετίζεται με αυτή την ετικέτα έκδοσης και όχι τη διορθωμένη. Αυτό σήμαινε ότι η συστάδα της ΕΕ1 —η οποία αντλεί από το εσωτερικό κάτοπτρο — κατέληξε να λειτουργεί μια διαφορετική, ελαττωματική εικόνα από άλλες συστάδες, οι οποίες αντλούν απευθείας από τη δημόσια πηγή και ως εκ τούτου έλαβαν τη διορθωμένη εικόνα. Η ελαττωματική εικόνα περιείχε ένα ζήτημα ταυτοποίησης που προκάλεσε την αποτυχία των ανεβάσεων του αγωγού. # * * * Mitigation ** * Επανέστρεψε τον επηρεαζόμενο λογαριασμό στην τελευταία γνωστή-καλή έκδοση του συστατικού αποστολής, αποκαθιστώντας αμέσως τα ανεβάσματα του αγωγού. * Δημοσιεύθηκε μια διορθωμένη, μόνιμη έκδοση του συστατικού για την επίλυση του ζητήματος σε όλες τις συστάδες. # ** Επόμενα βήματα ** * Επιδιορθώστε το βήμα αποστολής για να αφαιρέσετε το υποκείμενο ελάττωμα που σχετίζεται με το δοχείο που έκανε αυτή τη λειτουργία αποτυχίας δυνατή. * Ενημέρωση αγωγό απελευθέρωσης μας για αυτό το συστατικό έτσι ώστε η δημοσίευση μιας εικόνας δεν μπορεί ποτέ να αντικαταστήσει μια υπάρχουσα έκδοση — κάθε δημοσίευση πρέπει να δημιουργήσει μια νέα, ξεχωριστή έκδοση πηγαίνει προς τα εμπρός.
Αυτόματη μετάφραση από την επίσημη ενημέρωση του συμβάντος.
Περίληψη - Αντιμετωπίζουμε διαλείποντα προβλήματα συνδεσιμότητας δικτύου με το Build VM να αδυνατεί να συνδεθεί με εξωτερικούς πόρους. Αυτή τη στιγμή ερευνούμε το θέμα.
Εφαρμόστηκε μια ρύθμιση και παρακολουθούμε τα αποτελέσματα.
Συνεχίζουμε να παρακολουθούμε για τυχόν περαιτέρω ζητήματα.
Το περιστατικό λύθηκε.
## Summary Starting on August 4, 2026, CI runners in the us-west1 and us-central1 regions intermittently experienced connection timeouts of approximately 134 seconds when reaching external services such as GitHub and Bitbucket over outbound network gateways. ## Impact * CI runners in the affected regions intermittently experienced connection timeouts of approximately 134 seconds when reaching external services \(e.g., GitHub, Bitbucket\) over our outbound network gateways. * The issue was intermittent rather than constant — connections succeeded under normal load, and failures clustered during periods of high outbound traffic volume. * No data was lost or corrupted. This was a network-connectivity and capacity issue, not a data-integrity issue. * us-west1 and us-central1 were the affected regions; other regions were not impacted by this issue. ## Root Cause Our load balancer distributes outbound traffic across multiple NAT gateways using a hashing method based on connection details \(source/destination address and port\). For any single connection, these details stay constant for that connection's lifetime. We had a sustainted traffic surge for a few seconds which congested the gateways ## Action Items To prevent such issues from happening again Harness will, Increase outbound connection capacity on our NAT gateways by provisioning additional external network interfaces, giving each gateway a substantially larger pool of connections it can serve concurrently..
Αυτόματη μετάφραση από την επίσημη ενημέρωση του συμβάντος.
Αυτή τη στιγμή ερευνούμε αυτό το ζήτημα.
Εφαρμόστηκε μια ρύθμιση και παρακολουθούμε τα αποτελέσματα.
Το περιστατικό λύθηκε.
Αυτόματη μετάφραση από την επίσημη ενημέρωση του συμβάντος.
Αυτή τη στιγμή ερευνούμε αυτό το ζήτημα.
Συνεχίζουμε να ερευνούμε αυτό το ζήτημα.
Το θέμα έχει εντοπιστεί και υλοποιείται μια λύση.
Συνεχίζουμε να εργαζόμαστε πάνω σε μια λύση για αυτό το ζήτημα.
Εφαρμόστηκε μια ρύθμιση και παρακολουθούμε τα αποτελέσματα.
Συνεχίζουμε να παρακολουθούμε για τυχόν περαιτέρω ζητήματα.
Το περιστατικό λύθηκε.
# Περίληψη Κατά τη διάρκεια μιας πρόσφατης ανάπτυξης της παραγωγής, ένα ελάττωμα στην εσωτερική ανάπτυξη μας προκάλεσε δύο κρίσιμες υπηρεσίες να λειτουργήσουν με λανθασμένες, μη παραγωγικές τιμές διαμόρφωσης στο περιβάλλον παραγωγής μας Αυτό οδήγησε σε ένα σχετικό σύνολο τεσσάρων διακριτών συμπτωμάτων: λανθασμένη συμπεριφορά διαμόρφωσης, διαλείπουσες αστοχίες σύνδεσης/πρόσβασης, ένα θέμα πρόσβασης filestore που επηρεάζει ένα περιβάλλον πελατών, και καθυστερήσεις ενημερώσεις κατάσταση του αγωγού στο UI. Έχουμε εντοπίσει και εφαρμόζουμε μια μόνιμη ρύθμιση για το υποκείμενο ελάττωμα διαμόρφωσης, και έχουμε ήδη θέσει σε εφαρμογή αλλαγές πόρων και ικανοτήτων που επιλύουν το σύμπτωμα καθυστέρησης UI. Σε κανένα σημείο κατά τη διάρκεια αυτού του περιστατικού δεν χάθηκαν οι ίδιες εκτελέσεις των αγωγών, αλλοιώθηκαν, ή έφυγαν σε μια κολλημένη κατάσταση. Όπου η συμπεριφορά εκτέλεσης επηρεάστηκε, περιορίστηκε σε καθυστερήσεις στην ορατότητα κατάστασης, όχι στην υποκείμενη επεξεργασία. Λεπτομέρειες περιστατικού Εφαρμόζονται λανθασμένες τιμές διαμόρφωσης παραγωγής . . . . Η ομάδα μας επιβεβαίωσε ένα ελάττωμα στον αγωγό εγκατάστασης του διαχειριστή υπηρεσιών που προκάλεσε την ανάπτυξη συγκεκριμένων υπηρεσιών παραγωγής χρησιμοποιώντας τιμές διαμόρφωσης που προορίζονται για διαφορετικό περιβάλλον, και όχι τη σωστή διαμόρφωση παραγωγής. ** Αιτία Root ** Η υπηρεσία που είναι υπεύθυνη για την ανάκτηση παρακάμψεων ρυθμίσεων κατά τη διάρκεια της ανάπτυξης διερωτάται ένα εσωτερικό API που επιστρέφει το πολύ 1.000 αποτελέσματα ανά αίτημα. Ο συνολικός αριθμός των υπηρεσιών στο περιβάλλον αυξήθηκε πρόσφατα πέρα από αυτό το όριο. Ως αποτέλεσμα, οποιαδήποτε υπηρεσία πέρα από τα πρώτα 1.000 που επιστράφηκαν δεν συμπεριλήφθηκε στην απάντηση, και ο αγωγός ανάπτυξης υποχώρησε σιωπηλά στις προεπιλεγμένες τιμές διαμόρφωσης για αυτές τις υπηρεσίες. Αυτό είναι ένα επιβεβαιωμένο ελάττωμα στη διαδικασία ανάπτυξης, όχι ένα ζήτημα με τις ίδιες τις τιμές διαμόρφωσης. ** Λύση ** Το μηχανοστάσιο επιβεβαίωσε τον μηχανισμό και εφαρμόζει μια μόνιμη ρύθμιση για να εξαλείψει αυτό το κενό που σχετίζεται με τα όρια στον αγωγό ανάπτυξης. Διαλείπουσα Είσοδος / Αποτυχίες Πρόσβασης Κατά τη διάρκεια της εγκατάστασης Service Manager που αναφέρεται παραπάνω, ορισμένοι χρήστες παρουσίασαν διαλείπουσες βλάβες σύνδεσης ή πρόσβασης. Στο πλαίσιο της κανονικής λειτουργίας, οι προηγούμενες περιπτώσεις λειτουργίας θα πρέπει να συνεχίσουν να εξυπηρετούν την κυκλοφορία χωρίς διακοπή, ενώ μια νέα ανάπτυξη βρίσκεται σε εξέλιξη. Σε αυτό το περιστατικό, αυτή η εφεδρική συμπεριφορά δεν συνέβη όπως αναμενόταν, συμβάλλοντας σε αποτυχίες πρόσβασης κατά τη διάρκεια του παραθύρου ανάπτυξης. Θέμα πρόσβασης στο Filestore Εντοπίστηκε ένα θέμα πρόσβασης σε filestore που ήταν συγκεκριμένο για το περιβάλλον Prod-3 και επηρέασε το περιβάλλον ενός μόνο πελάτη. ** Αιτία Root ** Αυτό σχετίζεται με μια ρύθμιση άδειας IAM / αποθήκευσης-ταμιευτήρα στο διαχειριστή υπηρεσιών, που ενδέχεται να πυροδοτηθεί από την αναδρομική δραστηριότητα. . . Καθυστερημένη κατάσταση εκτέλεσης αγωγών σε UI Ορισμένοι χρήστες παρατήρησαν ότι το γράφημα εκτέλεσης του αγωγού στο UI ήταν αργό να ανανεωθεί και δεν αντανακλούσε αμέσως την τελευταία κατάσταση. Σημαντικά, αυτή ήταν μόνο μια καθυστέρηση ορατότητας: δεν υπήρξε αντίκτυπος σε πραγματικές εκτελέσεις αγωγών, και καμία εκτέλεση δεν κόλλησε ή απέτυχε ως αποτέλεσμα αυτού του ζητήματος. ** Αιτία Root ** Το γράφημα εκτέλεσης του αγωγού βασίζεται σε ένα ρεύμα μηνύματος \(το αρχείο καταγραφής ενορχήστρωσης\) για να λαμβάνετε ενημερώσεις κατάστασης. Κατά τη διάρκεια του παραθύρου του συμβάντος, η επεξεργασία του ρεύματος αυτού από τον καταναλωτή έμεινε πίσω \(υψηλή υστέρηση καταναλωτή\), γεγονός που καθυστέρησε το πόσο γρήγορα οι ενημερώσεις κατάστασης έφτασαν στο UI. Αυτό προκλήθηκε από το γεγονός ότι η υποκείμενη βάση δεδομένων βρισκόταν στη μέση μιας προγραμματισμένης λειτουργίας κλιμάκωσης ταυτόχρονα, και μια αύξηση της κυκλοφορίας κατά τη διάρκεια αυτού του παραθύρου επιδείνωσε περαιτέρω την καθυστέρηση. Οι χρήστες το βίωσαν αυτό ως φαινομενική βραδύτητα του αγωγού, παρόλο που οι υποκείμενες εκτελέσεις εκτελούσαν κανονικά. ** Λύση ** Έχουμε αυξήσει την ικανότητα των πόρων για τα επηρεαζόμενα συστατικά για να διατηρήσει περισσότερο από 50% εφεδρική headroom πηγαίνει προς τα εμπρός, μειώνοντας την ευαισθησία σε παρόμοιες αιχμές φορτίου. Αυτή η αλλαγή έχει υλοποιηθεί και επί του παρόντος επικυρώνεται ως μέρος της μακροπρόθεσμης σκλήρυνσης για αυτό το μέρος της πλατφόρμας. Περίληψη αντίκτυπου * Service Manager και License Manager έτρεξε με λανθασμένες τιμές διαμόρφωσης στα περιβάλλοντα Prod-1 και Prod-3. * Μερικοί χρήστες παρουσίασαν διαλείπουσες αποτυχίες σύνδεσης ή πρόσβασης κατά τη διάρκεια του θιγόμενου παραθύρου ανάπτυξης. * Ένα περιβάλλον πελατών στο Prod-3 βίωσε ένα θέμα πρόσβασης filestore. * Οι χρήστες σε περιβάλλοντα που επηρεάστηκαν είδαν καθυστερημένες ενημερώσεις για την κατάσταση εκτέλεσης του αγωγού στο UI. # Προληπτικές ενέργειες Εντοπίστηκαν τα ακόλουθα διορθωτικά και προληπτικά μέτρα. Αναγνωρίζουμε τον αντίκτυπο που είχε αυτό το περιστατικό σε πολλούς τομείς της πλατφόρμας και εκτιμούμε την υπομονή σας καθώς εργαζόμαστε μέσω μιας πλήρους επίλυσης.
Αυτόματη μετάφραση από την επίσημη ενημέρωση του συμβάντος.
Ερευνούμε ένα θέμα που επηρεάζει τα ταμπλό του AIDI. Οι χρήστες μπορεί να βιώσουν αυξημένο χρόνο φόρτωσης ή διαλείπουσες αστοχίες κατά την πρόσβαση σε ταμπλό. Η ομάδα μας εργάζεται ενεργά για να εντοπίσει τη βασική αιτία και να αποκαταστήσει την κανονική απόδοση. Θα παρέχουμε ενημερώσεις καθώς θα γίνονται διαθέσιμες περισσότερες πληροφορίες.
Το θέμα έχει εντοπιστεί και υλοποιείται μια λύση.
Εφαρμόστηκε μια ρύθμιση και παρακολουθούμε τα αποτελέσματα.
Το περιστατικό λύθηκε.
Περίληψη Οι πελάτες σε Prod1, Prod2, και Prod3 συστάδες παρουσίασαν διαλείπουσες αστοχίες φορτίου widget και αυξημένο χρόνο φόρτωσης κατά την πρόσβαση στα ταμπλό AIDI 2.0 στις 22 Ιουλίου 2026. Δεν επηρεάστηκαν όλα τα widgets ταυτόχρονα το ζήτημα που εκδηλώθηκε ως σποραδικές αποτυχίες και όχι μια πλήρης διακοπή. Δεν χάθηκαν δεδομένα πελατών. Οι πελάτες του SEI 1.0 δεν επηρεάστηκαν. Αιτία ρίζας Με την πάροδο του χρόνου, μια διαδικασία συντήρησης της βάσης δεδομένων ρουτίνας απέτυχε να τρέξει σε ορισμένους πίνακες στη βάση δεδομένων μας ανάλυσης, προκαλώντας αυτούς τους πίνακες να συσσωρεύσουν ένα μεγάλο όγκο εσωτερικών μεταδεδομένων που χρησιμοποιούνται για την παρακολούθηση διαγραμμένων αρχείων. Όταν η βάση δεδομένων σχεδίαζε ερωτήματα εναντίον αυτών των πινάκων, φόρτωσε όλα αυτά τα συσσωρευμένα μεταδεδομένα στη μνήμη, προκαλώντας τη χρήση μνήμης στους επηρεαζόμενους κόμβους να καρφωθούν επανειλημμένα. Αυτές οι επαναλαμβανόμενες αιχμές πυροδότησαν έναν αυτόματο μηχανισμό ασφάλειας που επανεκκινεί έναν κόμβο όταν ανιχνεύει υπερβολική πίεση μνήμης, και οι επηρεαζόμενοι κόμβοι άρχισαν να επανεκκινούν σε ένα βρόχο ως αποτέλεσμα. Αυτό προκάλεσε διαλείπουσα, υποβαθμισμένη απόδοση ερωτήματος στα ταμπλό AIDI 2.0 για τη διάρκεια του περιστατικού. Σύγκρουση Οι πελάτες σε Prod1, Prod2, και Prod3 συστάδες μπορεί να έχουν βιώσει διαλείπουσες αστοχίες φορτίου widget ή αυξημένο χρόνο φόρτωσης στα ταμπλό AIDI 2.0. **Duration: ** July 22, 2026, 07:58 PDT – 16:16 PDT \(~8 ώρες 18 λεπτά\), με διαλείπουσες αστοχίες widget; το σύστημα επανεκκινήθηκε και υπό ενεργή παρακολούθηση από 08:25 PDT και μετά. Τι δεν επηρεάστηκε; * Κατάποση και επεξεργασία δεδομένων * SEI 1.0 πελάτες * Ενσωματώσεις και ροές μεταδεδομένων Δεν χάθηκαν δεδομένα πελατών. . . . Αποκατάσταση Μετά τον εντοπισμό του θέματος, οι επηρεαζόμενοι κόμβοι βάσης δεδομένων επανεκκινήθηκαν στις 08:25 PDT, η οποία αποκατέστησε την αρχική σταθερότητα. Συνεχίσαμε να παρακολουθούμε στενά το σύστημα, και όταν η διαλείπουσα υποβάθμιση παρατηρήθηκε ακόμη μετά, εφαρμόσαμε αρκετές πρόσθετες διορθώσεις: * Ρυθμισμένες ρυθμίσεις ρύθμισης της βάσης δεδομένων για τον περιορισμό της ποσότητας της μνήμης που χρησιμοποιείται για την επεξεργασία συσσωρευμένων μεταδεδομένων, και συντονισμένες ρυθμίσεις σχεδιασμού ερωτημάτων για τη μείωση της πίεσης μνήμης. * Ran εργασίες καθαρισμού για να μειώσει το παρελθόν των συσσωρευμένων μεταδεδομένων στους πληγέντες πίνακες. * Αυξημένη χωρητικότητα στους επηρεαζόμενους κόμβους βάσης δεδομένων για την παροχή επιπλέον headroom. Οι αλλαγές αυτές σταθεροποίησαν σταδιακά το σύστημα, και το περιστατικό επιλύθηκε πλήρως στις 16:16 PDT. . . . Στοιχεία δράσης Για να αποτρέψουμε την επανάληψη, εφαρμόζουμε τα ακόλουθα: 1. Έχουμε αναβαθμίσει το σύστημα υποστήριξης το οποίο περιλαμβάνει υποκείμενες βελτιώσεις που χειρίζονται αιχμές μνήμης που προκαλούνται από την υπερβολική διαγραφή αρχείων. 2. Έχουμε κυκλοφορήσει αυτοματοποιημένες εργασίες συμπίεσης για νεοεισαχθέντες πίνακες για να αποτρέψουμε τη διαγραφή συσσώρευσης αρχείων προς τα εμπρός.
Αυτόματη μετάφραση από την επίσημη ενημέρωση του συμβάντος.
Αυτή τη στιγμή ερευνούμε αυτό το ζήτημα.
Το θέμα έχει εντοπιστεί και υλοποιείται μια λύση.
Εφαρμόστηκε μια ρύθμιση και παρακολουθούμε τα αποτελέσματα.
Το περιστατικό λύθηκε.
# Περίληψη Στις 17 Ιουλίου 2026, μετά από μια ανάπτυξη κώδικα ρουτίνας, οι πελάτες σε παλαιότερες εκδόσεις ανάθεσης \(858xx και κάτω\) άρχισαν να βιώνουν καθυστερημένα CI οικοδομήματα σε Harness Cloud-hosted builds χρησιμοποιώντας την παγκόσμια ικανότητα built-queueing μας. Οι επηρεαζόμενες κατασκευές γνώρισαν μια απροσδόκητη παύση έως και 8 λεπτών περίπου στο "αναμονή για την υποδομή" στάδιο πριν από τη συνέχιση, αντί να προχωρήσει εντός της αναμενόμενης υποδεύτερης φοράς. Η συνολική δόμηση της βραδύτητας ήταν διαλείπουσα. # Σύγκρουση * Όλες οι κατασκευές CI ήταν δυνητικά υπόκεινται σε καθυστέρηση; αντίκτυπος ήταν πιο έντονη για τις κατασκευές σε Harness Cloud-φιλοξενούμενη υποδομή χρησιμοποιώντας το παγκόσμιο χαρακτηριστικό κατασκευής-queueing. * Επηρεαζόμενα κτίρια βίωσε μια ανεξήγητη παύση μέχρι περίπου 8 λεπτά πριν συνεχιστούν, ακολουθούμενη από μια πιο αργή " ψυχρή εκκίνηση - δεδομένου ότι μια προ-επιφύλαξη υπολογιστική υποδοχή δεν ήταν διαθέσιμη - αυτό παρουσιάστηκε στους χρήστες ως αργή builds αντί να οικοδομήσουμε αποτυχίες. * Οι λογαριασμοί που εκτελούνται σε νεότερες εκδόσεις ανάθεση \(858xx και πάνω\) δεν επηρεάστηκαν. * Κανένα οικοδόμημα δεν απέτυχε οριστικά ως άμεσο αποτέλεσμα αυτού του ζητήματος, και δεν χάθηκαν δεδομένα. # Αιτία ρίζας Η βασική αιτία ήταν μια εσωτερική αλλαγή κώδικα που άθελά του έσπασε το πώς ένα συγκεκριμένο build-queueing εγγραφή διαβάστηκε πίσω από τη βάση δεδομένων μας κάποτε κατασκευές που είχαν ήδη τεθεί σε αναμονή κάτω από την προηγούμενη έκδοση του κώδικα συνάντησε τη νέα έκδοση. Επιλύσαμε τον άμεσο αντίκτυπο καθαρίζοντας τα επηρεαζόμενα αρχεία και επαναφέροντας την υποκείμενη αλλαγή κώδικα, και εφαρμόζουμε αρκετές διασφαλίσεις για να αποτρέψουμε την επανάληψη αυτής της κατηγορίας ζητημάτων. # Επόμενα βήματα Εκτιμούμε τον κίνδυνο μιας παρόμοιας επανάληψης τόσο χαμηλής όσο και οι ακόλουθες ενέργειες που λαμβάνονται υπόψη. Η συγκεκριμένη πορεία κώδικα που προκάλεσε αυτό το περιστατικό έχει ήδη επανέλθει, και εφαρμόζουμε διαρθρωτικές διασφαλίσεις, έτσι ώστε αυτή η γενική κατηγορία θεμάτων να μην μπορεί να επαναληφθεί, ανεξάρτητα από το πού στη βάση κώδικα θα μπορούσε να συμβεί διαφορετικά.
Αυτόματη μετάφραση από την επίσημη ενημέρωση του συμβάντος.
Αυτή τη στιγμή ερευνούμε αυτό το ζήτημα.
Το θέμα έχει εντοπιστεί και υλοποιείται μια λύση.
Εφαρμόστηκε μια ρύθμιση και παρακολουθούμε τα αποτελέσματα.
Συνεχίζουμε να παρακολουθούμε για τυχόν περαιτέρω ζητήματα.
Το περιστατικό λύθηκε.
# Περίληψη Μεταξύ 19 Ιουνίου και 17 Ιουλίου 2026, το ενσωματωμένο βήμα Git Clone — και κάθε βήμα του αγωγού χρησιμοποιώντας το πρόσθετο κλώνου drone-git — απέτυχε στο ARM64 Kubernetes οικοδομήσουμε την υποδομή με το σφάλμα exec /usr/local/bin/clone: exec σφάλμα μορφή. AMD64 \(Intel/AMD\) χτίζει, τα Windows χτίζει, και η VM δυαδική διαδρομή χωρίς δοχείο δεν επηρεάστηκαν. Η βασική αιτία ήταν ένα ελάττωμα στην εσωτερική διαδικασία έκδοσης εικόνας μας που προκάλεσε ARM64-tagged drone-git εικόνες να περιέχουν πραγματικά AMD64 δυαδικά. Αναγνωρίσαμε και μετριάσαμε το θέμα την ίδια μέρα που αναφέρθηκε επαναφέροντας την εικόνα drone-git στην τελευταία γνωστή-καλή έκδοση. Δεν απαιτείται καμία ενέργεια ή αλλαγή ρύθμισης του πελάτη. # Αιτία ρίζας Στις 19 Ιουνίου 2026, μια αποκατάσταση ασφαλείας αναδιάρθρωσε τον τρόπο κατασκευής της εικόνας drone-git. Οι κατασκευές AMD64 ενημερώθηκαν σωστά, αλλά ο αγωγός κατασκευής ARM64 δεν κατασκεύασε άμεσα αρχεία ARM64 — προσάρμοσε το αρχείο κατασκευής AMD64 μέσω αντικατάστασης κειμένου και το συνέταξε σε υποδομές ARM64. Η αλλαγή της 19ης Ιουνίου άλλαξε το αρχείο AMD64 έτσι ώστε η αντικατάσταση σιωπηρά no-op'd αντί να αποτύχει, έτσι ο αγωγός δημοσίευσε μια εικόνα με ετικέτα ARM64 του οποίου τα διάρια Git Clone και Git LFS είχαν ακόμα συνταχθεί για AMD64. # Σύγκρουση * Επηρεασμένο: Το ενσωματωμένο βήμα Git Clone, και κάθε βήμα του αγωγού χρησιμοποιώντας το πρόσθετο κλώνων drone-git, που εκτελείται σε ARM64 Kubernetes κατασκευή υποδομών, σε όλους τους λογαριασμούς, μεταξύ 6 και 17 Ιουλίου 2026. * Σύμπτωμα: Οι κατασκευές απέτυχαν στο βήμα Git Clone με exec /usr/local/bin/clone: exec format error. * Δεν επηρεάζεται: AMD64 \ (Intel/AMD\) Kubernetes και VM κατασκευές, Windows κατασκευάζει, η VM διαδρομή εκτέλεσης χωρίς εμπορευματοκιβώτιο, και σκληρυμένη παραλλαγή εικόνας μας. # Μετριασμός Επιστρέψαμε την έκδοση drone-git εικόνας που χρησιμοποιήθηκε σε όλες τις επηρεαζόμενες υπηρεσίες στην τελευταία γνωστή-καλή κυκλοφορία. Αυτό επέλυσε πλήρως τις αστοχίες εκτέλεσης του ARM64· δεν απαιτούνταν αλλαγές στη διαμόρφωση του πελάτη. # Επόμενα βήματα Για να αποτραπεί η επανάληψη τέτοιων ζητημάτων. * Ξαναχτίστε τον αγωγό ARM64 έκδοση εικόνας για να οικοδομήσουμε τα αφιερωμένα αρχεία ARM64 μας οικοδομήσουμε άμεσα, αντί να προσαρμόσετε τα αρχεία κατασκευής AMD64. * Ενισχύστε την αυτοματοποιημένη μεταδημοσίευση επικύρωσης σε κάθε έκδοση της εικόνας: επαληθεύστε ότι η δυαδική αρχιτεκτονική ταιριάζει με την ετικέτα της εικόνας, και εκτελέστε μια λειτουργική δοκιμή καπνού πριν από μια εικόνα θεωρείται εκρηκτική. * Επέκταση αυτοματοποιημένη κάλυψη δοκιμών για να συμπεριλάβει ARM64 Kubernetes οικοδομήσουν σενάρια. * Αφαιρέστε τις επηρεαζόμενες ενδιάμεσες εκδόσεις εικόνων από την κυκλοφορία μόλις επικυρωθεί η διορθωμένη κυκλοφορία.
Αυτόματη μετάφραση από την επίσημη ενημέρωση του συμβάντος.