Événement de panne d'Internet sur plusieurs sites
- monitoring
(Ce statut est séparé d'une question antérieure qui, à l'origine, aurait été liée.) Les clients de LON1, AMS1, AMS2, AMS3, DUB1, DUB2, FRA2, SGP1, SGP2, TYO1, TYO2 et TYO3 ont connu une perte d'accessibilité aux destinations Internet, ainsi qu'aux destinations internes de base de Teraswitch entre les sites touchés. D'autres sites nord-américains n'ont pas été touchés. MIA1 (Miami, FL) a été intentionnellement retiré de l'épine dorsale dans le cadre de notre réponse. MIA1 reste accessible et en service, mais fonctionne actuellement sans connectivité complète de la colonne vertébrale, le trafic à destination et en provenance d'autres sites Teraswitch est acheminé sur Internet public plutôt que sur notre colonne vertébrale privée. Les clients qui comptent sur MIA1 pour la connectivité privée ou inter-site devraient s'attendre à modifier les caractéristiques de la latence et du chemin jusqu'à ce que MIA1 soit réintégré. Cause : Teraswitch utilise une route par défaut (0.0.0.0/0) en interne pour signaler qu'un routeur de bord est capable d'avancer le trafic vers Internet. Chaque site préfère normalement la valeur par défaut de ses propres routeurs locaux, avec des attributs d'itinéraire qui distinguent une origine locale de celle distante. Une route par défaut a été propagée à MIA1 avec ses métriques et ses communautés dépouillées et un sentier AS contenant seulement notre propre ASN. À l'heure actuelle, nous comprenons que cette route n'a jamais existé dans les routeurs de MIA1 en tant que route valide. Un réflecteur de route sur notre site AMS2 a propagé cette route modifiée sur nos marchés de l'UE et de l'APAC. Les routeurs de bord de réception l'interprétaient comme originaire locale et le préféraient à leur propre défaut local valide. Ces routeurs ont ensuite annoncé la route vers le centre de données en aval, qui l'a rejeté comme invalide. En l'absence d'une présence par défaut acceptable, les tissus du site touchés ont cessé de transmettre le trafic à leurs propres routeurs, ce qui a entraîné une perte d'accessibilité. Résolution : Les ingénieurs ont identifié la voie mal formée dans les 10 minutes suivant le début et ont retiré le MIA1 de l'épine dorsale pour arrêter la propagation. Les sites touchés ont été reconvergés sur leurs routes et le service local par défaut a été restauré à 04:16:15 UTC. Prochaines étapes: Le défaut sous-jacent, que ce soit dans les routeurs MIA1 ou dans le réflecteur de route, n'a pas encore été identifié. Nous travaillons à reproduire la condition et avons engagé notre fournisseur. Entre-temps, nous mettons en oeuvre une politique visant à faire respecter les attributs minimaux requis sur les routes par défaut d'origine interne afin qu'une publicité malformée ne puisse être préférée à une publicité locale valide. MIA1 restera hors de l'épine dorsale jusqu'à ce que le défaut soit compris et que les mesures d'atténuation soient vérifiées; nous publierons une mise à jour lorsqu'il sera réintégré. Un RFO complet suivra.
- resolved
Working with our network hardware vendor, we have deployed a global change across all compute sites to improve the reliability of the connection between our Internet/backbone edge routers and our data center core networks. This change addresses the blackhole condition that caused the overnight outage. With it in place, a malformed route entering the fabric will no longer prevent traffic forwarding - sites will continue to forward via their local edge routers rather than losing reachability. We considered the previous behavior a critical flaw and have prioritized this fix accordingly. All sites, including the unaffected data centers, had this configuration change completed successfully earlier today. We continue to investigate the underlying condition that caused the default route from MIA1 to be advertised/readvertised with incorrect attributes, and will publish a full RFO once that analysis is complete. Please note: a separate, unrelated incident affecting our global traffic routing systems remains open. That work involves a distinct vendor defect and route scaling improvements, and is not connected to the outage described here.
Traduit automatiquement depuis la mise à jour officielle de l'incident.