Varios servicios de Atlas están experimentando problemas
- investigating
Estamos experimentando problemas con múltiples productos Atlassianos. Nuestros equipos están investigando más y más actualizaciones, incluyendo serán compartidos dentro de 1 hora.
- identified
Hemos identificado que la causa raíz del problema está relacionada con un gasto de infraestructura de nuestro proveedor de nube pública. Trabajamos estrechamente con ellos para mitigar esta cuestión. Proporcionaremos más actualizaciones cuando estén disponibles.
- identified
Nuestros equipos continúan trabajando en la mitigación de la pérdida de infraestructura de nuestro proveedor de nube pública. Proporcionaremos más actualizaciones cuando estén disponibles.
- identified
Continuamos trabajando con nuestro proveedor de nube pública para mitigar este problema. Estamos empezando a ver alguna recuperación en regiones fuera de los EE.UU. Oriental, sin embargo, los usuarios de todo el mundo todavía pueden estar experimentando problemas con ciertas características del producto. Estos se enumeran en la parte inferior de cada página de producto.
- monitoring
Se ha mitigado la cuestión subyacente de la infraestructura pública que afectó el procesamiento de eventos asincrónicos y se están recuperando todos los servicios afectados. Ahora estamos trabajando en la limpieza del atraso de los eventos apagados, lo que significa que algunas acciones (como notificaciones, disparadores de automatización y sincronizaciones de datos) pueden estar en estado degradado. Seguiremos monitoreando y proporcionando actualizaciones ya que el atraso está aclarado.
- monitoring
Seguimos vigilando la situación a medida que se recuperan los servicios. Actualmente estamos en proceso de despejar el atraso de los eventos apagados. Proporcionaremos una actualización adicional en aproximadamente una hora.
- monitoring
Nuestros servicios están ahora plenamente operativos. Seguimos reproduciendo cualquier evento que se perdió durante el incidente, y estamos haciendo un buen progreso. Proporcionaremos otra actualización una vez que las repeticiones estén completas. Si experimenta algún problema en curso, por favor contacte con nuestro equipo de soporte. Nos disculpamos por la interrupción y le agradecemos por su paciencia.
- resolved
El 8 de mayo de 2026, algunos clientes que utilizan productos Atlassianos experimentaron altas tasas de error y rendimiento degradado. El problema se ha resuelto y el servicio funciona normalmente para todos los clientes afectados.
- postmortem
Todas las fechas y fechas a continuación están en UTC a menos que se indique lo contrario. #### Summary El 8 de mayo de 2026 entre las 00:22 y las 06:08, uno de nuestros proveedores de hospedaje sufrió un incidente significativo en una zona de disponibilidad específica en prod-east que llevó a clientes de Atlassian experimentar rendimiento degradado y retrasos de operaciones de fondo y ejecución de automatización. El incidente comenzó el 8 de mayo de 2026 a las 00:22 y fue detectado dentro de 4 minutos por sistemas de monitoreo automatizados. Nuestros equipos trabajaron para restaurar el acceso básico para las 06:08. La limpieza final de los procesos respaldados y las cuestiones menores progresaron en etapas desde allí se completó iterativamente en 19:15. #### **IMPACT** La infraestructura principal afectada en este incidente fue el gasoducto de procesamiento de eventos en la región prod-este, que distribuye eventos entre servicios Atlassianos y apoya operaciones de fondo como la ejecución de automatización, indexación de búsqueda, notificaciones, sincronización de permisos. * Entre las 00:22 y las 06:08, un incidente de infraestructura en nuestro proveedor de alojamiento provocó un fallo de ingestión en nuestra tubería de procesamiento de eventos. * At 02:50, event ingestion was failed over to an un affected availability zone, progressively restorering live event flows. * A las 06:08, confiabilidad para la nueva ingestión en prod-east recuperada al 100%. El trabajo restante era drenar el atraso acumulado de la lista cruzada de mensajes, que terminó a las 17:00. * Para 18:48, Automation había procesado su acumulación de eventos que se crearon durante el procesamiento **Automatización* Entre las 00:22 y las 02:50, los clientes con reglas de automatización activadas por eventos originarios de la región prod-este experimentaron una reducción significativa en las ejecuciones de reglas. Durante esta ventana, las reglas de automatización desencadenadas por eventos no estaban disparando porque los eventos que los desencadenaban no estaban siendo entregados. Autorización de reglas, ahorro y reglas activadas manualmente, por horarios, o por webhooks no se vieron afectados. A las 02:50, la infraestructura de procesamiento de eventos falló en una zona de disponibilidad no afectada, restaurando la entrega de eventos en vivo a Automation y permitiendo nuevas reglas desencadenadas por eventos para comenzar a ejecutar normalmente. Sin embargo, los acontecimientos generados durante la ventana de impacto todavía necesitan ser reproducidos antes de que se puedan procesar las automatización retrasadas. A partir de las 08:28, los servicios de corriente rejuvenecieron sus eventos en una secuencia coordinada, y todos los eventos reinterpretados fueron procesados por 18:48. Durante la ventana de reproducción, los clientes pueden haber experimentado reglas de automatización ejecutando más adelante de lo esperado, un pequeño número de reglas que alcanzan los límites de procesamiento diarios debido a la repetición comprimida, y reglas sensibles al tiempo que no se completan como se esperaba si se superaran los umbrales de tiempo interno. **Jira y Jira Service Management** Entre las 00:22 y las 02:50, los clientes con inquilinos alojados en la región prod-este experimentaron trastornos a Jira y Jira Service Management características impulsadas por eventos como la automatización, junto con un corto período de errores elevados durante la falla de infraestructura. Durante todo el incidente se mantuvieron disponibles las experiencias de Core Jira, incluidas las opiniones sobre cuestiones, las juntas y la navegación de proyectos. La entrega de eventos de Jira se vio afectada por el impacto primario, evitando que los servicios de abajo reciban eventos de ciclo de vida de emisión. Estas reglas de automatización afectadas desencadenadas por eventos Jira, orquestación de agentes AI en Jira, notificaciones de actualizaciones de emisión y transiciones, indexación de búsqueda de problemas nuevos creados o modificados, e integraciones impulsadas por eventos entre Jira y otros productos Atlassianos. A las 02:50, la infraestructura de procesamiento de eventos falló en una zona de disponibilidad no afectada, restaurando la entrega de nuevos eventos. Todos los eventos generados durante la ventana de impacto fueron retenidos en una cola de recuperación y repetidas. Esto comenzó a las 08:28 y terminó a las 12:00. Durante la ventana de reproducción, los clientes pueden haber experimentado reglas de automatización ejecutando más adelante de lo esperado, notificaciones demoradas que llegan horas después de la acción de activación, lagunas temporales en los resultados de búsqueda de contenido creados o modificados durante la ventana de impacto, y flujos de trabajo de agentes de IA que no se completan como se esperaba cuando los umbrales de tiempo interno fueron superados. *Confluencia* Entre las 00:22 y las 02:50, los clientes con inquilinos alojados en la región prod-east experimentaron perturbaciones a servicios impulsados por eventos en Confluence. Esto dio lugar a demoras en la indexación de búsqueda, notificaciones, ejecución de reglas de automatización y sincronización de permisos. La infraestructura de procesamiento de eventos subyacentes no afectó a una zona de disponibilidad no afectada, después de la cual las operaciones de Confluencia en vivo reanudaron normalmente. Sin embargo, los acontecimientos generados durante la ventana de impacto fueron consultados para reproducirse, y algunos servicios de antecedentes se mantuvieron retrasados hasta que concluyera esa labor de reproducción y validación conexas. Entre las 10:14 y las 17:00, se completó una repetición a granel de todas las tareas de reproducción de inquilinos apagados para restaurar la consistencia de los datos. Durante e inmediatamente después de la ventana de reproducción, los clientes pueden haber experimentado resultados de búsqueda que no reflejen el contenido creado o modificado durante el outage, notificaciones demoradas o faltantes para la actividad de página y comentario, reglas de automatización disparando más tarde de lo esperado, y breves demoras en la sincronización de permisos para los inquilinos que dependen de la sincronización de identidad incremental. #Bitbucket and Pipelines # Entre las 00:22 y las 06:08, los clientes que utilizan Bitbucket y Pipelines experimentaron fallos y degradaron la funcionalidad en los flujos de trabajo impulsados por eventos. Las operaciones de Core Git, incluyendo empuje, tira y clon, no se vieron afectadas y continuaron operando normalmente durante todo el incidente. Los disparadores automáticos de oleoducto iniciados por los eventos de solicitud de empuje o tirado no estaban disponibles durante la ventana de impacto. Combinar colas, controles de fusión personalizadas, desencadenantes basados en forja, cambios de permiso del espacio de trabajo, y algunos flujos de suministro del espacio de trabajo también fueron afectados. Los clientes que utilizan colas de fusión no pudieron fusionar solicitudes de tiraje, y algunos pasos de oleoducto fallaron porque el trabajo solicitado contribuyó a elevar los límites de concurrencia. Aproximadamente a las 03:57, Pipelines fue reconfigurado para consumir eventos a través de un camino alternativo, restaurando el disparador automático de tuberías. Las colas de fusión, los controles de fusión personalizados, los desencadenantes de Forge y otros flujos de trabajo afectados fueron restaurados progresivamente a medida que se recuperaba la infraestructura de procesamiento de eventos subyacentes. Todos los servicios de Bitbucket y Pipelines fueron confirmados totalmente operativos por 06:08. Después de la recuperación, se revisaron y reinterpretaron los acontecimientos en los que se pudo recuperar la coherencia de los datos para facturar, registrar auditorías y otros procesos de antecedentes. ** Servicios de identidad** Entre las 00:22 y las 02:50, los clientes con inquilinos alojados en la región prod-east experimentaron retrasos en la propagación de la identidad y los cambios de membresía de grupo a los productos de Atlas. Las operaciones básicas de identidad, incluidas las acciones de autenticación, login y gestión directa de grupos, no se vieron afectadas y continuaron funcionando normalmente durante todo el incidente. El impacto se limitó a operaciones asincrónicas impulsadas por eventos que dependen de la tubería de procesamiento de eventos. Esto incluyó retrasos en la entrega de miembros de grupo y cambios de perfil de usuario a productos como Jira y Confluence, que afectaron la sincronización de permisos aguas abajo y flujos de sincronización de multitudes. Un pequeño número de flujos de trabajo de sincronización de identidad basados en SCIM y suministro de sitios también experimentó demoras temporales. Después de la recuperación de la infraestructura de procesamiento de eventos, se reiniciaron eventos de identidad y directorios de grupo cuando fuera necesario, restaurando la consistencia de aguas abajo para los productos afectados. No se perdieron datos de identidad. Tras la recuperación, se retuvieron y procesaron los cambios en la composición del grupo, las actualizaciones del perfil de usuario y los acontecimientos relacionados con la provisión que ocurrieron durante la ventana de impacto. ### ** Acciones urgentes PLAN & NEXT STEPS** Sabemos que las interrupciones impactan su productividad. Si bien nuestros procesos de vigilancia y recuperación nos ayudaron a responder rápidamente, este incidente puso de relieve oportunidades para fortalecer aún más la resiliencia de los servicios impulsados por los eventos. Estamos priorizando mejoras que: * ** Mejorar la cobertura de failover** para que el procesamiento de eventos crítico pueda recuperarse con más facilidad durante las perturbaciones de infraestructura. * **Manejo de recuperación de Strengthen** para que los eventos repetidos puedan ser procesados más rápido. Nos disculpamos con clientes cuyos servicios fueron impactados durante este incidente; estamos tomando medidas inmediatas para mejorar el rendimiento y la disponibilidad de la plataforma. Gracias. Atención al cliente de Atlassian.
Traducido automáticamente desde la actualización oficial del incidente.