Estamos completamente abajo para un subconjunto de clientes. Estamos investigando el problema, y estamos devolviendo un despliegue.
- investigating
Actualmente estamos investigando esta cuestión.
- investigating
Seguimos investigando esta cuestión.
- investigating
El rollback parece tener errores completamente resueltos. Estamos monitoreando de cerca, pero los usuarios deben poder acceder de nuevo a Asana.
- monitoring
Se ha aplicado una solución y estamos monitoreando los resultados.
- resolved
Este incidente ha sido resuelto.
- postmortem
Incident: Un sistema interno responsable de escalar automáticamente la capacidad del servidor backend en uno de nuestros clústeres de computación dejó de sustituir la capacidad que se había ciclado durante el mantenimiento rutinario. Esto causó una reducción gradual de la capacidad disponible durante varias horas. Un despliegue posterior se activó con insuficiente capacidad, lo que hizo fracasar todas las nuevas solicitudes de ese grupo de cálculo. Para mitigar el impacto, revertimos a una revisión de la versión anterior, que todavía tenía suficiente capacidad. Impacto: Durante aproximadamente 30 minutos, los clientes cuyo tráfico fue manejado por este grupo de computación vieron tiempo de inactividad completo; otros clientes no fueron afectados. No se perdieron datos de clientes. Avances: Hemos añadido una vigilancia adicional para detectar este tipo de fallos de aumento de la capacidad mucho antes, y hemos añadido salvaguardias para evitar que los despliegues desplacen el tráfico antes de que se confirme suficiente capacidad saludable. Nuestra métrica considera un promedio ponderado de tiempo de trabajo experimentado por los usuarios en cada centro de datos. El número de minutos de tiempo de inactividad mostrado refleja este promedio ponderado.
Traducido automáticamente desde la actualización oficial del incidente.