Edición Descubierta - Interrupción del servicio en la Región Norteamericana - Servicios Múltiples
- investigating
xMatters herramientas de monitoreo han identificado un problema con xMatters On-Demand para algunos clientes ubicados en la región de América del Norte, limitado a un grupo de bases de datos. Actualmente estamos investigando el problema y actualizaremos a medida que la información esté disponible. Si usted también está experimentando problemas, o si no está seguro de si este problema afecta su servicio, póngase en contacto con xMatters Client Assistance en https://support.xmatters.com/hc/en-us/requests/new - nuestros agentes de apoyo están esperando ayudar.
- monitoring
El equipo xMatters Incident Response ha implementado una solución para el problema. Actualmente estamos monitoreando la situación para asegurar que la aplicación sea estable y que todos los servicios sean restaurados.
- resolved
Se ha abordado la cuestión y se han restablecido todos los servicios. Gracias por su paciencia mientras abordamos este asunto.
- postmortem
¿Qué pasó? El 1 de julio de 2026, algunos clientes reportaron un problema a xMatters Customer Support donde estaban encontrando errores de autenticación al acceder a la interfaz de usuario web. ¿Por qué sucedió? This issue occurred because a database cluster reached 100% resource use, causing database requests to time out. Un patrón de tráfico excepcional expuso un conjunto de consultas de lento funcionamiento, que aumentó significativamente latencia de consultas en el grupo. A medida que aumentaba la latencia, había hambre de recursos y mayor degradación de la capacidad de respuesta del grupo, lo que dio lugar a un tiempo. **¿Cómo respondemos?** Tan pronto como el Servicio de Atención al Cliente confirmó el problema, contrataron a los equipos de Ingeniería para investigar. Como se diseñó, el sistema se había restaurado antes de que Engineering pudiera implementar cualquier acción de mitigación o recuperación, pero los equipos todavía podían identificar y aislar la causa raíz. *¿Qué estamos haciendo para evitar que vuelva a suceder?* Para evitar que este problema vuelva a ocurrir, el Equipo de Ingeniería diseñó, desarrolló y probó una solución. Desplegó la solución en la mañana del miércoles 8 de julio de 2026, y se ha aplicado con éxito para todos los casos.
Traducido automáticamente desde la actualización oficial del incidente.