Microsoft revela la causa de la caída de Azure y Microsoft 365

Iniciado por Dragora, Julio 24, 2026, 04:21:29 PM

Tema anterior - Siguiente tema

0 Miembros y 5 Visitantes están viendo este tema.

Julio 24, 2026, 04:21:29 PM Ultima modificación: Julio 24, 2026, 04:27:38 PM por Dragora

Microsoft ha revelado la causa oficial de la interrupción masiva que afectó a Azure y Microsoft 365 el pasado 23 de julio, un incidente que dejó sin acceso a millones de usuarios y empresas en todo el mundo. Según la investigación preliminar de la compañía, el origen del problema no fue un ciberataque ni una falla de hardware, sino un error en un sistema automatizado encargado de procesar solicitudes de mantenimiento de la infraestructura de red.

El incidente provocó interrupciones en servicios esenciales como Microsoft Teams, SharePoint Online, OneDrive, Power BI, Copilot Chat, Power Automate, Windows 365, Microsoft Defender y numerosas plataformas de Azure utilizadas por organizaciones de todos los tamaños.

La compañía ha confirmado que el fallo se produjo durante una operación rutinaria de mantenimiento en la región Azure Oeste de Estados Unidos (West US) y que ya trabaja en reforzar sus controles internos para evitar que un error similar vuelva a repetirse.

Una interrupción que comenzó en la infraestructura de Azure

La caída comenzó a las 10:44 AM (ET) del jueves 23 de julio, afectando principalmente a los clientes que accedían a los servicios de Microsoft 365 a través de la infraestructura de red conectada con la región Azure West US.

A medida que avanzaban los minutos, miles de usuarios comenzaron a reportar problemas para acceder a las aplicaciones empresariales de Microsoft. Plataformas de monitoreo como Downdetector registraron un aumento extraordinario de incidencias.

A las 11:11 AM ET, se habían contabilizado 2.403 reportes de fallos, una cifra muy superior al promedio habitual de apenas 29 incidencias.

Entre las aplicaciones más afectadas destacaban:

  • SharePoint Online, con el 78 % de las incidencias reportadas.
  • Microsoft Excel, con aproximadamente un 11 %.
  • Centro de Administración de Microsoft 365, con cerca del 6 %.

Mientras tanto, Microsoft abrió oficialmente el incidente bajo el identificador MO1437424, iniciando las labores de diagnóstico y mitigación.

Servicios afectados durante la caída

La interrupción impactó en una gran variedad de servicios críticos para empresas y administraciones públicas.

Entre los principales servicios afectados se encontraban:

  • Microsoft OneDrive, con accesos intermitentes.
  • SharePoint Online, donde los usuarios recibían el mensaje "Algo salió mal".
  • Microsoft Teams, especialmente en el sistema de chat y carga de imágenes.
  • Centro de Administración de Microsoft 365, con tiempos de carga extremadamente lentos o completamente inaccesible.
  • Power Automate, cuyos flujos dejaron de ejecutarse correctamente.
  • Copilot Chat, con retrasos y errores al responder consultas.
  • Microsoft Loop, que impedía abrir o cargar páginas colaborativas.

Además, también experimentaron problemas:

  • Microsoft Fabric
  • Power BI
  • Power Apps
  • Copilot Studio
  • Windows 365
  • Microsoft Defender

En el caso específico de Microsoft Defender, algunos clientes sufrieron retrasos en las respuestas de los expertos en seguridad, mientras que funciones avanzadas como Threat Explorer, Advanced Hunting y diversos procesos automatizados de respuesta y remediación también experimentaron errores.

Microsoft intentó mantener los servicios mediante rutas alternativas

Tras detectar el problema, los ingenieros comenzaron inmediatamente a redirigir el tráfico hacia rutas de red redundantes, intentando minimizar el impacto para los clientes.

Aunque esta medida permitió recuperar parcialmente algunos servicios, muchas plataformas continuaron mostrando errores de conectividad y elevada latencia.

Debido a la incertidumbre existente durante las primeras horas del incidente, Microsoft incluso recomendó a las organizaciones revisar sus planes de continuidad del negocio (Business Continuity) y sus procedimientos de recuperación ante desastres (Disaster Recovery), una recomendación poco habitual que reflejaba la magnitud del problema.

Posteriormente, tras identificar la causa exacta, la compañía inició un proceso de reversión del cambio responsable del incidente.

La restauración comenzó a la 1:45 PM ET, finalizó a las 2:26 PM ET y permitió que Microsoft confirmara, mediante telemetría interna y reportes de clientes, la recuperación progresiva de los servicios.

A las 3:41 PM ET, todos los servicios afectados ya habían recuperado completamente su funcionamiento.

El verdadero origen: un error en el sistema automatizado de mantenimiento

En su revisión técnica preliminar, Microsoft explicó que la interrupción ocurrió durante una tarea rutinaria de mantenimiento de dispositivos de red dentro de la región Azure West US.

Como parte del procedimiento habitual, determinadas rutas de red debían aislarse temporalmente para realizar trabajos de mantenimiento sin afectar al tráfico de producción.

El proceso normalmente funciona de la siguiente manera:

  • Los ingenieros generan una solicitud de mantenimiento.
  • Un sistema automatizado convierte esa solicitud en instrucciones comprensibles para los dispositivos de red.
  • Antes de ejecutar cualquier cambio, el sistema verifica que al menos una de las rutas redundantes permanezca disponible para garantizar la continuidad del servicio.

Sin embargo, en esta ocasión ocurrió un fallo inesperado.

Microsoft confirmó que el sistema encargado de traducir las solicitudes de mantenimiento interpretó incorrectamente la operación, incluyendo dispositivos adicionales que nunca debían formar parte del mantenimiento programado.

Como consecuencia, se eliminaron rutas IP críticas en una cantidad mucho mayor de dispositivos de la prevista.

Estas rutas conectaban el centro de datos de Azure en la región oeste de Estados Unidos con la red troncal WAN (Wide Area Network) global de Microsoft.

Al desaparecer dichas rutas, el tráfico de entrada y salida hacia la región quedó interrumpido.

La compañía aclaró que el tráfico que permanecía completamente dentro de la región Azure West US continuó funcionando normalmente, mientras que el tráfico que necesitaba atravesar la red WAN fue el que sufrió las mayores afectaciones.

Azure también sufrió importantes interrupciones

El problema no solo afectó a Microsoft 365.

Numerosos servicios de Azure experimentaron problemas de conectividad, aumento considerable de la latencia y fallos de acceso.

Entre ellos destacaban:

  • Azure App Service
  • Azure Application Gateway
  • Azure AD B2C
  • Azure AI Search
  • Azure API Management
  • Azure Cosmos DB
  • Azure Databricks
  • Azure Firewall
  • Azure Kubernetes Service (AKS)
  • Azure Monitor
  • Azure Virtual Desktop
  • ExpressRoute
  • Log Analytics
  • Microsoft Graph
  • Microsoft Sentinel
  • Power BI Embedded
  • Virtual WAN
  • VPN Gateway

Muchos clientes empresariales reportaron interrupciones en aplicaciones críticas que dependen directamente de estas plataformas, especialmente aquellas desplegadas en arquitecturas híbridas o multicloud.

Microsoft reforzará sus controles automatizados

Tras completar la recuperación de los servicios, Microsoft anunció el inicio de una investigación interna mucho más amplia para revisar todos los mecanismos automáticos utilizados durante el mantenimiento de su infraestructura.

La compañía indicó que el análisis se centrará especialmente en:

  • Mejorar las validaciones automáticas antes de ejecutar cambios.
  • Revisar los sistemas encargados de convertir solicitudes humanas en instrucciones para dispositivos de red.
  • Añadir nuevas comprobaciones de seguridad que impidan que un error similar afecte simultáneamente a múltiples dispositivos.
  • Fortalecer los mecanismos de reversión automática cuando se detecten comportamientos inesperados.

Microsoft también confirmó que publicará un informe técnico definitivo (Post-Incident Review) una vez finalice completamente la investigación, un proceso que normalmente concluye en un plazo aproximado de 14 días.

¿Qué significa este incidente para las empresas?

Este incidente demuestra que incluso los mayores proveedores de servicios en la nube pueden verse afectados por errores internos durante operaciones rutinarias de mantenimiento. Aunque Microsoft cuenta con arquitecturas redundantes y sofisticados sistemas de automatización, un fallo en la interpretación de una solicitud fue suficiente para provocar una interrupción global con impacto en miles de organizaciones.

Para las empresas que dependen de Microsoft 365 y Azure, este evento refuerza la importancia de contar con planes de continuidad del negocio, estrategias de recuperación ante desastres, arquitecturas redundantes y mecanismos de supervisión independientes que permitan reducir el impacto de futuras incidencias. Asimismo, pone de manifiesto la necesidad de revisar periódicamente los procedimientos de gestión de cambios, incluso cuando estos estén altamente automatizados, ya que una validación insuficiente puede traducirse en interrupciones de gran alcance para servicios críticos utilizados diariamente por millones de usuarios.

Fuente: You are not allowed to view links. You are not allowed to view links. Register or Login or You are not allowed to view links. Register or Login