Underc0de - La Casa de los Informáticos

Foros Generales => Noticias Informáticas => Mensaje iniciado por: Dragora en Julio 24, 2026, 04:21:29 PM

Título: Microsoft revela la causa de la caída de Azure y Microsoft 365
Publicado por: Dragora en Julio 24, 2026, 04:21:29 PM
(https://i.imgur.com/s27jJaF.png)

Microsoft ha revelado la causa oficial de la interrupción masiva que afectó a Azure y Microsoft 365 el pasado 23 de julio, un incidente que dejó sin acceso a millones de usuarios y empresas en todo el mundo. Según la investigación preliminar de la compañía, el origen del problema no fue un ciberataque ni una falla de hardware, sino un error en un sistema automatizado encargado de procesar solicitudes de mantenimiento de la infraestructura de red.

El incidente provocó interrupciones en servicios esenciales como Microsoft Teams, SharePoint Online, OneDrive, Power BI, Copilot Chat, Power Automate, Windows 365, Microsoft Defender y numerosas plataformas de Azure utilizadas por organizaciones de todos los tamaños.

La compañía ha confirmado que el fallo se produjo durante una operación rutinaria de mantenimiento en la región Azure Oeste de Estados Unidos (West US) y que ya trabaja en reforzar sus controles internos para evitar que un error similar vuelva a repetirse.

Una interrupción que comenzó en la infraestructura de Azure

La caída comenzó a las 10:44 AM (ET) del jueves 23 de julio, afectando principalmente a los clientes que accedían a los servicios de Microsoft 365 a través de la infraestructura de red conectada con la región Azure West US.

A medida que avanzaban los minutos, miles de usuarios comenzaron a reportar problemas para acceder a las aplicaciones empresariales de Microsoft. Plataformas de monitoreo como Downdetector registraron un aumento extraordinario de incidencias.

A las 11:11 AM ET, se habían contabilizado 2.403 reportes de fallos, una cifra muy superior al promedio habitual de apenas 29 incidencias.

Entre las aplicaciones más afectadas destacaban:


Mientras tanto, Microsoft abrió oficialmente el incidente bajo el identificador MO1437424, iniciando las labores de diagnóstico y mitigación.

Servicios afectados durante la caída

La interrupción impactó en una gran variedad de servicios críticos para empresas y administraciones públicas.

Entre los principales servicios afectados se encontraban:


Además, también experimentaron problemas:


En el caso específico de Microsoft Defender, algunos clientes sufrieron retrasos en las respuestas de los expertos en seguridad, mientras que funciones avanzadas como Threat Explorer, Advanced Hunting y diversos procesos automatizados de respuesta y remediación también experimentaron errores.

Microsoft intentó mantener los servicios mediante rutas alternativas

Tras detectar el problema, los ingenieros comenzaron inmediatamente a redirigir el tráfico hacia rutas de red redundantes, intentando minimizar el impacto para los clientes.

Aunque esta medida permitió recuperar parcialmente algunos servicios, muchas plataformas continuaron mostrando errores de conectividad y elevada latencia.

Debido a la incertidumbre existente durante las primeras horas del incidente, Microsoft incluso recomendó a las organizaciones revisar sus planes de continuidad del negocio (Business Continuity) y sus procedimientos de recuperación ante desastres (Disaster Recovery), una recomendación poco habitual que reflejaba la magnitud del problema.

Posteriormente, tras identificar la causa exacta, la compañía inició un proceso de reversión del cambio responsable del incidente.

La restauración comenzó a la 1:45 PM ET, finalizó a las 2:26 PM ET y permitió que Microsoft confirmara, mediante telemetría interna y reportes de clientes, la recuperación progresiva de los servicios.

A las 3:41 PM ET, todos los servicios afectados ya habían recuperado completamente su funcionamiento.

El verdadero origen: un error en el sistema automatizado de mantenimiento

En su revisión técnica preliminar, Microsoft explicó que la interrupción ocurrió durante una tarea rutinaria de mantenimiento de dispositivos de red dentro de la región Azure West US.

Como parte del procedimiento habitual, determinadas rutas de red debían aislarse temporalmente para realizar trabajos de mantenimiento sin afectar al tráfico de producción.

El proceso normalmente funciona de la siguiente manera:


Sin embargo, en esta ocasión ocurrió un fallo inesperado.

Microsoft confirmó que el sistema encargado de traducir las solicitudes de mantenimiento interpretó incorrectamente la operación, incluyendo dispositivos adicionales que nunca debían formar parte del mantenimiento programado.

Como consecuencia, se eliminaron rutas IP críticas en una cantidad mucho mayor de dispositivos de la prevista.

Estas rutas conectaban el centro de datos de Azure en la región oeste de Estados Unidos con la red troncal WAN (Wide Area Network) global de Microsoft.

Al desaparecer dichas rutas, el tráfico de entrada y salida hacia la región quedó interrumpido.

La compañía aclaró que el tráfico que permanecía completamente dentro de la región Azure West US continuó funcionando normalmente, mientras que el tráfico que necesitaba atravesar la red WAN fue el que sufrió las mayores afectaciones.

Azure también sufrió importantes interrupciones

El problema no solo afectó a Microsoft 365.

Numerosos servicios de Azure experimentaron problemas de conectividad, aumento considerable de la latencia y fallos de acceso.

Entre ellos destacaban:


Muchos clientes empresariales reportaron interrupciones en aplicaciones críticas que dependen directamente de estas plataformas, especialmente aquellas desplegadas en arquitecturas híbridas o multicloud.

Microsoft reforzará sus controles automatizados

Tras completar la recuperación de los servicios, Microsoft anunció el inicio de una investigación interna mucho más amplia para revisar todos los mecanismos automáticos utilizados durante el mantenimiento de su infraestructura.

La compañía indicó que el análisis se centrará especialmente en:


Microsoft también confirmó que publicará un informe técnico definitivo (Post-Incident Review) una vez finalice completamente la investigación, un proceso que normalmente concluye en un plazo aproximado de 14 días.

¿Qué significa este incidente para las empresas?

Este incidente demuestra que incluso los mayores proveedores de servicios en la nube pueden verse afectados por errores internos durante operaciones rutinarias de mantenimiento. Aunque Microsoft cuenta con arquitecturas redundantes y sofisticados sistemas de automatización, un fallo en la interpretación de una solicitud fue suficiente para provocar una interrupción global con impacto en miles de organizaciones.

Para las empresas que dependen de Microsoft 365 y Azure, este evento refuerza la importancia de contar con planes de continuidad del negocio, estrategias de recuperación ante desastres, arquitecturas redundantes y mecanismos de supervisión independientes que permitan reducir el impacto de futuras incidencias. Asimismo, pone de manifiesto la necesidad de revisar periódicamente los procedimientos de gestión de cambios, incluso cuando estos estén altamente automatizados, ya que una validación insuficiente puede traducirse en interrupciones de gran alcance para servicios críticos utilizados diariamente por millones de usuarios.

Fuente: https://www.bleepingcomputer.com/