# theHarvester para recopilar correos, dominios y fuentes públicas

**Categoría:** Hacking ético · **Nivel:** Intermedio · **Lectura:** 16 min
**Publicada:** 2026-07-28 · **Actualizada:** 2026-07-28 · **Autoría:** Underc0de
**Versión HTML (canónica):** https://underc0de.org/guias/hacking/theharvester-recopilar-correos-y-dominios/

## Respuesta rápida

**theHarvester** es una herramienta de **OSINT** (inteligencia de fuentes abiertas) que recopila de forma **automática y pasiva** la **huella pública** de una organización: **correos electrónicos** de sus empleados, **subdominios**, **hosts** y servidores, nombres y otra información que la organización deja visible en internet sin darse cuenta. Consulta un montón de **fuentes públicas** —buscadores, registros de certificados, servicios de OSINT, bases de datos— y reúne todo en un solo lugar. Es una de las herramientas clásicas de la fase de **reconocimiento** (o *footprinting*): antes de cualquier prueba de seguridad, se mapea qué expone el objetivo. Lo que la hace especialmente relevante es que recopila **correos de empleados**, y esos correos son la **materia prima del phishing dirigido**: con una lista de direcciones reales de una empresa, un atacante puede lanzar [campañas de ingeniería social](../../seguridad-informatica/ingenieria-social-tecnicas-y-como-prevenirlas/index.md) creíbles. Por eso theHarvester tiene un doble valor: para el atacante, construir el mapa de a quién y cómo engañar; para la **defensa** (su uso legítimo), descubrir *cuánto expone tu organización* —cuántos correos y datos son públicos— para reducir esa exposición y preparar a la gente contra los engaños. Es pasiva y de bajo impacto técnico (no ataca, solo consulta lo público), y muchas fuentes rinden más con **claves de API**. La condición **no negociable**: se usa sobre **tu propia organización o con autorización explícita**; recopilar y perfilar sistemáticamente los datos de una organización ajena sin permiso, aunque sean públicos, puede tener implicaciones legales y siempre debe hacerse con mandato.

## Qué es theHarvester

**theHarvester** es una herramienta de **reconocimiento pasivo** y OSINT que automatiza la recopilación de la información pública de una organización. En vez de buscar a mano en decenas de sitios qué correos, subdominios y datos hay expuestos, theHarvester consulta muchas fuentes de golpe y presenta el resultado unificado. Es una de las primeras herramientas que se aprende en OSINT por lo directa y útil que es.

> **Atención**
>
> Aunque theHarvester trabaja con información *pública* y de forma pasiva —lo que reduce mucho el riesgo técnico—, recopilar y perfilar de forma sistemática los datos de una organización ajena debe hacerse siempre **con autorización o sobre la propia organización**. Reunir masivamente correos y datos de terceros puede tener implicaciones legales y de protección de datos, aunque cada dato por separado sea accesible. El uso legítimo es **defensivo o autorizado**: medir la exposición de tu propia organización para reducirla, o hacerlo para un cliente que te contrató con un alcance definido. Practicar sobre tus propios dominios es siempre seguro.

## Qué recopila y de dónde

theHarvester unifica dos tipos de información valiosa para el reconocimiento, obtenida de fuentes que ya son públicas:

| Qué recopila | Por qué importa |
|---|---|
| Correos de empleados | Materia prima del phishing dirigido y de la ingeniería social |
| Subdominios y hosts | Amplían el mapa de la superficie de ataque |
| Nombres de personas | Ayudan a construir engaños creíbles y personalizados |
| Direcciones IP y servidores | Revelan la infraestructura expuesta |

> **Reconocimiento pasivo: solo mira lo que ya está**
>
> theHarvester es **pasivo**: no ataca ni sondea la infraestructura del objetivo, solo **consulta información que ya es pública** en buscadores, registros de certificados y servicios de OSINT. Eso lo hace sigiloso y de muy bajo riesgo de causar daño. Pero conviene entender la implicación incómoda: toda esa información **ya estaba ahí**, expuesta, esperando a que alguien la reuniera. theHarvester no «hackea» nada; simplemente **hace visible de golpe** lo que la organización fue dejando ver poco a poco. Muchas de sus fuentes rinden más con **claves de API** gratuitas configuradas. Esta capacidad de agregación es justo lo que lo hace útil tanto para el atacante como para el defensor.

## Para qué sirve

Como toda herramienta de reconocimiento, tiene un doble uso, y entender ambos es lo que permite defenderse:

> **Atención**
>
> Aquí está la conexión clave para la defensa. Cuando un atacante obtiene con theHarvester una **lista de correos reales** de los empleados de una empresa, tiene la materia prima para un [ataque de phishing dirigido](../../seguridad-informatica/ingenieria-social-tecnicas-y-como-prevenirlas/index.md): sabe a quién escribir, con direcciones que existen, y puede personalizar el engaño con los nombres y datos que también recopiló. Por eso el uso **defensivo** de theHarvester es tan valioso: al ejecutarlo sobre tu propia organización, descubrís *exactamente lo que un atacante vería* —cuántos correos son públicos, qué datos expone tu gente—, y con eso podés reducir la exposición innecesaria y, sobre todo, **preparar a los empleados** para reconocer los engaños que esos datos harán posibles. Conocer tu propia huella pública es el primer paso para reducirla.

| Uso | Para qué |
|---|---|
| Defensivo (el tuyo) | Medir tu exposición pública, reducirla y preparar a la gente contra el phishing |
| Auditoría autorizada | Mapear la huella de un cliente como parte de una evaluación acordada |
| Ofensivo (lo que hace el atacante) | Construir el mapa de a quién y cómo engañar |

## Errores frecuentes

- **Recopilar datos de organizaciones ajenas sin permiso.** Aunque sean públicos, perfilarlos sistemáticamente debe hacerse con autorización.
- **Creer que «es público, no pasa nada».** Agregar masivamente datos personales tiene implicaciones legales y de protección de datos.
- **Olvidar el uso defensivo.** Ejecutarlo sobre tu propia organización revela lo que un atacante vería y permite reducirlo.
- **No configurar claves de API.** Muchas fuentes rinden mucho más con claves; sin ellas se recopila menos.
- **Ignorar la conexión con el phishing.** Los correos recopilados son el insumo del engaño; hay que preparar a la gente.
- **Tratar la huella como estática.** La exposición cambia; conviene medirla periódicamente.
- **Quedarse solo en la recopilación.** El valor está en actuar: reducir exposición y concienciar, no solo listar.

## Preguntas frecuentes

**¿Qué es theHarvester?**
theHarvester es una herramienta de inteligencia de fuentes abiertas, conocida como OSINT, que automatiza la recopilación de la información pública que una organización deja expuesta en internet, reuniendo datos como las direcciones de correo electrónico de sus empleados, los subdominios, los hosts y servidores, los nombres de personas y otra información visible. Su funcionamiento es pasivo, lo que significa que no ataca ni sondea directamente la infraestructura del objetivo, sino que consulta una amplia variedad de fuentes de información que ya son públicas y accesibles, como los motores de búsqueda, los registros de transparencia de certificados, diversos servicios y bases de datos de inteligencia de fuentes abiertas y otros repositorios, y luego reúne y organiza todo ese material en un único lugar. De este modo, en lugar de tener que buscar manualmente en decenas de sitios distintos qué correos, subdominios y datos hay expuestos sobre una organización, theHarvester realiza esa búsqueda de forma automática y presenta el resultado unificado, ahorrando mucho tiempo. Es una de las herramientas clásicas y de las primeras que se aprenden en la fase de reconocimiento, también llamada footprinting, que es la etapa inicial de cualquier evaluación de seguridad en la que se mapea qué información y qué activos expone el objetivo antes de proceder con análisis más profundos. Lo que hace a theHarvester especialmente relevante es que recopila las direcciones de correo de los empleados, que constituyen un insumo muy valioso para los ataques de ingeniería social y phishing dirigido. Esto le confiere un doble valor: por un lado, es una herramienta que emplean los atacantes en su reconocimiento inicial, y por otro, y este es su uso legítimo, es muy útil de forma defensiva, ya que permite a una organización descubrir cuánta información suya está expuesta públicamente para reducir esa exposición y preparar a su personal frente a los engaños. Como toda herramienta de reconocimiento, debe usarse únicamente sobre la propia organización o con autorización explícita, ya que recopilar y perfilar sistemáticamente los datos de terceros, aunque sean públicos, puede tener implicaciones legales.

**¿Qué información recopila exactamente?**
theHarvester recopila diversos tipos de información pública que, en conjunto, dibujan la huella digital de una organización en internet, es decir, lo que esta deja ver sin necesidad de vulnerar ningún sistema. El tipo de dato más característico y relevante que recopila son las direcciones de correo electrónico asociadas a la organización, típicamente las de sus empleados, que aparecen públicamente en páginas web, documentos, publicaciones y otras fuentes; estas direcciones son especialmente importantes porque constituyen la materia prima de los ataques de phishing dirigido y de ingeniería social, al proporcionar una lista de objetivos reales a los que dirigir engaños. Además de los correos, theHarvester recopila subdominios de la organización, que amplían el mapa de su superficie de ataque revelando los distintos servicios y sitios que tiene desplegados; hosts y servidores, con información sobre la infraestructura expuesta; direcciones de red asociadas a la organización; y nombres de personas vinculadas a ella, que resultan útiles para construir engaños más creíbles y personalizados, así como para relacionar identidades. Toda esta información se obtiene consultando fuentes públicas, sin tocar la infraestructura del objetivo, lo que hace que la recopilación sea pasiva y de bajo riesgo técnico. La cantidad y la riqueza de los datos obtenidos dependen en buena medida de las fuentes que se consulten y de si se han configurado las claves de acceso a las interfaces de programación de determinados servicios, ya que muchas fuentes ofrecen resultados más completos cuando se dispone de dichas claves. Es importante comprender que toda esta información ya estaba disponible públicamente antes de usar la herramienta; theHarvester no la genera ni la extrae de sistemas protegidos, sino que simplemente la localiza, la agrega y la presenta de forma organizada, haciendo visible de golpe lo que la organización fue exponiendo poco a poco a lo largo del tiempo. Precisamente esta capacidad de agregación es lo que hace a la herramienta tan valiosa, ya que permite ver de un vistazo el conjunto de la huella pública, algo que de otro modo requeriría un laborioso trabajo manual, y es útil tanto para quien quiere atacar como para quien quiere defenderse conociendo y reduciendo su exposición.

**¿Por qué los correos recopilados son un riesgo?**
Las direcciones de correo electrónico que theHarvester recopila constituyen un riesgo importante porque son la materia prima de los ataques de phishing dirigido y de ingeniería social, que están detrás de la mayoría de los incidentes de seguridad reales. Cuando un atacante consigue una lista de correos electrónicos reales de los empleados de una organización, obtiene algo muy valioso para él: sabe a quién dirigirse, dispone de direcciones que existen y funcionan, y puede planificar campañas de engaño contra personas concretas de esa organización. Con esa base, el atacante puede enviar correos fraudulentos que se hacen pasar por comunicaciones legítimas, como mensajes del departamento de sistemas, de recursos humanos, de un proveedor o de un superior, con el objetivo de que la víctima haga clic en un enlace malicioso, introduzca sus credenciales en una página falsa, descargue un archivo infectado o realice alguna acción perjudicial. Cuanto más se sabe sobre los destinatarios, más creíble y personalizado puede ser el engaño, y aquí es donde la información adicional que theHarvester recopila, como los nombres de las personas y otros datos, incrementa aún más el riesgo, ya que permite construir ataques de phishing dirigido, mucho más difíciles de detectar que el phishing genérico. El peligro se agrava porque la ingeniería social explota el factor humano, que suele ser el eslabón más débil de la seguridad, de modo que basta con que una sola persona de la organización caiga en el engaño para que el atacante pueda obtener un punto de entrada. Por todo ello, el hecho de que los correos de una organización sean fácilmente recopilables representa un riesgo concreto, y comprenderlo tiene un valor defensivo muy claro: al ejecutar theHarvester sobre la propia organización, se descubre exactamente qué correos y datos están expuestos y, por tanto, qué vería un atacante, lo que permite tomar medidas como reducir la exposición innecesaria de direcciones, y sobre todo formar y concienciar a los empleados para que reconozcan y resistan los intentos de phishing que esos datos harán posibles. En definitiva, los correos recopilados son un riesgo porque abren la puerta a los ataques dirigidos contra las personas, que son una de las vías de entrada más eficaces y utilizadas.

**¿theHarvester es legal si la información es pública?**
El hecho de que la información sea pública no convierte automáticamente en legal cualquier uso de theHarvester, por lo que la regla prudente y correcta es emplearlo únicamente sobre la propia organización o con autorización explícita, aun cuando la herramienta trabaje con datos accesibles públicamente. Es cierto que theHarvester realiza un reconocimiento pasivo, consultando información que ya está disponible en fuentes públicas sin tocar ni vulnerar la infraestructura del objetivo, lo que reduce mucho el riesgo técnico y sitúa su actividad en un terreno distinto al de un ataque activo. Sin embargo, hay que tener en cuenta varias consideraciones. En primer lugar, aunque cada dato individual sea accesible de forma aislada, la recopilación y agregación sistemática y masiva de datos personales, como las direcciones de correo y los nombres de los empleados de una organización, puede tener implicaciones legales, especialmente en el marco de las normativas de protección de datos personales, que regulan el tratamiento de esa información con independencia de que provenga de fuentes públicas. En segundo lugar, reunir de forma organizada la huella completa de una organización ajena, aunque sea a partir de datos públicos, se inscribe habitualmente en la fase de reconocimiento previa a un ataque, y hacerlo sin ningún mandato ni relación legítima con esa organización resulta cuando menos éticamente cuestionable y potencialmente problemático desde el punto de vista legal según el contexto y la jurisdicción. Por estas razones, el uso legítimo de theHarvester es el defensivo o el autorizado: medir la exposición pública de la propia organización con el fin de conocerla y reducirla, o realizar esa recopilación para un cliente que ha contratado formalmente una evaluación y ha definido el alcance permitido. Para aprender y practicar sin riesgo alguno, se pueden usar los propios dominios y datos. En resumen, la naturaleza pública de la información no elimina la necesidad de contar con autorización o de actuar sobre lo propio, y la línea que separa un uso legítimo de uno problemático la marcan el permiso, la finalidad legítima y el respeto a la normativa de protección de datos, y no simplemente el hecho de que los datos estén disponibles públicamente.

**¿Cómo uso theHarvester para defender mi organización?**
Para defender tu organización con theHarvester, la idea central es ejecutarlo sobre tu propia organización con el fin de ver exactamente lo que un atacante vería, y a partir de ese conocimiento reducir la exposición y preparar a las personas frente a los ataques que esa información hace posibles. El primer paso es realizar la recopilación sobre los dominios y la identidad de tu propia organización, lo cual es plenamente legítimo al tratarse de activos propios, para obtener el inventario de lo que está públicamente expuesto, como las direcciones de correo de los empleados, los subdominios, los hosts y los nombres que aparecen en fuentes públicas. Conviene configurar las claves de acceso a las fuentes que lo permitan para obtener resultados lo más completos posible, de modo que la imagen de la exposición sea realista. Una vez que se tiene ese panorama, el trabajo defensivo consiste en actuar sobre varios frentes. En cuanto a la superficie técnica, se revisan los subdominios y hosts descubiertos para identificar activos olvidados, innecesariamente expuestos o mal protegidos, con el fin de retirarlos o asegurarlos, reduciendo así la superficie de ataque. En cuanto a la exposición de correos y datos personales, se valora si es necesario que tantas direcciones y datos estén públicamente accesibles, y se reduce la exposición innecesaria donde sea posible, aunque conviene ser realista, ya que muchos correos deben ser públicos por razones de negocio. El frente más importante, dado que los correos recopilados son la materia prima del phishing dirigido, es la concienciación y formación del personal: sabiendo que sus direcciones y datos están expuestos y que por tanto recibirán intentos de engaño, se debe formar a los empleados para reconocer el phishing y la ingeniería social, enseñarles a desconfiar de los mensajes inesperados y urgentes, a verificar por canales alternativos y a no entregar credenciales ni códigos, y complementar esa formación con medidas técnicas como la autenticación de dos factores, que limita el daño si un engaño tiene éxito. También es útil realizar esta medición de la exposición de forma periódica, ya que la huella pública cambia con el tiempo. En definitiva, usar theHarvester de forma defensiva consiste en convertir el reconocimiento que haría un atacante en una herramienta propia para conocer la exposición, reducirla donde se pueda y, sobre todo, preparar a las personas contra los ataques dirigidos que esa información facilita.

**¿En qué se diferencia theHarvester de Amass o Maltego?**
theHarvester, Amass y Maltego son herramientas relacionadas con el reconocimiento y la inteligencia de fuentes abiertas, pero tienen enfoques y alcances distintos que las hacen complementarias más que equivalentes. theHarvester se centra en recopilar de forma rápida y automatizada la huella pública de una organización, con un énfasis particular en las direcciones de correo electrónico de los empleados, además de subdominios, hosts y nombres, consultando múltiples fuentes públicas y presentando el resultado de manera unificada; su fortaleza es la sencillez y la orientación a obtener rápidamente ese tipo de información de exposición, especialmente los correos que alimentan el phishing. Amass, en cambio, está especializado en el descubrimiento de subdominios y el mapeo de la infraestructura de una organización, combinando reconocimiento pasivo y activo y construyendo un panorama detallado de la superficie de ataque en términos de subdominios, hosts y direcciones de red; su foco no son los correos ni las personas, sino la infraestructura expuesta, y es más exhaustivo en ese ámbito concreto. Maltego, por su parte, es una herramienta de un tipo diferente, orientada al análisis y la visualización de relaciones en investigaciones de inteligencia de fuentes abiertas; permite representar gráficamente cómo se conectan entre sí distintas entidades, como personas, correos, dominios, organizaciones y otros datos, y explorar esas relaciones de forma visual e interactiva, siendo especialmente potente para investigaciones complejas en las que interesa entender las conexiones entre múltiples piezas de información. De este modo, cada herramienta ocupa un lugar distinto: theHarvester es ideal para una recopilación rápida y directa de la huella pública, sobre todo de correos; Amass destaca en el descubrimiento exhaustivo de subdominios e infraestructura; y Maltego sobresale en el análisis y la visualización de relaciones entre entidades. En la práctica, estas herramientas se complementan dentro de un mismo proceso de reconocimiento e investigación, y no es raro usar theHarvester para obtener rápidamente correos y datos iniciales, herramientas como Amass para mapear a fondo la infraestructura, y Maltego para relacionar y visualizar todo lo recopilado. La elección o combinación depende del objetivo concreto de la evaluación, y todas ellas deben usarse siempre dentro del marco de la autorización y la legalidad correspondiente.

## Fuentes

Documentación oficial y material de la comunidad consultados para esta guía. Fecha de consulta: 28 de julio de 2026.

### Aportes de la comunidad Underc0de

1. **Underc0de, foro.** [Sección Hacking](https://underc0de.org/foro/hacking/). OSINT y reconocimiento.
2. **Underc0de, foro.** [Sección Seguridad informática](https://underc0de.org/foro/seguridad-informatica/). Exposición y footprinting.

### Documentación oficial

1. **laramies.** [theHarvester](https://github.com/laramies/theHarvester). Repositorio y documentación.
2. **OSINT Framework.** [OSINT Framework](https://osintframework.com/). Recursos de inteligencia de fuentes abiertas.
3. **OWASP.** [Web Security Testing Guide](https://owasp.org/www-project-web-security-testing-guide/). Recopilación de información.
4. **SANS.** [SANS Blog](https://www.sans.org/blog/). Recursos sobre OSINT.

## Guías relacionadas

- [Introducción a OSINT](../introduccion-a-osint-busqueda-de-informacion-publica/index.md)
- [Maltego para OSINT](../maltego-desde-cero-para-investigaciones-osint/index.md)
- [Amass](../amass-descubrir-subdominios-y-mapear-infraestructura/index.md)
- [Ingeniería social](../../seguridad-informatica/ingenieria-social-tecnicas-y-como-prevenirlas/index.md)
- [Índice de Hacking ético](../index.md)
