Archivos históricos (Wayback)
Internet no olvida: la Wayback Machine y otros archivos guardan versiones antiguas de las webs. Para un atacante, eso es una mina: endpoints que ya no están enlazados pero siguen funcionando, parámetros antiguos vulnerables, ficheros que se “quitaron” pero no se borraron, secretos en versiones previas del código, y subdominios/tecnologías que la empresa ya no usa pero dejó expuestos. El pasado de un sitio revela superficie que el presente oculta.
Qué se consigue
Sección titulada «Qué se consigue»- URLs y endpoints históricos: rutas, parámetros y APIs que ya no se enlazan.
- Parámetros antiguos: candidatos para fuzzing (muchos siguen activos y vulnerables).
- Ficheros retirados: backups, docs, configs que se quitaron del índice pero no del servidor.
- Cambios de tecnología: qué usaban antes (versiones viejas aún accesibles).
- Contenido eliminado: texto, emails, nombres que la empresa borró.
Fuentes de archivo
Sección titulada «Fuentes de archivo»Wayback Machine (archive.org) el principal archivo históricoarchive.today / archive.ph snapshots puntualesCommon Crawl corpus masivo de la webGoogle/Bing cache versiones recientes cacheadasExtraer URLs históricas (para fuzzing)
Sección titulada «Extraer URLs históricas (para fuzzing)»# gau: URLs de Wayback + Common Crawl + otrosgau target.com | sort -u > urls.txt# waymore: más exhaustivo (Wayback + CC + URLScan + VirusTotal)waymore -i target.com -mode U# waybackurls (clásico)waybackurls target.com# API directa de Waybackcurl -s "http://web.archive.org/cdx/search/cdx?url=target.com*&output=text&fl=original&collapse=urlkey"Qué hacer con las URLs
Sección titulada «Qué hacer con las URLs»# filtrar las que tienen parámetros (candidatas a fuzzing/IDOR/SQLi/XSS)cat urls.txt | grep "=" | sort -u# extraer solo los nombres de parámetros (para fuzzear valores)cat urls.txt | grep -oE '[?&][a-zA-Z0-9_]+=' | sort -u# comprobar cuáles siguen vivas hoycat urls.txt | httpx -mc 200,301,302,403 -silent# buscar ficheros jugosos en el históricocat urls.txt | grep -iE '\.(bak|sql|zip|env|config|log|json)$'Las URLs vivas con parámetros son objetivos directos para las pruebas de la sección Web (SQLi, XSS, IDOR, open redirect).
Ver contenido antiguo concreto
Sección titulada «Ver contenido antiguo concreto»# snapshot concreto de una página (ver código/secretos de entonces)https://web.archive.org/web/2021*/target.com/config.jsÚtil para recuperar JavaScript antiguo con endpoints/claves que ya no están en la versión actual.
Para la defensa
Sección titulada «Para la defensa»No puedes borrar el pasado del archivo, pero sí: rotar cualquier secreto que estuvo alguna vez en una versión pública, retirar de verdad (no solo des-enlazar) los recursos sensibles del servidor, desactivar endpoints/parámetros antiguos, y asumir que todo lo que publicaste alguna vez sigue siendo accesible para quien busque.
Checklist de prueba
Sección titulada «Checklist de prueba»- Extraer URLs históricas (gau/waymore/waybackurls)
- Filtrar URLs con parámetros (candidatas a fuzzing)
- Comprobar cuáles siguen vivas (httpx)
- Buscar ficheros retirados (bak/sql/env/config)
- Recuperar JS antiguo con endpoints/secretos
- Detectar tecnologías/subdominios abandonados
- Alimentar las pruebas Web con los endpoints vivos
- Revisar archive.today para snapshots puntuales