Saltearse al contenido

Archivos históricos (Wayback)

Internet no olvida: la Wayback Machine y otros archivos guardan versiones antiguas de las webs. Para un atacante, eso es una mina: endpoints que ya no están enlazados pero siguen funcionando, parámetros antiguos vulnerables, ficheros que se “quitaron” pero no se borraron, secretos en versiones previas del código, y subdominios/tecnologías que la empresa ya no usa pero dejó expuestos. El pasado de un sitio revela superficie que el presente oculta.

  • URLs y endpoints históricos: rutas, parámetros y APIs que ya no se enlazan.
  • Parámetros antiguos: candidatos para fuzzing (muchos siguen activos y vulnerables).
  • Ficheros retirados: backups, docs, configs que se quitaron del índice pero no del servidor.
  • Cambios de tecnología: qué usaban antes (versiones viejas aún accesibles).
  • Contenido eliminado: texto, emails, nombres que la empresa borró.
Wayback Machine (archive.org) el principal archivo histórico
archive.today / archive.ph snapshots puntuales
Common Crawl corpus masivo de la web
Google/Bing cache versiones recientes cacheadas
# gau: URLs de Wayback + Common Crawl + otros
gau target.com | sort -u > urls.txt
# waymore: más exhaustivo (Wayback + CC + URLScan + VirusTotal)
waymore -i target.com -mode U
# waybackurls (clásico)
waybackurls target.com
# API directa de Wayback
curl -s "http://web.archive.org/cdx/search/cdx?url=target.com*&output=text&fl=original&collapse=urlkey"
# filtrar las que tienen parámetros (candidatas a fuzzing/IDOR/SQLi/XSS)
cat urls.txt | grep "=" | sort -u
# extraer solo los nombres de parámetros (para fuzzear valores)
cat urls.txt | grep -oE '[?&][a-zA-Z0-9_]+=' | sort -u
# comprobar cuáles siguen vivas hoy
cat urls.txt | httpx -mc 200,301,302,403 -silent
# buscar ficheros jugosos en el histórico
cat urls.txt | grep -iE '\.(bak|sql|zip|env|config|log|json)$'

Las URLs vivas con parámetros son objetivos directos para las pruebas de la sección Web (SQLi, XSS, IDOR, open redirect).

# snapshot concreto de una página (ver código/secretos de entonces)
https://web.archive.org/web/2021*/target.com/config.js

Útil para recuperar JavaScript antiguo con endpoints/claves que ya no están en la versión actual.

No puedes borrar el pasado del archivo, pero sí: rotar cualquier secreto que estuvo alguna vez en una versión pública, retirar de verdad (no solo des-enlazar) los recursos sensibles del servidor, desactivar endpoints/parámetros antiguos, y asumir que todo lo que publicaste alguna vez sigue siendo accesible para quien busque.

  • Extraer URLs históricas (gau/waymore/waybackurls)
  • Filtrar URLs con parámetros (candidatas a fuzzing)
  • Comprobar cuáles siguen vivas (httpx)
  • Buscar ficheros retirados (bak/sql/env/config)
  • Recuperar JS antiguo con endpoints/secretos
  • Detectar tecnologías/subdominios abandonados
  • Alimentar las pruebas Web con los endpoints vivos
  • Revisar archive.today para snapshots puntuales