Saltearse al contenido

Google Dorking

Google (y otros buscadores) ya han indexado gran parte de lo que una organización expone sin darse cuenta: paneles de login, ficheros de configuración, documentos internos, backups, credenciales en texto. El “dorking” es usar operadores de búsqueda avanzados para encontrar exactamente eso. Es recon 100% pasivo —solo consultas al buscador— y de lo más rentable: hallazgos críticos sin tocar al objetivo.

site:target.com limita a un dominio (y subdominios)
inurl:admin término en la URL
intitle:"index of" término en el título (listados de directorios)
filetype:pdf / ext:sql por extensión de fichero
intext:"password" término en el cuerpo
cache:target.com versión cacheada
-site:www.target.com excluir (ver otros subdominios)
"frase exacta" coincidencia literal
* comodín

Se combinan: site:target.com filetype:pdf confidential.

# listados de directorios abiertos
site:target.com intitle:"index of"
# ficheros sensibles indexados
site:target.com ext:sql | ext:bak | ext:log | ext:env | ext:config
site:target.com filetype:xls | filetype:csv intext:password
# paneles de login / administración
site:target.com inurl:login | inurl:admin | inurl:dashboard
# documentos con metadatos (ver recon-metadatos)
site:target.com filetype:pdf | filetype:docx | filetype:xlsx
# errores que filtran info / rutas
site:target.com intext:"sql syntax near" | "fatal error"
# subdominios y entornos
site:*.target.com -www
# claves / secretos en código indexado
site:target.com intext:"api_key" | "BEGIN RSA PRIVATE KEY"
Bing (operadores propios: ip:, feed:) Yandex (muy potente para imágenes/dorks)
DuckDuckGo, Brave GitHub code search (ver recon-code)
# agregadores de dorks
Google Hacking Database (GHDB) de Exploit-DB: miles de dorks catalogados
# documentos filtrados con metadatos
site:target.com filetype:pdf -> descargar y extraer metadatos (recon-metadatos)
# buckets de cloud expuestos (ver cloud)
site:s3.amazonaws.com target "target" en Google / grayhatwarfare

El dorking consulta al buscador, no al objetivo → muy sigiloso. Aun así, no automatices cientos de consultas desde tu IP (Google te bloqueará con CAPTCHAs); usa herramientas que respeten el rate o hazlo manual para lo importante.

Evitar que lo sensible se indexe: robots.txt no oculta (solo pide no indexar, y revela rutas); lo correcto es no exponer ficheros sensibles, usar autenticación, cabeceras X-Robots-Tag: noindex, y monitorizar con los mismos dorks qué hay indexado de tu organización. Quitar de Google lo ya indexado requiere eliminar el recurso + solicitar retirada.

  • site: para mapear lo indexado del dominio y subdominios
  • Listados de directorios (intitle:"index of")
  • Ficheros sensibles por extensión (sql, env, bak, log, config)
  • Documentos (pdf/docx/xlsx) para metadatos
  • Paneles de login/admin (inurl:)
  • Errores que filtran rutas o stack
  • Secretos/claves en contenido indexado
  • Revisar GHDB para dorks específicos del stack