Volver a todos los artículos
guides 9 min read

Cómo verificar el tráfico de Googlebot con rangos de IP

Serap Gündoğdu ·
Cómo verificar el tráfico de Googlebot con rangos de IP

Cómo verificar el tráfico de Googlebot con archivos de rangos de IP

Una línea en el registro de su servidor (server log) indica que Googlebot acaba de rastrear su página de precios. ¿Es cierto? La cadena de user agent (agente de usuario) dice que sí, pero las cadenas de user agent son una de las cosas más fáciles de falsificar en internet. Los scrapers (extractores de contenido), ladrones de contenido y herramientas de la competencia se disfrazan rutinariamente de Googlebot porque la mayoría de los servidores nunca verifican más allá de esa única cabecera. Google lo sabe, y por eso publica archivos de rangos de IP legibles por máquina que le permiten confirmar, con total certeza, si una solicitud realmente proviene de su infraestructura de rastreo.

Esto es importante por dos razones prácticas. Primero, la seguridad: el tráfico falso de Googlebot puede extraer su contenido, sobrecargar su servidor o buscar vulnerabilidades mientras se oculta detrás de un nombre de confianza. Segundo, el presupuesto de rastreo (crawl budget): si su servidor consume ciclos de CPU atendiendo a impostores, el Googlebot real recibirá menos atención y sus páginas reales tardarán más en ser rastreadas e indexadas. Verificar el tráfico de los bots no es un caso extremo de paranoia, es una práctica básica de higiene para cualquiera que gestione un sitio web que dependa de la búsqueda orgánica.

Por qué la cadena de User Agent por sí sola no demuestra nada

La cabecera User-Agent es simplemente una cadena de texto que el cliente envía con cada solicitud. Nada impide que un script de extracción (scraping) configure este valor como Mozilla/5.0 (compatible; Googlebot/2.1; +http://www.google.com/bot.html), que es exactamente la cadena que utiliza el Googlebot real. Los servidores que solo verifican esta cabecera para el control de acceso o la segmentación de analítica están confiando en un valor que el visitante controla por completo.

El efecto práctico se manifiesta en dos lugares. En la analítica, las visitas fantasma de un supuesto “Googlebot” inflan los números de la actividad de rastreo y hacen parecer que Google está prestando más atención a su sitio de la que realmente recibe. En los registros del servidor, un pico de solicitudes de un Googlebot falso puede parecer un aumento legítimo de rastreo, enmascarando lo que en realidad es un extractor de datos que cosecha su contenido o un actor malicioso probando endpoints (puntos de acceso de la API). Ninguno de estos problemas es visible hasta que alguien contrasta la dirección IP detrás de la solicitud, que es precisamente para lo que sirven las herramientas de verificación de Google.

De DNS inverso a JSON: los métodos de verificación actuales de Google

Google ha ofrecido una forma de verificar sus rastreadores (crawlers) durante años, pero el método ha evolucionado.

Búsqueda de DNS inverso, el método clásico

El enfoque tradicional es una verificación de DNS de dos pasos. Primero, se realiza una búsqueda de DNS inverso (reverse DNS lookup) en la dirección IP que realizó la solicitud; una IP auténtica de Googlebot se resuelve en un nombre de host (hostname) que termina en googlebot.com o google.com. Segundo, se realiza una búsqueda de DNS directa (forward DNS lookup) en ese nombre de host y se confirma que apunte de nuevo a la misma dirección IP original. Si ambas comprobaciones coinciden, la solicitud está verificada. Google sigue documentando y admitiendo este método, el cual continúa siendo útil para comprobaciones manuales puntuales o para equipos cuyas herramientas de seguridad existentes están diseñadas en torno a la resolución de DNS en lugar de listas estáticas.

La desventaja es la velocidad y el costo de automatización. Realizar dos viajes de ida y vuelta de DNS por cada solicitud no es algo que se quiera hacer en tiempo real (inline) en cada visita a un servidor de producción, especialmente a gran escala. Funciona bien para comprobar de forma puntual un puñado de entradas sospechosas en el registro, pero no es adecuado para reglas de cortafuegos (firewall) en tiempo real.

Los archivos JSON de rangos de IP

Para resolver el problema de la automatización, Google publica ahora archivos JSON estructurados que enumeran los rangos de IP que utilizan sus rastreadores. Un script puede obtener, almacenar en caché y comparar estos archivos para convertirlos directamente en listas de permitidos para cortafuegos o reglas de servidor, sin necesidad de realizar búsquedas de DNS en el momento de la solicitud. Este es el método en torno al cual vale la pena crear automatizaciones si usted gestiona un sitio con un volumen significativo de tráfico de bots.

googlebot.json frente a special-vendors.json

Aquí está el detalle que la mayoría de los tutoriales rápidos pasan por alto, y que es sumamente importante: Google no publica un solo archivo, sino varios, y confundirlos puede causar problemas reales.

  • googlebot.json detalla los rangos de IP utilizados por el rastreador principal que indexa sus páginas para la búsqueda, incluyendo su componente de renderizado.
  • special-vendors.json enumera los rangos de IP de servicios independientes de Google, como los rastreadores de verificación de Google Ads y otros sistemas de obtención de datos con fines específicos.

Si configura una regla de cortafuegos que solo permita los rangos de googlebot.json y bloquee todo lo demás etiquetado como “Google”, podría cortar accidentalmente el tráfico de verificación relacionado con Ads. Esto se traduciría en una caída de los niveles de calidad de los anuncios o en fallos de verificación que no tienen nada que ver con la búsqueda orgánica. Antes de escribir cualquier regla de lista de permitidos, confirme qué archivo coincide realmente con el servicio que está intentando proteger contra la suplantación de identidad.

Convertir la verificación en una práctica de seguridad y presupuesto de rastreo

Saber que los archivos existen es solo el primer paso. El verdadero valor proviene de integrar una verificación repetible en la forma en que supervisa su sitio.

Un flujo de trabajo de verificación manual

Para comprobaciones puntuales ocasionales, una rutina sencilla funciona: extraiga la IP sospechosa del registro de su servidor, obtenga el archivo googlebot.json actual de la documentación para desarrolladores de Google y verifique si la IP se encuentra dentro de uno de los rangos enumerados. Si no es así, y la solicitud también falla una comprobación de DNS inverso, se encuentra ante tráfico falsificado, no ante Googlebot. Vale la pena realizar este paso manual cada vez que detecte un pico inusual de visitas de “Googlebot”, un aumento repentino en el ancho de banda de un solo agente de usuario o cuando aparezca contenido copiado en otro sitio web poco después de un rastreo.

Automatización en el servidor

Para una protección continua, los rangos del archivo JSON se pueden convertir en reglas de servidor. Un enfoque básico en Nginx consiste en denegar todo el tráfico que afirme ser Googlebot mediante el user agent, a menos que la IP de origen coincida con un rango permitido. Esto se puede lograr combinando un bloque map basado en la dirección IP real con una respuesta alternativa return 403 para cualquier dirección fuera de los rangos conocidos. Los administradores de Apache pueden lograr el mismo resultado con reglas RewriteCond que verifiquen REMOTE_ADDR contra los rangos publicados antes de permitir que pase una solicitud que declare la identidad de Googlebot. La sintaxis exacta dependerá de su entorno de desarrollo, pero el principio es el mismo en todos los casos: verificar el origen de la red antes de confiar en la identidad declarada.

Aquí también es donde las herramientas de rastreo local demuestran su valor. Cuando usted audita su propio sitio con un crawler que se ejecuta en su máquina en lugar de un servicio en la nube compartido, las solicitudes en el registro de su servidor son de origen inequívoco: provienen de su propia IP, no de un grupo de terceros que podría ser marcado o confundido con tráfico de bots más adelante. Seodisias funciona de esta manera: se ejecuta localmente en Windows, macOS o Linux, de modo que cuando está probando cómo responde su sitio a un rastreo, no añade ruido a los datos de registro que intenta mantener limpios para la verificación de bots reales. Revisar cómo gestiona un sitio el acceso de los rastreadores, incluido el comportamiento de renderizado de JavaScript (JS), encaja de forma naturaleza en una auditoría técnica más amplia, como la descrita en nuestra lista de verificación de auditoría SEO lista para IA, donde el acceso de los bots y la integridad del renderizado forman parte del mismo análisis.

Por qué esto protege el presupuesto de rastreo, no solo la seguridad

Cada solicitud que su servidor procesa de un Googlebot falso es una solicitud que no está dedicando a la actividad de rastreo real. En sitios web más grandes, la carga repetitiva de la extracción de datos puede ralentizar los tiempos de respuesta generales, afectando también al rastreador legítimo. Bloquear a los imitadores no es solo una medida de seguridad; es una forma directa de mantener su presupuesto de rastreo centrado en el tráfico genuino de Google, en lugar de diluirlo con ruido que a primera vista parece idéntico pero consume los mismos recursos del servidor.

Conclusión

Verificar el tráfico de Googlebot es un pequeño hábito con una gran recompensa. La cadena de user agent le indica lo que un visitante afirma ser; los archivos de rangos de IP, contrastados con el DNS inverso cuando es necesario, le indican lo que realmente es. Conocer la diferencia entre googlebot.json y special-vendors.json le evita bloquear accidentalmente servicios legítimos de Google mientras filtra a los imitadores. Convertir esa comprobación en una regla de servidor automatizada, en lugar de una búsqueda manual única, es lo que mantiene la protección activa sin necesidad de estar pendiente de ella de forma constante.

Si quiere ver exactamente cómo se comporta su propio sitio durante un rastreo, incluidos los patrones de renderizado y acceso que debe tener en cuenta una configuración de verificación de bots, realice una auditoría completa con Seodisias, un rastreador SEO local, gratuito y multiplataforma (Windows, macOS y Linux) que no tiene límites de URL ni requiere registro.