Volver a todos los artículos
guides 6 min read

Cómo encontrar los crawlers de IA en sus logs del servidor: quién visita, cuánto y cómo verificarlo

Serap Gündoğdu ·
Cómo encontrar los crawlers de IA en sus logs del servidor: quién visita, cuánto y cómo verificarlo

Las grandes mediciones del sector ya coinciden en algo que hace cinco años habría sonado absurdo: el tráfico automatizado ha superado al humano en la web. El panorama general de ese cambio lo analizamos en el tráfico de bots ya supera la mitad de la web. Este artículo es la continuación práctica, porque la pregunta interesante para quien gestiona un sitio no es “¿está la web llena de bots?” sino “¿cuáles de ellos están en mi sitio y qué hacen ahí?”. Hay exactamente un lugar donde esa pregunta se responde con honestidad: sus logs del servidor. Analytics no muestra a estos visitantes, porque los crawlers de IA no ejecutan etiquetas de JavaScript. La línea de log suele ser el único rastro que dejan.

Así que leamos los logs. Esta es una guía para encontrar crawlers de IA en su access log, verificar que son quienes dicen ser y pensar con claridad sobre qué significa su presencia.

A quién está buscando

Los crawlers relacionados con IA se dividen en tres grupos que se comportan de forma muy distinta, y confundirlos lleva a malas decisiones.

El primer grupo son los crawlers de entrenamiento, que recogen contenido para entrenar futuros modelos: GPTBot (OpenAI), ClaudeBot (Anthropic), CCBot (Common Crawl, con cuyo corpus entrenan muchos laboratorios), Bytespider (ByteDance), meta-externalagent (Meta), Amazonbot (Amazon). Bloquearlos afecta a si su contenido acaba algún día dentro de los pesos de un modelo; no afecta a si usted aparece hoy en las respuestas de la búsqueda con IA.

El segundo grupo son los crawlers de índice de búsqueda de los motores de respuestas: OAI-SearchBot (el índice de búsqueda de OpenAI) y PerplexityBot (el índice de Perplexity). Estos deciden si sus páginas pueden ser encontradas y citadas por esos productos. Bloquearlos se parece mucho más a bloquear a Googlebot que a renunciar al entrenamiento.

El tercer grupo son los fetchers bajo demanda, que recuperan una página en el momento en que un usuario pregunta por ella: ChatGPT-User, Claude-User, Perplexity-User. Un hit de uno de estos suele significar que una persona real, ahora mismo, está leyendo su contenido a través de un asistente de IA. Es lo más parecido a un referral que tiene este ecosistema.

Una entrada merece nota aparte porque confunde a todo el mundo: Google-Extended no es un crawler y nunca aparece en sus logs. Es un token de robots.txt que indica a los crawlers habituales de Google si su contenido puede usarse para entrenamiento de IA. El que descarga es, en cualquier caso, el Googlebot de siempre. Si una guía de análisis de logs le dice que busque hits de Google-Extended, esa guía está adivinando.

Sacarlos del log

Con un access log estándar, la primera pasada es un comando:

grep -iE "gptbot|oai-searchbot|chatgpt-user|claudebot|claude-user|perplexitybot|ccbot|bytespider|amazonbot|meta-external" access.log | awk '{print $1}' | sort | uniq -c | sort -rn

Eso da recuentos por IP para toda la cohorte de IA. Dos refinamientos lo vuelven útil de verdad. Separe los recuentos por user agent en lugar de mezclarlos, para ver si trata con recolección de entrenamiento o con lecturas de usuarios en vivo:

grep -ioE "gptbot|oai-searchbot|chatgpt-user|claudebot|claude-user|perplexitybot|ccbot|bytespider" access.log | sort | uniq -c | sort -rn

Y mire qué descargan, no solo cuánto. Un crawler de entrenamiento que recorre su archivo una vez al mes es una historia distinta a un fetcher bajo demanda que golpea la misma página de producto cuarenta veces al día. El segundo le está diciendo por cuáles de sus páginas preguntan de verdad los usuarios de IA, que es estudio de mercado gratuito si se molesta en leerlo.

El problema de los impostores

Y aquí la parte que la mayoría de artículos se salta: un user agent es una afirmación, no una credencial. Cualquiera puede enviar GPTBot en una cabecera. Los scrapers se hacen pasar de forma rutinaria por bots de IA conocidos precisamente porque muchos sitios tratan ahora esos nombres con suavidad. Antes de concluir nada de sus recuentos, y mucho antes de tomar decisiones de bloqueo basadas en ellos, verifique.

El método limpio es la verificación DNS en ambos sentidos. Tome la IP, haga una búsqueda inversa y compruebe que el hostname resultante pertenece al dominio del operador; después resuelva ese hostname hacia delante y confirme que devuelve la misma IP:

host 203.0.113.42          # inversa: debería terminar en algo como openai.com
host <hostname-obtenido>   # directa: debería devolver 203.0.113.42

Los grandes operadores publican además sus rangos de IP de crawler como listas legibles por máquinas (OpenAI, Anthropic y Perplexity lo hacen), de modo que puede cotejar una IP sospechosa directamente contra los rangos publicados. En la práctica, una parte apreciable del tráfico que se declara bot de IA suspende estas comprobaciones. Trate los hits verificados y los no verificados como dos conjuntos de datos separados: uno habla de empresas de IA, el otro de scrapers con sus chaquetas puestas.

Qué hacer con todo esto

Una vez que sabe quién visita de verdad, las decisiones se vuelven decisiones normales de política, no pánico. Si no quiere alimentar corpus de entrenamiento, bloquee al grupo de entrenamiento en robots.txt; la sintaxis y sus contrapartidas están en nuestra guía completa de robots.txt y crawlers de IA. Si le importa la visibilidad en la búsqueda con IA, cuide de no bloquear a los crawlers de índice y a los fetchers bajo demanda mientras apunta a los bots de entrenamiento; ese error de fuego amigo es común y le borra en silencio de las respuestas de IA. Y si un crawler agresivo carga su servidor, recuerde: los bots educados respetan las reglas de robots tras la verificación, los impostores no, y por eso la verificación va primero. A los impostores se les limita o bloquea en el firewall, no en robots.txt, porque robots.txt es una nota que solo leen los actores honestos.

El último hábito que vale la pena: compare el comportamiento de la cohorte de IA con un rastreo propio de su sitio. Los bots ven el sitio que usted sirve de verdad, no el que cree servir. Un rastreo completo muestra lo que cualquier crawler encuentra, sea de búsqueda o de IA: enlaces rotos, cadenas de redirecciones, secciones bloqueadas por accidente. Si GPTBot gasta sus visitas en URLs con parámetros que usted había olvidado, la solución no es una política de IA, es higiene técnica corriente, y una auditoría técnica de SEO la saca a la superficie.

En resumen

Sus logs del servidor son el único registro honesto de los visitantes más relevantes de la era de la IA, y leerlos cuesta un grep y un hábito de verificación. Clasifique a los visitantes en entrenamiento, índice y bajo demanda; verifique antes de fiarse de cualquier nombre; y decida los bloqueos por grupo, no de una sola pasada. Los bots no van a desaparecer; les irá bien a los sitios que sepan exactamente quién llama a la puerta.