Volver a todos los artículos
tutorials 12 min read

Como comprobar si los rastreadores de IA ven su contenido

Serap Gündoğdu ·
Como comprobar si los rastreadores de IA ven su contenido

Su pagina posiciona en Google. Lo comprobo, ahi esta, en la primera pagina para una consulta que le importa. Asi que da por hecho que el contenido es visible para las maquinas y sigue adelante. Luego le hace la misma pregunta a ChatGPT o a Perplexity y su pagina no aparece por ningun lado en la respuesta, mientras un competidor mas pobre si es citado. El posicionamiento era real. La visibilidad no. Este tutorial le muestra como comprobar esa brecha de forma directa, en pocos comandos, antes de que le cueste en silencio la proxima era del trafico de busqueda.

El motivo de la brecha merece un parrafo, y no mas, porque el mecanismo esta cubierto a fondo en otro lugar. Googlebot renderiza JavaScript. Descarga su pagina, la pone en cola, ejecuta los scripts y, con el tiempo, indexa el resultado final. La mayoria de los rastreadores de IA no hacen esto. Descargan el HTML crudo que envia su servidor y se quedan con el texto que ya esta dentro. Si su contenido se ensambla en el navegador mediante JavaScript, Google puede esperarlo y los motores de IA por lo general no. Para el panorama completo de como las estrategias de renderizado provocan esto, lea la guia de SEO y renderizado con JavaScript. Este articulo es la otra mitad de esa historia: no que estrategia elegir, sino como medir lo que ya esta publicando.

Que significan realmente los bytes legibles

Cada pagina que sirve tiene dos versiones. La primera es el HTML crudo, los bytes exactos que devuelve su servidor antes de que se ejecute cualquier script. La segunda es el DOM renderizado, lo que la pagina llega a ser despues de que JavaScript se ejecute en un navegador. Una persona ve la segunda version. Un rastreador que no renderiza solo ve la primera.

El numero util es cuanto texto real y legible vive en esa primera version. Llamemoslo el contenido legible de la pagina. No el tamano en bytes del archivo, inflado por scripts, estilos en linea y codigo de relleno del framework, sino las palabras visibles que un lector podria extraer de verdad solo del HTML crudo.

Una entrada de blog renderizada en el servidor tiene casi todo su contenido legible en el HTML crudo. Una aplicacion de una sola pagina a menudo no tiene casi nada. Su HTML crudo es un cascaron: un <div id="root">, unas cuantas etiquetas <script> y un indicador de carga. Para un navegador eso es el comienzo de una pagina. Para un rastreador de IA eso es la pagina entera, y no contiene ningun articulo.

El patron se ve mas facil uno junto al otro. El mismo articulo de 1.500 palabras, servido de dos maneras distintas, produce un HTML crudo muy diferente:

Como se publica el articuloTexto legible en el HTML crudoCon que se queda un rastreador de IA
Pagina estatica o renderizada en el servidorCasi las 1.500 palabrasEl articulo completo
Pagina hidratada con el contenido en el HTML inicialCasi las 1.500 palabrasEl articulo completo
Ruta renderizada en el cliente (contenido descargado tras la carga)Un cascaron y un indicador de cargaCasi nada

La prueba que esta a punto de ejecutar responde una pregunta para cualquier URL: si el lector fuera una maquina que no ejecuta JavaScript, cuanto de mi contenido sobreviviria? Todo lo que sigue es una forma de ver ese numero, primero para una pagina y luego para un sitio entero.

Tres formas de ver lo que ve un rastreador que no renderiza

No necesita software especial para una sola pagina. Necesita una terminal y un navegador. Cada metodo a continuacion muestra el mismo HTML crudo desde un angulo ligeramente distinto, y usar dos de ellos juntos elimina cualquier duda.

La descarga cruda

curl descarga una URL e imprime exactamente lo que envia el servidor, sin ninguna ejecucion de JavaScript. Eso lo convierte en lo mas parecido a la vista de un rastreador de IA que ya tiene instalado.

curl -s https://example.com/your-page > raw.html

Abra raw.html en un navegador, o desplacese por el en la terminal, y busque una frase que sepa que esta en su articulo. Si su parrafo de apertura esta ahi, bien. Si todo lo que ve es un cascaron y etiquetas de script, eso es lo que ve tambien el rastreador.

Un matiz importa. Algunos sitios sirven un HTML distinto a los bots que a los navegadores, a veces a proposito y a veces por accidente. Para detectarlo, descargue con una identidad real de rastreador de IA para ver lo que se le sirve de verdad al bot:

curl -s -A "Mozilla/5.0 (compatible; GPTBot/1.0; +https://openai.com/gptbot)" \
  https://example.com/your-page > raw-as-bot.html

Si raw.html y raw-as-bot.html difieren en su texto legible, tiene una inconsistencia de servido que conviene entender antes que cualquier otra cosa.

La vista con JavaScript desactivado

La descarga cruda muestra los bytes. El navegador con JavaScript desactivado muestra esos mismos bytes renderizados como pagina, lo que a menudo es mas facil de juzgar de un vistazo.

En Chrome, abra las DevTools, abra el menu de comandos con Control+Shift+P o Command+Shift+P, escriba “Disable JavaScript”, seleccionelo y recargue la pagina. Lo que queda en pantalla es, a grandes rasgos, lo que conserva un rastreador que no renderiza. Si el cuerpo del articulo desaparece y se queda con una cabecera y un marco vacio, el contenido depende de JavaScript que el rastreador nunca ejecutara.

Vale la pena hacer esta vista incluso cuando la salida de curl se veia bien, porque detecta contenido que esta presente en el HTML pero que los scripts ocultan o reemplazan al cargar.

La comparacion renderizada

Para demostrar la brecha en lugar de sospecharla, compare los dos estados. Un conteo aproximado del contenido legible del HTML crudo se logra con un comando. Este elimina scripts y estilos, quita las etiquetas y cuenta los caracteres del texto visible que queda:

curl -s https://example.com/your-page \
  | perl -0777 -pe 's/<(script|style)[^>]*>.*?<\/\1>//gs; s/<[^>]+>/ /g; s/\s+/ /g' \
  | wc -c

Ejecutelo en una pagina que sepa que esta renderizada en el servidor y anote el numero. Ejecutelo en una pagina que sospeche renderizada en el cliente y compare. Un articulo rico en contenido que devuelve unos pocos cientos de caracteres le esta diciendo que sus palabras no estan en el HTML crudo. La cifra exacta no importa. Lo que revela el problema es la proporcion entre una pagina sana y una sospechosa.

Asi se relacionan los tres metodos, para que pueda elegir el adecuado en cada momento:

MetodoQue muestraIdeal para
Descarga cruda con curlLos bytes exactos que recibe un rastreadorUna comprobacion rapida y automatizable y detectar servido especifico para bots
JavaScript desactivado en el navegadorEl HTML crudo renderizado como paginaJuzgar de un vistazo si el cuerpo sobrevive
Conteo de contenido legibleUn numero aproximado para comparar paginasDemostrar una brecha en lugar de sospecharla

Dos de los tres juntos suele bastar. La descarga con curl le dice que se sirve, y la vista con JavaScript desactivado le dice como se ve eso para un lector que en realidad es una maquina.

Auditar el contenido legible en todo un sitio

Probar una URL a mano esta bien para una comprobacion puntual. No escala a un sitio con cientos de plantillas y miles de paginas, y las paginas que fallan rara vez son las que pensaria en probar. La pagina de inicio suele estar bien. La pagina de producto profunda, el listado filtrado, el articulo cargado mediante una ruta del lado del cliente, ahi es donde el contenido desaparece en silencio.

Para escalar, quiere un rastreador que pueda descargar cada URL dos veces, una como HTML crudo y otra con un motor de navegador real, y reportar la diferencia por pagina. Esa diferencia es la auditoria. Las paginas donde la version renderizada tiene mucho mas contenido legible que la version cruda son su lista de riesgo, ordenada.

Esta es exactamente la brecha que Seodisias esta construido para sacar a la luz. Rastrea con un motor de navegador real y reporta que contenido se extrajo de verdad, para que pueda comparar lo que produce su codigo con lo que conserva un rastreador, en todo el sitio en lugar de una pagina cada vez. Su analisis AI Ready mira la misma cuestion desde el lado del contenido, comprobando si el texto que si sobrevive esta estructurado de una forma que los motores de IA puedan usar. Como sea que ejecute la auditoria, el principio es el mismo: nunca de por sentado que una plantilla es segura porque una pagina en ella se veia bien.

Mientras audita, ayuda saber que maquinas visitan de verdad. Sus registros de acceso ya las listan, y encontrar rastreadores de IA en los registros de su servidor le dice si GPTBot, ClaudeBot y los demas estan llegando a sus paginas siquiera. Una pagina que es invisible en el HTML crudo y que nunca se rastrea tiene dos problemas, no uno.

Leer los resultados sin exagerar

Una prueba fallida es una senal, no un veredicto. Antes de reescribir una arquitectura, ordene lo que encontro por cuanto importa.

Empiece por la intencion. Un panel con sesion iniciada, una pantalla de configuracion de cuenta o una herramienta interna no tienen razon para ser legibles por un rastreador de IA, y el renderizado del lado del cliente es una eleccion perfectamente valida ahi. Que falte contenido legible en esas paginas no es un fallo. Es el diseno funcionando como se pretende.

Luego mire las paginas que existen para ser encontradas. Articulos, guias, paginas de producto y de categoria, documentacion, cualquier cosa que deberia aparecer en una respuesta o una cita. Cuando esas vuelven casi vacias en el HTML crudo, ese es el hallazgo real, y merece atencion en proporcion aproximada al trafico y a las citas que la pagina deberia estar ganando.

Vigile tambien los fallos parciales, porque son faciles de pasar por alto. Una pagina cuyo texto del cuerpo esta en el HTML crudo pero cuyo <title> y meta descripcion inyecta JavaScript tras la carga se leera con un nombre generico del sitio como titulo. Las palabras son visibles, el encuadre no, y en las respuestas de IA el encuadre suele ser lo que se cita. Una forma rapida de detectar esto es confirmar que el titulo y la descripcion que espera estan presentes en la salida de curl, no solo el cuerpo.

Por ultimo, resista la tentacion de tratar cada brecha como urgente. Un repaso trimestral de una muestra de paginas de cada plantilla detecta las regresiones a tiempo sin convertir un habito de medicion en un panico. El sentido de la prueba es una conciencia serena de lo que conservan las maquinas, ejecutada con la frecuencia suficiente para confiar en ella.

Lo que la prueba no le dice

Esta es una prueba de visibilidad, no una prueba de citacion, y la diferencia vale la pena tenerla presente. Pasarla significa que un rastreador de IA puede leer sus palabras. No significa que un motor vaya a elegir citarlas. Muchas paginas son perfectamente legibles en el HTML crudo y aun asi nunca aparecen en una respuesta, porque el contenido es pobre, indiferenciado o sencillamente no es la mejor fuente para la pregunta.

Piense en el contenido legible como el billete de entrada. Sin el no esta en la sala en absoluto, por muy buena que sea la redaccion. Con el, es elegible, y entonces el trabajo de siempre decide el resultado: estructura clara, experiencia genuina, informacion que un lector no puede conseguir en otros diez lugares. Ese trabajo es el tema del manual de optimizacion para motores generativos, y esta prueba es simplemente la comprobacion que ejecuta primero, porque es el unico fallo que hace irrelevante todo lo demas.

La prueba tambien es una instantanea, no un monitor. Una pagina que pasa hoy puede sufrir una regresion la proxima vez que un componente se refactorice para descargar su contenido en el cliente, y nada en el posicionamiento le avisara. Por eso el habito importa mas que cualquier resultado individual. Mida segun un calendario, guarde los numeros y vigile la pagina que solia estar llena y de repente es un cascaron.

Conclusion

Los posicionamientos le dicen lo que hace Google despues de renderizar su pagina. No dicen nada de lo que conserva un rastreador de IA cuando no lo hace. La unica forma de saberlo es mirar el HTML crudo directamente, y ahora tiene tres formas de hacerlo para una pagina y una forma de hacerlo en todo un sitio. Descargue la pagina, desactive JavaScript, compare el contenido legible y ordene los resultados segun si la pagina estuvo pensada alguna vez para ser encontrada. Cuando las paginas que importan vuelven vacias, la solucion es una decision de renderizado, y vale la pena trabajar las opciones con cuidado en lugar de adivinar. Meter las palabras en la primera version de la pagina es la base para todo lo demas, porque un motor no puede citar lo que nunca leyo. Si quiere ejecutar esta auditoria en todo un sitio en lugar de una URL cada vez, descargue Seodisias gratis y dejelo rastrear con un motor de navegador real. Mida primero, y luego arregle lo que demuestre la medicion.