Por qué Google ignora tu sitemap y cómo diagnosticarlo

Lo hiciste todo bien. Generaste un sitemap XML válido, lo enviaste en Search Console y esperaste. Semanas después, el informe de cobertura sigue mostrando solo una fracción de tus URLs indexadas, o Search Console marca el sitemap como leído mientras la mayoría de las páginas se quedan en “Rastreada, actualmente sin indexar” o “Detectada, actualmente sin indexar.” Parece que Google ignora el archivo por completo.
En cierto sentido, así es. No porque el archivo esté roto, sino porque un sitemap no funciona como la mayoría supone. Entender qué promete de verdad un sitemap, y qué no, es la diferencia entre volver a enviarlo sin fin y una solución real. Esta guía repasa por qué Google descuenta un sitemap y cómo diagnosticar qué razón afecta a tu sitio.
Un sitemap es una pista, no una orden
Lo más importante de interiorizar es que un sitemap es una sugerencia. Le dice a los buscadores, aquí hay URLs que considero dignas de mirar. No fuerza el rastreo, no fuerza la indexación, y nunca lo ha hecho. Google lo ha dicho claramente durante años: enviar una URL en un sitemap no garantiza que se rastree, y que se rastree no garantiza que se indexe.
Compáralo con el robots.txt, que sí es una directiva. Cuando bloqueas una ruta, los rastreadores que la respetan la obedecen. Un sitemap no tiene ese poder. Se parece más a una carta de recomendación que a una orden de trabajo. Google lee la carta, la sopesa contra todo lo demás que sabe de tu sitio y luego decide según su propio calendario y sus propias prioridades.
Cuando aceptas ese marco, la pregunta cambia. Ya no es “por qué Google ignora mi lista,” sino “por qué Google elige no actuar sobre estas URLs concretas.” Esa sí es una pregunta que puedes responder, y las respuestas caen en cuatro categorías.
Razón 1: Las URLs que enviaste no son las que Google quiere
Es de lejos la causa más común y la más invisible. Tu sitemap lista una URL, pero esa URL no es la versión limpia, indexable y canónica de la página. Google la sigue, encuentra un motivo para no indexar esa dirección exacta y se va en silencio. Se repiten varios patrones.
La URL redirige. Tu sitemap lista http:// cuando el sitio funciona en https://, o lista un slug que ahora hace un 301 a otro sitio. Google sigue la redirección, indexa el destino y trata la entrada del sitemap como obsoleta. Cada URL redirigida en un sitemap es una señal desperdiciada.
La página lleva una etiqueta noindex. El sitemap dice “indexa esto,” la cabecera de la página o la etiqueta meta robots dice “no indexar.” Gana la etiqueta de la página, siempre. Un sitemap que lista una URL con noindex es una contradicción directa, y Google la resuelve en tu contra.
El canonical apunta a otro lado. Envías /producto?color=azul, pero la página declara un canonical de /producto. Google respeta el canonical y descarta la versión con parámetros. Si tu sitemap está lleno de URLs con parámetros o variantes de filtros, la mayor parte es redundante para Google.
La página está bloqueada por robots.txt. Una URL del sitemap bloqueada en robots.txt no puede rastrearse en absoluto. Google puede saber que existe, pero no recupera el contenido, lo que suele acabar en “Detectada, actualmente sin indexar.” Si ves ese estado de forma masiva, es un sospechoso principal. Nuestra guía sobre por qué las páginas se quedan detectadas pero sin indexar desglosa ese estado en detalle.
La solución para todo esto sigue el mismo principio: un sitemap solo debe contener URLs canónicas, autorreferenciales, indexables y con estado 200. Nada que redirija, nada bloqueado, nada cuyo canonical apunte a otro sitio. Cuando el sitemap y la página por fin coinciden, Google deja de descontar el archivo.
Razón 2: Google dejó de confiar en tu lastmod
El campo lastmod sirve para decir a los rastreadores cuándo cambió por última vez una URL de forma significativa, para que prioricen contenido fresco y salten páginas que no se han movido. Usado con honestidad, ayuda de verdad a que los sitios grandes se vuelvan a rastrear antes.
Usado con deshonestidad, se convierte en ruido que Google aprende a ignorar. Muchos sistemas y plugins estampan la fecha de hoy en cada URL del sitemap en cada reconstrucción, aunque en la página no haya cambiado nada. Cuando cada página afirma haber cambiado esta mañana, el campo no aporta información. Google detecta el patrón, considera tus valores de lastmod poco fiables y empieza a ignorarlos en todo el sitio.
El diagnóstico es simple. Abre tu sitemap y mira los valores de lastmod en una muestra de URLs. Si páginas que no tocas desde hace un año muestran todas una fecha reciente, tu lastmod miente. La solución es emitir lastmod solo cuando el contenido cambia de verdad, y omitirlo antes que falsearlo. La mecánica de construirlo bien está en nuestra guía más profunda sobre crear y validar sitemaps XML a escala.
Razón 3: El archivo nunca se recuperó limpiamente
A veces Google no descuenta tu sitemap por su contenido. Nunca lo leyó del todo. Estos fallos son más silenciosos que un error grave porque Search Console a menudo informa “Correcto” de un sitemap que solo procesó en parte.
Un puñado de problemas lo provocan. El sitemap está en una URL que a su vez está bloqueada por robots.txt. El archivo se sirve con el tipo de contenido equivocado, así que se trata como página web y no como XML. Supera los límites, 50.000 URLs o 50 MB sin comprimir, y el excedente se descarta en silencio. O un índice de sitemaps referencia sitemaps hijos en URLs que dan 404. Cualquiera de estos puede dejar a Google con una vista parcial o vacía de tus URLs mientras el informe se ve verde.
Para diagnosticar, recupera el sitemap como lo haría un rastreador, no en una pestaña del navegador que lo renderiza amablemente. Pide el archivo en bruto, confirma que devuelve estado 200 con tipo de contenido XML, comprueba que está por debajo de los límites de tamaño y, si es un índice, confirma que cada sitemap hijo que lista resuelve de verdad. Que una persona pueda abrir el archivo en el navegador no prueba que un bot lo recuperara limpio.
Razón 4: Las páginas son reales, pero Google raciona atención
Supón que las URLs están limpias, el lastmod es honesto y el archivo se recupera perfecto. Google aún puede dejar páginas fuera, y aquí la razón es la calidad y el presupuesto, no la mecánica.
Google no le debe un hueco en el índice a cada página. Reparte el rastreo y la indexación según cuánto confía en un sitio y cuánto valor espera de una página dada. En un sitio grande, las páginas delgadas, casi duplicadas y de plantilla de bajo valor compiten por una parte limitada de atención, y muchas pierden. De ahí suele venir “Rastreada, actualmente sin indexar”: Google recuperó la página, la juzgó indigna de un hueco y la dejó fuera. Meter más URLs en el sitemap no ayuda, porque el límite no es el descubrimiento, es el valor. Nuestra guía sobre cómo se gasta el crawl budget en páginas de bajo valor cubre esa competencia.
La solución incómoda es hacer el sitemap más pequeño y más fuerte, no más grande. Quita URLs delgadas y duplicadas, consolida páginas que se solapan y envía solo las páginas que defenderías de verdad como dignas de indexar. Un sitemap ajustado de páginas fuertes gana más atención de Google que uno inflado de relleno.
Cómo diagnosticar esto en tu propio sitio
El patrón en las cuatro razones es una brecha entre lo que afirma tu sitemap y lo que son en realidad tus páginas. Esa brecha no la ves solo en Search Console, porque te muestra el resultado, no la causa. Lo que necesitas es un rastreo completo de tu propio sitio que puedas comparar con el sitemap, línea por línea.
Para eso está hecho un rastreador de escritorio. Rastrea tu dominio, cruza el resultado con las URLs de tu sitemap y hazte las preguntas que plantea cada razón. Qué URLs del sitemap devuelven un estado distinto de 200. Cuáles redirigen. Cuáles llevan una etiqueta noindex o un canonical que apunta a otro sitio. Cuáles están bloqueadas en robots.txt. Qué páginas casi no tienen contenido único. Cada una es una URL que tu sitemap no debería pedirle a Google que indexe, y encontrarlas convierte un vago “Google ignora mi sitemap” en una lista concreta de correcciones.
Este tipo de comprobación puedes hacerla gratis tú mismo. Seodisias rastrea todo tu sitio en tu propia máquina, en Windows, macOS o Linux, sin límite de URLs y sin que los datos salgan de tu ordenador, para que alinees tus páginas en vivo contra tu sitemap y veas las discrepancias directamente. Cuando las páginas que envías y las que Google encuentra por fin describen el mismo sitio, el sitemap deja de parecer ignorado, porque ya no queda nada en él que Google pueda descontar.
Conclusión
Google no ignora tu sitemap por despecho, y volver a enviarlo no cambiará nada. Un sitemap es una pista, y Google la descuenta por razones concretas: las URLs contradicen a las páginas mediante redirecciones, etiquetas noindex o canonicals, el campo lastmod ha perdido su credibilidad, el archivo nunca se recuperó limpio, o las páginas simplemente no merecen un hueco en el índice. Cada una es diagnosticable y cada una tiene arreglo, pero solo cuando dejas de tratar el sitemap como una orden y empiezas a tratarlo como una afirmación que tienes que respaldar.
El siguiente paso es dejar de adivinar y mirar. Rastrea tu propio sitio, compáralo con el sitemap y deja que las discrepancias te digan cuál de las cuatro razones actúa. Corrige esas, mantén el archivo con URLs canónicas limpias que defenderías, y dale a Google un sitemap que no tenga razón para ignorar.