Ir al contenido

Glosario Noindex

¿Qué es Noindex?

Definición

Noindex es una directiva que indica a los buscadores que no incluyan una URL concreta en su índice, así que esa página deja de aparecer en los resultados de búsqueda aunque el sitio siga sirviéndola con normalidad.

Una estantería de libros antiguos con uno colocado del revés, mostrando el corte, junto al título Noindex
El libro sigue en el estante, pero de espaldas
En esta página 6
  1. ¿Qué es noindex?
  2. Meta-tag o cabecera HTTP: cuándo usar cada variante
  3. Diferencia con canonical
  4. Diferencia con robots.txt: el malentendido entre rastreo e indexación
  5. Buenas prácticas
  6. Errores frecuentes
En breve

Cómo se aplica noindex mediante meta-tag o cabecera HTTP, en qué se diferencia de canonical y de robots.txt, y por qué usarlo para tapar contenido pobre sale más caro que reescribirlo.

Una estantería de libros antiguos con uno colocado del revés, mostrando el corte, junto al título Noindex
El libro sigue en el estante, pero de espaldas

¿Qué es noindex?

Noindex es una directiva dirigida a los rastreadores que indica que una URL concreta no debe entrar en el índice del buscador. La página sigue existiendo, sigue siendo accesible para quien tenga el enlace y el servidor sigue sirviéndola con normalidad, pero deja de aparecer en los resultados de búsqueda porque Google, Bing o cualquier otro motor la excluye de su base de datos consultable.

La directiva se expresa de dos formas técnicas con el mismo efecto pero distinto alcance: la etiqueta meta robots dentro del <head> del documento HTML, o la cabecera HTTP X-Robots-Tag que envía el servidor junto con la respuesta. Ambas aceptan valores combinables: noindex,follow excluye la página del índice pero deja que el rastreador siga sus enlaces internos, mientras que noindex,nofollow bloquea las dos cosas a la vez.

Un matiz que se pasa por alto con frecuencia: noindex no borra una página ni impide que se cargue en el navegador. Solo instruye al buscador para que la retire de los resultados o no la añada nunca. Si la página ya estaba indexada cuando se añade la directiva, Google necesita rastrearla de nuevo para leer la etiqueta y aplicar la exclusión, un proceso que puede tardar desde unos días hasta varias semanas según la frecuencia de rastreo del sitio.

Aunque Google es el motor de referencia en la mayoría de auditorías, noindex forma parte del protocolo estándar de exclusión de robots y funciona de forma equivalente en Bing, Yandex o cualquier buscador que respete esas convenciones. No es una función propietaria de un solo motor, sino un acuerdo del sector sobre cómo comunicar qué contenido no debe aparecer en resultados de búsqueda.

Otro punto que genera confusión en la práctica: noindex no protege frente a un enlazado interno descuidado. Si una página lleva noindex pero sigue enlazada de forma visible desde el menú de navegación o desde otras páginas, usuarios y rastreadores seguirán encontrándola con normalidad; la etiqueta solo la saca del índice de búsqueda, no del resto del sitio.

Meta-tag o cabecera HTTP: cuándo usar cada variante

AspectoMeta-tag (meta name="robots")Cabecera X-Robots-Tag
Dónde se colocaDentro del <head> del documento HTMLEn la respuesta HTTP, la envía el servidor
Tipos de archivo que cubreSolo páginas HTMLCualquier tipo: PDF, imágenes, CSV, XML, JSON
Dónde se configuraEn la plantilla o el CMS de la páginaEn la configuración del servidor (Apache, Nginx) o del CMS a nivel de tipo de archivo

La etiqueta meta solo funciona en documentos HTML, porque el buscador necesita descargar y analizar el <head> para leerla. Eso la deja inútil para archivos que no tienen esa estructura: un PDF de catálogo, una imagen o un feed XML no pueden llevar una etiqueta HTML dentro de su contenido.

Para esos casos, la única opción es la cabecera X-Robots-Tag, configurada a nivel de servidor o de CMS para que viaje junto con la respuesta HTTP sin que el archivo en sí contenga ningún código. Es también la vía más práctica para bloquear en bloque un tipo de archivo entero, todos los PDF de una carpeta de descargas, por ejemplo, con una sola regla de servidor en lugar de editar cada documento.

Diferencia con canonical

Noindex y el canonical tag resuelven problemas distintos, aunque ambos aparecen en las mismas conversaciones sobre contenido duplicado. El canonical le dice al buscador cuál de varias URLs similares es la versión preferida y hacia dónde debe consolidar las señales de ranking, pero mantiene todas esas URLs dentro del índice como candidatas. Noindex, en cambio, saca una URL del índice sin condiciones: no hay consolidación ni versión preferida, esa página deja directamente de competir por posiciones.

La elección entre uno y otro depende de si la URL secundaria aporta algo por sí sola. Una página de producto con parámetros de filtro que muestra la misma información que la versión limpia es candidata a canonical: sigue siendo útil para quien llega directamente a ese enlace y no rompe la experiencia de compra. Una página de resultados de búsqueda interna generada automáticamente, en cambio, no representa contenido que valga la pena consolidar bajo otra URL, es candidata a noindex.

Combinar ambos en la misma URL genera un conflicto de señales. Si una página lleva noindex y a la vez un canonical hacia otra URL, la instrucción de exclusión ya la saca del índice por sí sola, así que la señal de canonical se vuelve irrelevante para ella. Google trata esa combinación como contradictoria y suele optar por respetar el noindex.

Canonical o noindex: qué decide cuál

Diferencia con robots.txt: el malentendido entre rastreo e indexación

El error más extendido con noindex es confundirlo con el bloqueo por robots.txt. El archivo robots.txt vive en la raíz del dominio y le dice a los rastreadores qué rutas no deben visitar: es una instrucción de rastreo. Noindex, en cambio, es una instrucción de indexación, no impide que el buscador visite la página, impide que la guarde en su índice después de visitarla.

La consecuencia práctica de esa diferencia sorprende a mucha gente: bloquear una URL en robots.txt no garantiza que desaparezca de los resultados de búsqueda. Si esa URL recibe enlaces desde otras páginas, internas o externas, Google puede indexarla igualmente a partir de esas señales externas, sin haber rastreado nunca su contenido real. El resultado suele ser una entrada visible en el buscador con la URL pero sin título ni descripción generados, del tipo "no hay información disponible para esta página".

Ese malentendido lleva a un segundo error, más grave en la práctica: bloquear en robots.txt una página que además lleva la etiqueta noindex. Si el rastreador tiene prohibido el acceso por robots.txt, nunca llega a descargar el HTML ni a leer esa etiqueta, así que la instrucción de exclusión queda sin efecto. Para sacar una URL del índice de forma fiable, el rastreador necesita poder visitarla y leer el noindex, lo que exige justo lo contrario: que robots.txt permita el acceso a esa ruta, no que la bloquee.

La propia Search Console refleja esta distinción en su informe de cobertura: una URL bloqueada por robots.txt aparece como "bloqueada por robots.txt", mientras que una URL con la etiqueta noindex correctamente leída aparece como "excluida por la etiqueta noindex". Revisar ese informe es la forma más rápida de detectar si alguna URL quedó en el peor de los dos escenarios, bloqueada y con noindex a la vez, sin que ninguna de las dos directivas llegue a aplicarse del todo.

Buenas prácticas

  • Aplica noindex a las páginas de resultados de búsqueda interna del propio sitio; no aportan valor a quien llega desde un buscador externo y suelen multiplicarse sin control según lo que teclee cada visitante.
  • Usa noindex en las páginas de agradecimiento o confirmación tras una conversión, formulario enviado, compra, descarga de un recurso; no tiene sentido que compitan por tráfico orgánico.
  • Combina noindex con follow, no con nofollow, cuando la página excluida sigue enlazando a contenido relevante del sitio; así el rastreador sigue esos enlaces aunque la página en sí no se indexe.
  • Revisa en Search Console qué URLs con parámetros de filtro, color, talla, orden de resultados, generan duplicados, y decide caso por caso entre noindex y canonical según si esa variante aporta valor propio.
  • Deja siempre que robots.txt permita el acceso a las URLs que llevan noindex, para que el rastreador pueda descargarlas y leer la etiqueta.
  • Verifica antes de cada lanzamiento que ninguna etiqueta noindex heredada de un entorno de pruebas haya llegado al sitio en producción.

Errores frecuentes

  • Usar noindex como parche para una página con contenido pobre o escaso en lugar de mejorarla. La página deja de competir por completo y renuncia a cualquier posibilidad de tráfico orgánico, mientras que una revisión de contenido conserva esa posibilidad y puede convertir la misma URL en una fuente real de visitas. Excluir una página del índice no resuelve el problema de fondo, solo lo aparta de la vista.
  • Dejar una etiqueta noindex heredada de un entorno de staging tras publicar la página en producción, lo que saca del índice contenido que sí debería posicionar y a veces afecta al sitio entero sin que nadie lo note durante semanas.
  • Bloquear en robots.txt una URL que además lleva noindex, con lo que el rastreador nunca llega a leer la etiqueta y la exclusión no llega a aplicarse.
  • Confundir noindex con nofollow: la primera afecta a si la página entra en el índice, la segunda a si se sigue un enlace concreto dentro de ella; son directivas independientes que se pueden combinar pero no significan lo mismo.
  • Mantener noindex durante años en páginas que siguen recibiendo enlaces internos de valor, sin revisar si esa exclusión sigue siendo necesaria; Google tiende a rastrear con menos frecuencia el contenido excluido de forma prolongada, lo que puede debilitar el paso de autoridad hacia el resto del sitio.
Manuel Riveiro Rodriguez CEO & Digital Strategist

Una auditoría técnica revisa esto y el resto en un solo paso.

Solicitar auditoría

Preguntas frecuentes

¿Noindex afecta al posicionamiento del resto del sitio?

No de forma directa. Cada URL con noindex se excluye de forma individual, no arrastra a otras páginas del dominio. El riesgo indirecto aparece cuando esa página recibía enlaces internos que ayudaban a repartir autoridad; al dejar de rastrearse con frecuencia, ese reparto puede debilitarse con el tiempo.

¿Cuánto tarda Google en aplicar un noindex?

Depende de la frecuencia con la que Google rastrea esa URL. Si la página ya estaba indexada, el buscador necesita visitarla de nuevo para leer la directiva, lo que puede tardar desde un par de días en sitios con rastreo frecuente hasta varias semanas en páginas poco visitadas por el rastreador.

¿Puedo usar noindex y robots.txt a la vez en la misma URL?

No conviene. Si robots.txt bloquea el acceso a esa ruta, el rastreador nunca llega a descargar el HTML ni a leer la etiqueta noindex, así que la exclusión no se aplica. Para que noindex funcione, robots.txt debe permitir el acceso a esa URL.

¿Noindex es lo mismo que eliminar una URL desde Search Console?

No. La herramienta de eliminación de Search Console oculta una URL de los resultados de forma temporal, unos meses, mientras se resuelve el problema de fondo. Noindex es la solución permanente: mientras la etiqueta siga presente y el rastreador pueda leerla, la URL se mantiene fuera del índice.

¿Sirve noindex para arreglar contenido duplicado o de baja calidad?

Como solución temporal para páginas realmente prescindibles, resultados de búsqueda interna, filtros sin valor propio, sí. Como sustituto de mejorar el contenido, no: excluir una página deja esa URL sin ninguna posibilidad de tráfico orgánico, mientras que reescribirla conserva la oportunidad de posicionar.

Fuentes

  1. Google Search Central: Robots meta tag, data-nosnippet y especificaciones de X-Robots-Tag: documentación oficial sobre la sintaxis de noindex, sus combinaciones con follow/nofollow y la diferencia entre la etiqueta meta y la cabecera HTTP.
  2. Google Search Central: Cómo bloquear la indexación en la Búsqueda con noindex: guía oficial que advierte explícitamente contra el uso combinado de robots.txt y noindex en la misma URL, y explica por qué el bloqueo por robots.txt no garantiza la exclusión del índice.