Por qué una página huérfana es un problema aunque esté indexada
No existe una definición oficial de «página huérfana» por parte de Google ni de ningún organismo de normalización; el término se ha consolidado como vocabulario de la práctica en SEO, popularizado por herramientas de rastreo como Screaming Frog, Ahrefs o Sitebulb.
=================================================== Es fácil asumir que si una página aparece en Google Search Console como indexada, está "bien". No es así. La indexación y la interconexión interna son dos procesos distintos, y confundirlos es el error de base detrás de la mayoría de páginas huérfanas que nadie detecta a tiempo.
Google puede rastrear e indexar una URL que aparece en el sitemap.xml sin que ninguna otra página del sitio la mencione. El rastreador la visita, la procesa y la añade al índice. Hasta ahí, todo parece correcto. El problema aparece en dos frentes que no se ven en un informe de cobertura básico.
El primero es el flujo de PageRank interno. Los enlaces entre páginas de un mismo dominio transmiten autoridad de unas a otras. Una página sin enlaces entrantes internos no recibe nada de esa autoridad, por muy fuerte que sea el dominio en su conjunto. Compite en los resultados con una fracción de la fuerza que debería tener, incluso si el contenido es bueno.
El segundo es la experiencia real de navegación. Ningún usuario llega a una página huérfana haciendo clic dentro del sitio, porque no hay ningún clic posible que lleve hasta ella. Solo la alcanza quien entra por una búsqueda directa, un enlace externo o quien conoce la URL de memoria. Para el resto de visitantes, esa página no existe, aunque el servidor la sirva sin errores.
Por eso conviene separar dos conceptos que se mezclan con frecuencia: visibilidad e indexación no son sinónimos. Una página puede estar indexada y a la vez ser invisible para cualquiera que navegue el sitio de forma normal. Rastreo, indexación y descubribilidad interna son tres capas distintas, y una página huérfana falla específicamente en la tercera.
Hay además un efecto de señal a medio plazo. Los motores de búsqueda interpretan la posición de una página dentro de la arquitectura del sitio como parte del contexto que usan para entender su relevancia temática. Una página aislada, sin enlaces entrantes ni salientes hacia contenido relacionado, transmite menos contexto sobre de qué trata y a qué otras páginas del dominio pertenece. Con el tiempo, eso puede traducirse en menos rastreos de refresco, porque el propio rastreador prioriza URLs que forman parte activa del grafo de enlaces del sitio.
===================================================
Indexada y aun así inalcanzable
El rastreador llega a la URL por la sitemap.xml, incluso sin un solo enlace interno.
Google incorpora el contenido al índice, con independencia de que el sitio apunte o no hacia esa página.
Ninguna otra página del dominio la enlaza, así que ningún clic dentro del sitio lleva hasta ella.
Un informe de cobertura cubre las dos primeras capas. La tercera solo la ve un rastreo que siga únicamente enlaces internos.
