Ir al contenido

Glosario Google-Extended

Qué es Google-Extended

Definición

Google-Extended es el identificador que se declara en el archivo robots.txt de un sitio para decidir si Google puede usar el contenido ya rastreado en el entrenamiento de los modelos Gemini y en el anclaje de sus respuestas, sin que esa decisión altere la presencia del sitio en la búsqueda.

En esta página 5
  1. Qué significa Google-Extended
  2. Qué gobierna exactamente y qué queda fuera
  3. Por qué importa
  4. Buenas prácticas
  5. Errores frecuentes
En breve

El identificador de robots.txt que gobierna el uso de tu contenido en los modelos Gemini, y que no controla las respuestas generativas del buscador.

Qué significa Google-Extended

La primera confusión que conviene deshacer es de categoría. Google-Extended no descarga páginas. No existe ningún robot con ese nombre recorriendo la web, ni aparecerá nunca una línea con esa cadena en los registros del servidor. Quien descarga sigue siendo Googlebot, con el mismo comportamiento de siempre. Lo que hace el identificador es gobernar el uso posterior de un contenido que Google ya tiene en su índice.

Esa diferencia explica por qué la regla se escribe en robots.txt aunque no regule ningún rastreo. El archivo se aprovecha como el lugar donde el editor deja constancia de una preferencia, y Google la consulta al decidir si ese material puede alimentar determinados productos generativos. La propia documentación de Google recoge el matiz: el identificador se emplea en función de control, no de petición.

El control apareció el 28 de septiembre de 2023, cuando los productos afectados todavía se llamaban Bard y Vertex AI. Los nombres comerciales cambiaron después hacia la familia Gemini, pero el identificador conservó el suyo, de ahí que hoy resulte poco descriptivo. Conviene leerlo como «uso ampliado de lo ya rastreado» y no como «un segundo rastreador de Google», porque de esa lectura equivocada nacen casi todas las reglas mal escritas que se ven en producción.

Qué gobierna exactamente y qué queda fuera

El identificador cubre dos usos concretos. El primero es el entrenamiento de futuras generaciones de modelos Gemini, incluidos los que alimentan las aplicaciones de Gemini y la API de Vertex AI. El segundo es el anclaje, es decir, el envío de contenido procedente del índice de búsqueda al modelo en el momento en que alguien formula una pregunta dentro de esos productos. Una regla Disallow: / bajo el identificador retira el sitio de ambos usos a la vez, sin posibilidad de separarlos.

Fuera del alcance queda justo aquello por lo que preguntan los clientes. Las respuestas generativas que aparecen dentro del buscador, tanto AI Overviews como AI Mode, se construyen a partir del índice ordinario que rellena Googlebot, y por eso no obedecen a esta regla. Google lo afirma sin rodeos: el identificador no afecta a la inclusión del sitio en la búsqueda ni se utiliza como señal de posicionamiento.

Durante casi tres años la consecuencia fue incómoda. Quien quería salir de las respuestas generativas del buscador solo podía conseguirlo restringiendo a Googlebot o limitando los fragmentos con nosnippet, data-nosnippet y max-snippet, medidas que se pagan en visibilidad clásica. El 3 de junio de 2026 Google anunció un ajuste específico en Search Console, bajo Configuración, llamado «Search generative AI control». Ofrece dos opciones para la propiedad, incluir o excluir, con la inclusión como valor por defecto, y permite retirar el sitio de AI Overviews, AI Mode y las funciones generativas de Discover sin tocar su posición en la búsqueda. El despliegue empezó por un grupo reducido de propiedades del Reino Unido antes de extenderse al resto.

Por qué importa

La decisión que depende de este identificador es más estrecha de lo que sugiere su fama. Bloquearlo sirve para una cosa: impedir que el contenido propio contribuya a los modelos Gemini y a las respuestas que esos modelos generan en las aplicaciones de Google. Es una decisión sobre el uso del contenido, cercana a la licencia y a la propiedad intelectual, y no una palanca de visibilidad.

Quien lo bloquea esperando desaparecer de las respuestas generativas del buscador no consigue nada, y a cambio renuncia a que la marca aparezca citada y enlazada en la superficie de Gemini. El coste se paga entero y el objetivo no se alcanza. Ese malentendido es la razón principal por la que un cliente pregunta por este identificador, y merece una respuesta clara antes de tocar el archivo.

Para un medio con contenido licenciable la lectura cambia. Ahí el bloqueo funciona como posición negociadora, y varios editores lo mantienen mientras discuten acuerdos de uso. Para un negocio que vive de captar demanda, en cambio, la respuesta habitual es permitirlo y trabajar la citabilidad de las páginas.

Desde junio de 2026 existe además una segunda palanca, independiente de la primera. Conviene decidir cada una por separado, porque responden a preguntas distintas: una sobre quién puede usar el contenido, otra sobre dónde aparece.

Buenas prácticas

  • Declarar un grupo propio con el identificador escrito de forma exacta, sin heredar comodines de otros bloques del archivo y sin mezclarlo con las reglas de Googlebot.
  • Decidir por separado las dos preguntas: el uso del contenido en los modelos, que se resuelve en robots.txt, y la presencia en las respuestas generativas del buscador, que se resuelve en Search Console.
  • No buscar visitas del identificador en los registros del servidor. La regla se verifica leyendo el archivo publicado y con el probador de robots.txt, nunca con un análisis de logs.
  • Dejar por escrito la fecha y el motivo de la decisión, porque los nombres de producto de Google han cambiado ya una vez sobre este mismo identificador.
  • Revisar el ajuste de Search Console cuando llegue a la propiedad, ya que el despliegue es progresivo y no todas las cuentas lo tienen todavía.
  • Antes de bloquear nada, medir qué tráfico y qué menciones llegan hoy desde superficies de IA, para conocer el importe real de la renuncia.

Errores frecuentes

  • Bloquear el identificador con la intención de salir de AI Overviews. Esas respuestas se alimentan del índice ordinario y siguen igual después del cambio.
  • Dar por hecho que la regla afecta también a OpenAI, Anthropic o Perplexity. Cada proveedor tiene sus propios agentes y sus propias reglas.
  • Concluir que la regla no funciona porque el identificador no aparece en los registros. Nunca va a aparecer, porque no emite peticiones.
  • Copiar un bloque de robots.txt ajeno que incluye un comodín amplio y termina restringiendo también a Googlebot.
  • Confundir la exclusión de Search Console con un noindex. La primera retira el sitio de las respuestas generativas y deja intacta la búsqueda clásica.
Manuel Riveiro Rodriguez CEO & Digital Strategist

Una auditoría técnica revisa esto y el resto en un solo paso.

Solicitar auditoría

Preguntas frecuentes

¿Bloquear Google-Extended me saca de AI Overviews?

No. AI Overviews y AI Mode se construyen con el índice ordinario que rellena Googlebot, y esa regla no interviene ahí. Para salir de esas superficies hay que usar el control de Search Console disponible desde junio de 2026, o bien limitar los fragmentos con nosnippet, con el coste que eso tiene en la búsqueda clásica.

¿Bloquearlo perjudica a mi posicionamiento?

No. Google afirma de forma explícita que el identificador no afecta a la inclusión del sitio en la búsqueda ni se usa como señal de posicionamiento. Lo que se pierde al bloquearlo es la posibilidad de que la marca aparezca citada y enlazada dentro de las aplicaciones de Gemini, no la posición en los resultados clásicos.

¿Por qué no veo Google-Extended en los registros del servidor?

Porque no descarga nada. Google-Extended carece de cadena de agente de usuario propia y no emite peticiones HTTP. Las páginas las sigue trayendo Googlebot, y el identificador solo interviene después, cuando Google decide para qué usos está disponible ese contenido. Buscarlo en los logs no sirve para comprobar si la regla está activa.

¿Sirve esta regla contra ChatGPT o Perplexity?

No. Cada proveedor gestiona sus propios agentes, con nombres y comportamientos distintos, y ninguno atiende a este identificador. Una política completa exige un bloque separado por agente en el archivo, y conviene recordar que los agentes de consulta en directo de algunos proveedores suelen ignorar esas reglas.

¿Cuándo tiene sentido bloquearlo?

Cuando el contenido tiene valor de licencia y la empresa quiere conservar la capacidad de negociar su uso, o cuando existe una decisión editorial firme sobre no alimentar modelos de terceros. Para un negocio que busca demanda a través de las respuestas de IA, bloquearlo suele restar más de lo que protege.

Fuentes

  1. La documentación de rastreadores de Google describe el identificador, aclara que no dispone de cadena de agente de usuario propia y enumera los usos que cubre.
  2. Anuncio original del 28 de septiembre de 2023, cuando el control se presentó para Bard y las API generativas de Vertex AI.
  3. Página de Google sobre las funciones de IA en la búsqueda, que remite a nosnippet, data-nosnippet y max-snippet y separa esos controles del identificador.
  4. Anuncio del 3 de junio de 2026 con el nuevo control para editores y la confirmación de que el despliegue empieza en el Reino Unido.
  5. Ayuda de Search Console con el ajuste «Search generative AI control», sus dos opciones, el valor por defecto y los plazos de aplicación.