Ir al contenido

Glosario Information gain (ganancia de información)

Information gain (ganancia de información)

Definición

El information gain o ganancia de información mide cuánta información nueva aporta un documento respecto a los documentos que el usuario ya ha consultado sobre el mismo tema; el concepto procede de una familia de patentes de Google y no está confirmado como parte de su sistema de clasificación.

En esta página 5
  1. Qué significa la ganancia de información
  2. De dónde viene el concepto y dónde termina la prueba
  3. Por qué importa
  4. Buenas prácticas
  5. Errores frecuentes
En breve

Concepto procedente de una familia de patentes de Google que describe cuánta información nueva aporta un documento frente a lo que el usuario ya ha leído sobre el mismo tema.

Qué significa la ganancia de información

El término procede de la teoría de la información, donde describe cuánto reduce la incertidumbre un dato nuevo. Aplicado a documentos web, la idea es sencilla de enunciar: si alguien ya ha leído tres páginas sobre un tema, la cuarta solo aporta algo si contiene material que las anteriores no tenían.

Lo decisivo es el punto de referencia. La ganancia de información no describe una originalidad absoluta, sino una diferencia respecto a un conjunto de documentos ya vistos. Un texto puede estar muy bien escrito y aportar cero información nueva si repite lo que el lector acaba de encontrar en otra parte. Ese mismo texto tendría un valor alto para alguien que llega al tema sin haber leído nada previo.

En el vocabulario del sector se usa como sinónimo de aportación propia: datos que nadie más publica, una prueba realizada por quien firma, una entrevista, un cálculo que no aparece en la competencia. Esa traducción resulta cómoda para trabajar, aunque simplifica la definición técnica, que depende del historial de lectura de cada persona y no de una comparación fija entre páginas.

De dónde viene el concepto y dónde termina la prueba

La fuente es una familia de patentes de Google LLC titulada «Contextual estimation of link information gain», con fecha de prioridad del 18 de octubre de 2018. La primera concesión, US11354342B2, es de junio de 2022; una continuación posterior, US12013887B2, se concedió en junio de 2024 y sigue vigente. El texto define la puntuación como aquella «indicativa de la información adicional que contiene un documento más allá de la información contenida en documentos ya presentados al usuario».

El procedimiento descrito consiste en aplicar representaciones semánticas de los documentos ya vistos y de los candidatos a un modelo de aprendizaje automático que devuelve una puntuación. La patente sitúa el mecanismo sobre todo en asistentes conversacionales, donde el sistema decide qué documento presentar a continuación, y añade que los resultados de búsqueda pueden ordenarse en parte según esas puntuaciones.

Aquí termina la prueba. Una patente acredita que alguien registró una idea, no que la idea funcione en un producto. Google patenta muchos procedimientos que nunca se implantan y no publica la lista de los que sí utiliza. En su documentación pública para creadores, la empresa jamás emplea la expresión «ganancia de información». Lo que sí escribe es una pregunta de autoevaluación: «¿El contenido aporta información, cobertura, investigación o análisis originales?», junto a otra sobre si un texto que se apoya en otras fuentes «evita limitarse a copiarlas o reescribirlas y ofrece en cambio valor añadido sustancial y originalidad». Ese lenguaje se parece a la idea de la patente, pero no confirma ninguna puntuación ni ningún sistema que lleve ese nombre.

Por qué importa

Aunque la puntuación no esté confirmada, el criterio que hay detrás sirve para decidir qué se publica. Sacar la versión número quince del mismo listado consume presupuesto y rara vez mueve un dominio de sitio, porque el lector ya encontró esa información antes de llegar. La pregunta útil no es si el texto está bien redactado, sino qué contiene que no tengan las diez primeras posiciones.

El asunto ha ganado peso con los sistemas generativos. Un modelo que resume varias fuentes tiene motivos para citar aquella que aporta un dato ausente en las demás, porque es la que justifica una referencia adicional. Un texto que repite el consenso queda absorbido en el resumen sin que haga falta enlazarlo.

También hay una lectura económica. Producir contenido reciclado sale barato y su rendimiento ha caído. Producir una encuesta propia, una comparativa medida o un caso documentado cuesta más y genera material que otros citan, con el efecto secundario de atraer enlaces y menciones. La ganancia de información resume esa diferencia en dos palabras, y por eso resulta cómoda en una reunión, siempre que no se presente como una métrica publicada por Google.

Buenas prácticas

  • Lee las diez primeras posiciones antes de escribir y anota qué afirma cada una; el hueco que queda es el punto de partida del texto.
  • Incorpora al menos un elemento propio por artículo: una medición, la captura de un proceso real, un dato de tu panel de analítica o la respuesta de una fuente a la que hayas preguntado.
  • Fecha los datos originales y documenta el método y el tamaño de la muestra, para que otros puedan citarlos sin desconfiar.
  • Sitúa la aportación nueva en la parte superior de la página, porque los lectores y los sistemas de resumen procesan antes los primeros párrafos.
  • Actualiza los textos antiguos añadiendo material nuevo en lugar de reescribir los mismos párrafos con otras palabras.
  • Cuando un tema ya esté bien cubierto por terceros y no tengas nada que añadir, enlaza la fuente y dedica el esfuerzo a otro contenido.

Errores frecuentes

  • Presentar la ganancia de información como un factor de posicionamiento confirmado. Google no ha reconocido ningún sistema con ese nombre en su documentación pública.
  • Confundirla con la extensión. Añadir mil palabras de relleno rebaja la densidad de información en lugar de subirla.
  • Fiarse de herramientas que prometen «medir el information gain» sin explicar contra qué corpus comparan; la cifra que devuelven es un modelo propio del fabricante.
  • Perseguir la novedad a costa de la exactitud, publicando afirmaciones llamativas que ninguna fuente sostiene.
  • Aplicar el criterio a páginas transaccionales, donde el usuario espera precio, disponibilidad y condiciones de envío en vez de un enfoque inédito.
Manuel Riveiro Rodriguez CEO & Digital Strategist

Una auditoría técnica revisa esto y el resto en un solo paso.

Solicitar auditoría

Preguntas frecuentes

¿Es la ganancia de información un factor de posicionamiento de Google?

No hay confirmación. El concepto aparece en una familia de patentes de Google concedida entre 2022 y 2024, y una patente registra una idea sin demostrar que se utilice. La documentación pública para creadores nunca emplea ese término, aunque sí pregunta si un contenido aporta información y análisis originales.

¿Cómo se puede medir la ganancia de información?

No existe una medida oficial. En la práctica se compara el borrador propio con los resultados que ya ocupan las primeras posiciones y se cuenta cuántas afirmaciones, cifras o ejemplos no aparecen en ninguno de ellos. Es un recuento manual, revisable por cualquiera y suficiente para decidir si merece la pena publicar.

¿Un texto más largo aporta más ganancia de información?

No guarda relación. La extensión mide caracteres, no aportación. Un artículo de seiscientas palabras con una prueba propia aporta más que uno de cuatro mil que resume lo ya publicado. El relleno, además, dificulta que el lector encuentre la parte nueva.

¿Sirve el concepto para las respuestas generadas por IA?

Sirve como criterio editorial. Un sistema que redacta un resumen a partir de varias páginas tiene motivos para citar la que aporta un dato ausente en el resto. Ningún proveedor documenta públicamente una puntuación de este tipo dentro de sus sistemas, así que conviene tratarlo como hipótesis de trabajo.

¿Qué diferencia hay con el contenido duplicado?

El contenido duplicado describe textos casi idénticos, a menudo dentro de un mismo dominio, y plantea un problema técnico de selección de URL. La ganancia de información describe cuánto aporta un texto respecto a lo que ya han publicado terceros, aunque no exista ninguna coincidencia literal entre ellos.

Fuentes

  1. Patente de Google LLC «Contextual estimation of link information gain», prioridad del 18 de octubre de 2018 y concesión en junio de 2022, donde se define la puntuación de ganancia de información.
  2. Continuación de la misma familia, concedida en junio de 2024 y vigente, que describe la ordenación de documentos según su puntuación de ganancia de información.
  3. Segunda continuación de la familia de patentes, útil para comprobar que Google mantuvo el registro activo durante años sin anunciar ninguna implantación.
  4. Documentación de Google para creadores, con las preguntas de autoevaluación sobre información original y valor añadido sustancial, y sin mención alguna al término ganancia de información.