Ir al contenido

Glosario Embedding (representación vectorial)

Embedding: qué mide realmente un vector de significado

Definición

Un embedding es una lista de números que representa un texto, una imagen u otro contenido dentro de un espacio donde la distancia entre dos representaciones indica cuánto se parecen sus significados.

En esta página 5
  1. Qué significa embedding
  2. Cómo se mide el parecido
  3. Por qué importa
  4. Buenas prácticas
  5. Errores frecuentes
En breve

Un embedding coloca un contenido en un espacio donde la distancia indica parecido de significado, y ese parecido no dice nada sobre si el contenido es cierto.

Qué significa embedding

Un embedding es, literalmente, un vector: una lista de números decimales. Ninguno de esos números tiene lectura propia. La dimensión 431 no significa «formalidad» ni «asunto jurídico», y buscarle sentido individual es tiempo perdido. Lo único que importa es la posición relativa. Dos contenidos con significados parecidos acaban cerca en ese espacio y dos contenidos ajenos acaban lejos, de modo que la distancia entre dos vectores mide su relación: distancias pequeñas indican relación alta.

De ahí salen dos límites que conviene fijar antes de seguir. El primero es que un embedding no guarda el texto. Es una representación con pérdida, pensada para comparar y no para reconstruir. El segundo es el que más confusión causa en los informes: un embedding mide parecido de significado, no verdad ni calidad. Dos frases pueden estar pegadas en el espacio vectorial y ser una correcta y la otra falsa, porque «el fármaco reduce el riesgo» y «el fármaco no reduce el riesgo» hablan exactamente de lo mismo. La negación apenas mueve el vector y sin embargo invierte el sentido.

Por eso una puntuación de similitud alta responde a la pregunta «¿trata de lo mismo?» y nunca a la pregunta «¿es cierto?». Cualquier panel que presente el coseno como indicador de calidad editorial está renombrando una medida por otra.

Cómo se mide el parecido

La medida habitual es la similitud coseno, que compara la dirección de dos vectores y descarta su longitud. OpenAI la recomienda de forma explícita y señala que sus vectores salen normalizados, de manera que el producto escalar da el mismo resultado algo más rápido y la distancia euclídea produce exactamente la misma ordenación. La documentación de Gemini lo explica por el mismo camino: se atiende a la dirección y no a la magnitud, porque la dirección refleja mejor la cercanía conceptual.

La dimensionalidad es el número de valores de la lista. Los modelos actuales trabajan en escalas conocidas: 1.536 valores en text-embedding-3-small y 3.072 en text-embedding-3-large, mientras que Gemini admite entre 128 y 3.072 y recomienda 768, 1.536 o 3.072. En la práctica, esa cifra dice cuánto matiz cabe y cuánto cuesta guardarlo y compararlo. Más dimensiones retienen más distinciones finas y ocupan más memoria; menos dimensiones abaratan el índice y aceleran la búsqueda a cambio de perder matiz.

La caída no es proporcional, y ese es el dato útil. OpenAI midió que su modelo grande recortado a 256 valores seguía superando en el banco de pruebas MTEB al modelo anterior con 1.536, así que recortar sale más barato de lo que la intuición sugiere. Queda un detalle operativo que se pasa por alto con frecuencia: algunas API distinguen si el texto entrante es una consulta o un documento del corpus, y usar el tipo equivocado degrada la recuperación sin emitir ningún aviso.

Por qué importa

Para quien decide un presupuesto de contenidos, la consecuencia práctica es un desplazamiento de palanca. Cuando la recuperación funciona por significado, repetir la variante exacta de una palabra clave deja de ser el mecanismo que hace encontrable un texto, porque el sistema reconoce sinónimos y formulaciones distintas por su cuenta. Google lo dice sin rodeos en su guía sobre búsqueda generativa: no hace falta escribir de una forma especial para la IA, ya que sus sistemas entienden sinónimos y el sentido general de lo que alguien busca.

La segunda consecuencia es un límite que casi nunca se enuncia en voz alta. Un buen parecido vectorial coloca tu texto entre los candidatos recuperados. No decide que se le cite, ni que se le crea, ni que sea correcto. Por encima de la recuperación actúan otros sistemas de clasificación y de filtrado, y la verificación de los hechos no figura entre las capacidades de un vector.

Traducido a decisiones concretas: tiene sentido invertir en cubrir un tema con precisión y en nombrar las cosas por su nombre, y no lo tiene contratar una herramienta que prometa «optimizar tus embeddings» para un buscador cuyo modelo nadie conoce desde fuera. Y ninguna cifra de similitud debería usarse jamás como control de calidad editorial.

Buenas prácticas

  • Escribe sobre el tema, no sobre la variante de la palabra clave. La recuperación por significado premia cubrir bien un asunto, y la repetición mecánica ya no aporta la ventaja que aportaba.
  • Nombra el sujeto, el producto, el lugar y la fecha de forma explícita. Un texto lleno de referencias implícitas produce un vector desdibujado y difícil de recuperar.
  • Combina búsqueda vectorial con búsqueda léxica si operas tu propio índice. En la evaluación de Anthropic, sumar coincidencia exacta a los embeddings bajó los fallos del 5,7 % al 2,9 %, y ayuda sobre todo con códigos, referencias y nombres propios raros.
  • Elige la dimensionalidad por presupuesto y compruébala. Recortar suele costar menos calidad de la esperada, pero eso se verifica con tu propio conjunto de pruebas y no por analogía.
  • Declara el tipo de tarea cuando la API lo ofrezca, distinguiendo consulta de documento. Es gratis y evita una pérdida silenciosa de precisión.
  • Verifica los hechos fuera del vector. La similitud indica de qué habla un texto; que sea cierto lo dice una fuente, no una distancia.

Errores frecuentes

  • Leer el coseno como nota de calidad. Es la confusión más cara del asunto, porque mide proximidad de significado y nada más.
  • Comparar valores de similitud entre modelos distintos. Cada modelo tiene su propia escala, y un 0,82 en uno no equivale a un 0,82 en otro.
  • Mezclar en un mismo índice vectores de modelos o versiones diferentes. Las distancias dejan de significar algo y la búsqueda devuelve resultados aleatorios con aspecto de resultados legítimos.
  • Cambiar de modelo sin reindexar el corpus entero. Los vectores antiguos no son compatibles con las consultas nuevas, aunque el sistema siga respondiendo sin dar error.
  • Esperar que el vector detecte una negación o una contradicción. Una frase y su contraria quedan muy cerca en el espacio, así que ese filtro tiene que estar en otra parte del sistema.
Manuel Riveiro Rodriguez CEO & Digital Strategist

Una auditoría técnica revisa esto y el resto en un solo paso.

Solicitar auditoría

Preguntas frecuentes

¿Un embedding sabe si un texto es cierto?

No. Mide parecido de significado y no veracidad. Una afirmación y su negación quedan muy cerca en el espacio vectorial, porque hablan de lo mismo. Por eso un sistema de recuperación puede devolver con máxima confianza un pasaje equivocado, y la verificación tiene que apoyarse en otro mecanismo.

¿Qué significa que un embedding tenga 1.536 dimensiones?

Que el texto se representa con 1.536 números. Más dimensiones permiten retener distinciones más finas y ocupan más memoria y tiempo de cálculo. OpenAI midió que su modelo grande recortado a 256 valores seguía superando al anterior con 1.536, así que la relación entre tamaño y calidad no es proporcional.

¿Puedo comparar la similitud coseno de dos modelos distintos?

No de forma directa. Cada modelo distribuye sus vectores en su propia escala, y un valor de 0,80 puede indicar relación estrecha en uno y relación floja en otro. Las comparaciones solo tienen sentido dentro de un mismo modelo y una misma versión, y sobre un índice construido con él.

¿Sirve repetir sinónimos si la búsqueda funciona por significado?

Poco. Google afirma que no hace falta escribir de una forma especial para la búsqueda generativa, porque sus sistemas entienden sinónimos y el sentido general de la consulta. Conviene nombrar las cosas con precisión y usar el término que emplea tu público, no acumular variantes por si acaso.

¿Usa Google embeddings en la búsqueda web?

Google documenta sistemas que trabajan con el significado y no con la coincidencia literal, como BERT, MUM, la coincidencia neuronal y el passage ranking. No publica qué representaciones vectoriales usa para el índice web ni con qué dimensiones. Lo primero está documentado; lo segundo es una suposición razonable sin confirmar.

Fuentes

  1. Guía de OpenAI que define el embedding como un vector de números decimales, explica que la distancia mide la relación entre dos textos y recomienda la similitud coseno.
  2. Anuncio de OpenAI con la medición en MTEB según la cual el modelo grande recortado a 256 dimensiones supera al modelo anterior con 1.536.
  3. Documentación de Gemini sobre similitud coseno, dimensionalidad variable entre 128 y 3.072 y los usos habituales de los embeddings en recuperación y clasificación.
  4. Evaluación de Anthropic que compara búsqueda vectorial sola y combinada con coincidencia léxica, con las cifras de fallo de recuperación de cada variante.
  5. Guía de Google donde se afirma que no hace falta escribir de una forma especial para la búsqueda generativa, porque sus sistemas entienden sinónimos y el sentido general.