Ir al contenido

Glosario LLM (modelo de lenguaje grande)

Qué es un LLM (modelo de lenguaje grande)

Definición

Un LLM, o modelo de lenguaje grande, es un sistema estadístico entrenado sobre grandes volúmenes de texto que genera respuestas calculando, fragmento a fragmento, qué continuación resulta más probable según los patrones fijados en sus parámetros.

En esta página 5
  1. Qué significa modelo de lenguaje grande
  2. Cómo se produce una respuesta
  3. Por qué importa
  4. Buenas prácticas
  5. Errores frecuentes
En breve

Un LLM calcula continuaciones probables en lugar de consultar un registro, y de esa diferencia salen la invención de datos, la variación entre respuestas y el plazo con el que reacciona a los cambios de tu empresa.

Qué significa modelo de lenguaje grande

El adjetivo «grande» no describe calidad, sino escala: la cantidad de texto usada en el entrenamiento y el número de parámetros ajustados durante ese proceso. Un parámetro es un valor numérico dentro de la red. Su cantidad no permite deducir qué tan útil será el sistema en una tarea concreta, y los fabricantes ya casi nunca la publican.

Conviene separar tres cosas que en la conversación diaria se mezclan. El modelo es el archivo de parámetros más el código que lo ejecuta. El asistente es el producto que lo rodea: interfaz, instrucciones fijas, historial de conversación, herramientas. Y el buscador con IA es un tercer nivel, donde el asistente consulta un índice web antes de redactar. La misma pregunta puede dar resultados distintos en los tres.

La otra distinción importante es temporal. Un modelo se entrena con textos hasta una fecha de corte. Algunos proveedores publican dos fechas: la del material de entrenamiento y otra anterior, hasta la que consideran fiable la información. Después de ese punto no hay nada en los parámetros sobre tu nueva sede, tu cambio de precios ni tu rebranding. Un sistema con recuperación en vivo evita parte del problema porque consulta fuentes en el momento de responder, y por eso reacciona a las novedades de forma distinta que un modelo aislado.

Cómo se produce una respuesta

El texto entra troceado en unidades llamadas tokens, que pueden ser una palabra, un fragmento de palabra o un signo. A partir de esa secuencia el sistema calcula una distribución de probabilidad sobre el token siguiente, selecciona uno, lo añade a la secuencia y repite la operación. La respuesta completa es la acumulación de esas decisiones sucesivas.

La selección no siempre recae en el token más probable. Parámetros de muestreo como la temperatura o top-p regulan cuánta probabilidad acumulada entra en el sorteo. Con temperatura cero se toma siempre el máximo, y aun así dos llamadas idénticas pueden divergir: en los servidores de inferencia el resultado depende del tamaño del lote con el que se procesa cada petición, y ese lote cambia con la carga que haya en ese instante. En un experimento con mil generaciones del mismo texto aparecieron ochenta variantes, todas idénticas hasta el token 103.

De ahí sale también la afirmación inventada. No hay una consulta a una base de datos, hay un cálculo de continuación plausible. Si sobre una marca pequeña apenas existe material, la continuación estadísticamente razonable puede ser una sede, un fundador o un catálogo que nunca existieron, redactados con la misma seguridad que un dato correcto. Un trabajo de OpenAI señala además el papel de los métodos de evaluación: al puntuar las respuestas como acierto o fallo, un modelo que siempre aventura algo obtiene mejor nota que uno que indica la falta de base, así que el procedimiento premia adivinar.

Por qué importa

La primera consecuencia afecta a la medición. Si el mismo prompt puede dar respuestas distintas, una sola comprobación no dice nada sobre la visibilidad de tu marca. Hace falta repetir, contar frecuencias y trabajar con tasas de aparición a lo largo del tiempo. Quien enseña una captura de pantalla como prueba está enseñando una tirada suelta.

La segunda afecta al contenido. Como la respuesta se construye por probabilidad y no por consulta a un registro, los datos de tu empresa que solo aparecen una vez, dentro de un PDF o incrustados en una imagen, pesan poco frente a los que se repiten de forma consistente en muchas fuentes citables. Eso convierte la coherencia de nombre, dirección, catálogo y cifras en un asunto técnico y no cosmético.

La tercera afecta a la corrección de errores. Cuando un sistema atribuye a tu empresa algo falso, no existe un botón de edición. Solo cabe alterar el material disponible: publicar la versión correcta donde el sistema pueda alcanzarla, conseguir que fuentes con peso la recojan y esperar al siguiente ciclo de entrenamiento o, si el sistema recupera en vivo, a la siguiente indexación. Saber cuál de los dos casos tienes delante decide si el arreglo tarda días o meses.

Buenas prácticas

  • Repite cada consulta varias veces y anota en cuántas aparece la marca, en lugar de fiarte de una respuesta suelta.
  • Registra junto a cada medición el modelo, la fecha y si la respuesta llevaba fuentes enlazadas. Sin esos tres datos la comparación posterior no vale.
  • Publica los datos de empresa en texto plano y en el mismo formato en todos los sitios: nombre legal, dirección, gama de producto y cifras con su fecha.
  • Distingue en el informe entre sistemas con recuperación en vivo y modelos sin acceso a la web, porque el plazo de reacción a una corrección es distinto.
  • Verifica por muestreo lo que los sistemas afirman sobre tu empresa y guarda las capturas fechadas, sobre todo antes de un cambio de precios o de sede.
  • Trata cada afirmación de un LLM sobre datos, fechas o normativa como pendiente de comprobación hasta que una fuente propia la confirme.

Errores frecuentes

  • Interpretar una respuesta favorable como posición conseguida, cuando la siguiente llamada puede dar otra cosa.
  • Comparar mediciones de momentos distintos sin anotar la versión del modelo, que el proveedor cambia sin aviso.
  • Usar el número de parámetros como argumento de calidad, cuando esa cifra no dice nada sin una tarea y un método de medición.
  • Suponer que una corrección publicada hoy en tu web se refleja mañana en un modelo sin acceso en vivo.
  • Pedir al sistema la fuente de una afirmación y darla por buena: la referencia también puede haberse generado por probabilidad.
Manuel Riveiro Rodriguez CEO & Digital Strategist

Una auditoría técnica revisa esto y el resto en un solo paso.

Solicitar auditoría

Preguntas frecuentes

¿Por qué un LLM da respuestas distintas a la misma pregunta?

Porque la respuesta se sortea sobre una distribución de probabilidad y porque el cálculo en el servidor depende del tamaño del lote de peticiones que se procesan a la vez. Ese lote varía con la carga. Incluso con la temperatura a cero, dos llamadas idénticas pueden separarse a partir de cierto punto del texto.

¿Puedo corregir lo que un modelo dice de mi empresa?

No de forma directa, porque no hay un registro editable. Lo que sí se puede cambiar es el material disponible: publicar la versión correcta en tu web, lograr que fuentes con peso la recojan y esperar al siguiente entrenamiento. En sistemas con recuperación en vivo el efecto llega mucho antes.

¿Qué significa la fecha de corte del entrenamiento?

Que en los parámetros no hay material posterior a ese día. Algunos proveedores publican además una fecha anterior hasta la que consideran fiable la información. Todo lo que tu empresa cambie después queda fuera hasta el siguiente ciclo, salvo que el sistema consulte fuentes en vivo al responder.

¿Un LLM busca en internet cuando responde?

Depende del producto. Un modelo por API responde solo con sus parámetros salvo que se le conecten herramientas. Los asistentes de consumo y los buscadores con IA suelen recuperar documentos antes de redactar. Conviene comprobarlo caso por caso, porque de ello depende el plazo de reacción a tus cambios.

¿Sirve el número de parámetros para elegir modelo?

Poco. Es una medida de tamaño, no de utilidad, y no dice nada sin una tarea concreta y un método de medición. Además, los proveedores ya casi no publican esa cifra para sus modelos actuales. La comparación útil se hace con tus propias consultas y tus propios criterios.

Fuentes

  1. Trabajo que introduce la arquitectura Transformer, base de los modelos de lenguaje actuales y del mecanismo de atención que pondera el contexto.
  2. Análisis de OpenAI sobre por qué se producen afirmaciones inventadas: los métodos de evaluación puntúan mejor a un modelo que aventura una respuesta que a uno que señala la falta de base.
  3. Experimento que explica la variación entre llamadas idénticas: mil generaciones del mismo texto con temperatura cero produjeron ochenta variantes, por dependencia del tamaño de lote en el servidor.
  4. Documentación de proveedor que distingue la fecha del material de entrenamiento de la fecha hasta la que la información se considera fiable.
  5. Trabajo que describe la generación aumentada por recuperación, el procedimiento por el que un sistema consulta fuentes externas antes de redactar la respuesta.