Ir al contenido

Glosario HTML

¿Qué es HTML?

Definición

HTML (HyperText Markup Language, lenguaje de marcado de hipertexto) es el lenguaje con el que se escribe la estructura y el significado del contenido de una página web: qué es un título, qué es un párrafo, qué es un enlace o una imagen.

En esta página 5
  1. Qué significa HTML
  2. Cómo funciona
  3. Por qué importa
  4. Buenas prácticas
  5. Errores frecuentes
En breve

HTML es el lenguaje que da estructura y significado a una página web: qué es, cómo lo leen navegadores y buscadores y qué ven los rastreadores de IA.

Qué significa HTML

MDN describe HTML como el componente más básico de la web: define el significado y la estructura del contenido. Para la apariencia se usa CSS, y para el comportamiento interactivo, JavaScript. HTML es un lenguaje de marcado: señala cada parte del texto con etiquetas que dicen qué es, sin calcular ni decidir nada.

Cada etiqueta va entre los signos de menor y mayor. La etiqueta h1 abre el título principal y su versión con barra lo cierra; la etiqueta p marca un párrafo; la etiqueta a, con el atributo href, crea un enlace. Las etiquetas pueden llevar atributos con información adicional, como el destino de un enlace, el texto alternativo de una imagen o el idioma de la página.

La norma vigente es el HTML Living Standard que mantiene el WHATWG, un documento que se actualiza de forma continua: la última versión publicada es del 7 de octubre de 2026. No hay versiones numeradas: los cambios entran en la norma viva a medida que los navegadores los adoptan.

Cómo funciona

Cuando alguien abre una página, el navegador descarga el HTML desde el servidor, lo interpreta de arriba abajo y construye con él una estructura en memoria, el DOM. Por el camino encuentra referencias a otros archivos, como hojas de estilo, scripts e imágenes, y los descarga también. Con todo eso pinta la página en pantalla.

Una página puede llegar al navegador de dos formas. En el renderizado en servidor, el HTML ya trae el contenido completo. En el renderizado en cliente, el servidor envía un HTML casi vacío y es JavaScript quien rellena el contenido después, en el navegador. Para quien mira la pantalla, el resultado puede ser idéntico. Para un rastreador que no ejecuta JavaScript, no: en el segundo caso, la página está vacía.

Los buscadores leen el HTML con un propósito distinto al del navegador. Su objetivo es entender qué dice la página y cómo se relaciona con otras: el title y la meta description, los encabezados, el texto, los enlaces, la etiqueta canonical, las alternativas de idioma (hreflang) y los datos estructurados.

Se comprueba en el código fuente, no en la ventana del navegador.

Por qué importa

Para el SEO, el HTML es la versión de la página que de verdad cuenta. Un título que solo se ve como imagen, un texto que se carga con un clic o un enlace que es un botón sin href son invisibles o confusos para un rastreador, aunque una persona los entienda sin problema.

En la búsqueda con IA, la diferencia es todavía mayor. En diciembre de 2024, Vercel publicó un análisis del tráfico de rastreadores en su red y concluyó que ninguno de los grandes rastreadores de IA, entre ellos los de OpenAI, Anthropic y Perplexity, ejecutaba JavaScript; solo Gemini, que usa la infraestructura de Googlebot, y Applebot lo hacían. Lo que no esté en el HTML inicial, para esos rastreadores no existe.

Lo hemos medido en este mismo glosario, con la entrada sobre CMS, el 8 de octubre de 2026. El servidor entrega 186.694 bytes de HTML, y el texto que se lee ocupa 12.769, menos del 7 %. El resto es estructura, estilos de componentes y scripts. Lo importante es que esas 2.049 palabras, incluidas las cinco preguntas frecuentes, ya están en el HTML que llega sin ejecutar nada, junto con un solo h1, catorce h2, el atributo lang con el valor «es» y cuatro referencias hreflang (es, en, de y x-default). Es lo que lee un rastreador que no ejecuta JavaScript.

Buenas prácticas

  • Comprueba con «ver código fuente» o con una petición sin JavaScript que el contenido principal está en el HTML que entrega el servidor.
  • Usa un solo h1 por página y una jerarquía de encabezados que refleje la estructura real del texto.
  • Escribe los enlaces como etiquetas a con atributo href y URL reales, no como botones o eventos de JavaScript.
  • Declara el idioma con el atributo lang y, si hay varias versiones, enlázalas con hreflang.
  • Añade texto alternativo útil a las imágenes que transmiten información.
  • Valida el marcado de vez en cuando: un error de cierre puede hacer que un bloque entero se interprete mal.

Errores frecuentes

  • Cargar el texto principal solo con JavaScript y dar por hecho que todos los rastreadores lo verán.
  • Usar etiquetas de encabezado para dar tamaño al texto en lugar de para marcar su jerarquía.
  • Esconder contenido importante detrás de pestañas o acordeones que solo se rellenan al hacer clic.
  • Repetir el mismo title y la misma meta description en muchas páginas.
  • Confundir lo que se ve en el inspector del navegador, ya procesado por JavaScript, con el HTML que envió el servidor.
Manuel Riveiro Rodriguez CEO & Digital Strategist

Una auditoría técnica revisa esto y el resto en un solo paso.

Solicitar auditoría

Preguntas frecuentes

¿HTML es un lenguaje de programación?

No. HTML es un lenguaje de marcado: indica qué es cada parte del contenido, como un título, un párrafo o un enlace, pero no ejecuta cálculos ni toma decisiones. Para eso se usa JavaScript, y para la presentación visual, CSS. Los tres trabajan juntos en casi cualquier página web.

¿Qué diferencia hay entre HTML y CSS?

HTML dice qué es cada cosa y en qué orden aparece. CSS dice cómo se ve: colores, tipografías, tamaños y posición. Se puede cambiar por completo el aspecto de una página tocando solo el CSS, sin modificar su HTML, y el contenido que leen los buscadores seguiría siendo el mismo.

¿Cómo influye el HTML en el SEO?

Es lo que leen los buscadores para entender una página: title, encabezados, texto, enlaces, canonical, idioma y datos estructurados. Si el contenido importante no está en el HTML o está mal marcado, el buscador lo entiende peor o no lo ve. Un HTML limpio no garantiza buenas posiciones, pero uno defectuoso puede impedirlas.

¿Leen los rastreadores de IA el JavaScript de una página?

Según el análisis que Vercel publicó en diciembre de 2024, los grandes rastreadores de IA, como los de OpenAI, Anthropic y Perplexity, no ejecutaban JavaScript; Gemini sí, porque usa la infraestructura de Googlebot. Por eso conviene que el contenido esté ya en el HTML que entrega el servidor.

¿Qué es HTML5?

Es el nombre con el que se popularizó la versión de HTML que introdujo, entre otras cosas, etiquetas semánticas como header, nav, article o footer, y soporte nativo para audio y vídeo. Hoy no hay versiones numeradas: el WHATWG mantiene el HTML Living Standard, que se actualiza de forma continua.

Fuentes

  1. MDN Web Docs, "HTML: Lenguaje de Marcado de Hipertexto". Fuente de la descripción de HTML como componente básico de la web que define el significado y la estructura del contenido, junto a CSS y JavaScript.
  2. WHATWG, "HTML Living Standard", última actualización 7 de octubre de 2026. Fuente de la norma vigente y de su actualización continua.
  3. Vercel, "The rise of the AI crawler", 17 de diciembre de 2024. Fuente de que los grandes rastreadores de IA analizados no ejecutaban JavaScript, con Gemini y Applebot como excepciones.