Falcon Information — Volver a la página principal

¿Qué es "llms.txt"? Formato, implementación y evaluación de resultados.

`llms.txt` es un formato de archivo propuesto por la comunidad en 2024, que utiliza Markdown conciso para que los sistemas de IA puedan comprender rápidamente la estructura y el contenido clave de un sitio web. Nosotros hemos implementado este formato, pero queremos ser claros: Google ha indicado que no utilizará `llms.txt`, y que no es una forma de ser incluido o citado. Este artículo te explica cómo hacerlo, y también te dice qué esperar de él.

Sección del artículo

  • ·Origen y ubicación
  • ·Normas de formato
  • ·Método de funcionamiento de esta plataforma.
  • ·Evaluación honesta de los resultados
  • ·Qué se debe y qué no se debe implementar.
  • ·Verificación posterior a la implementación

¿De dónde provienen los archivos "llms.txt"? ¿Cuál es su propósito o función?

Jeremy Howard de Answer.AI propuso llms.txt en 09/2024 por un motivo práctico: la navegación, los anuncios y los scripts recargan las páginas y dificultan su uso por modelos de lenguaje con contexto limitado. Un resumen limpio en Markdown puede explicar el sitio e indicar sus páginas principales. Su estatus es clave: es una propuesta de la comunidad, no un estándar oficial de ningún buscador o plataforma de IA. Esa distinción debe determinar cuánto esfuerzo invertir.

¿Qué tipo de formato es?

Las directrices están diseñadas para ser lo más sencillas posible: consiste en un archivo Markdown ubicado en la raíz del sitio web. La estructura es la siguiente: H1: Nombre del sitio web.; Bloque de cita (blockquote): Un breve resumen del sitio web.; H2: Lista de enlaces, con una frase de descripción para cada uno. También existe un archivo opcional llamado `llms-full.txt`, que contiene el contenido completo de la página, destinado a sistemas que puedan procesar documentos largos. Ambos archivos están en formato de texto plano y no requieren encabezados especiales.

  • H1: Nombre del sitio web o del proyecto (obligatorio)
  • Cita: Resumen de un párrafo en una página web.
  • Sección H2: Lista de enlaces categorizados, con una breve descripción para cada uno.
  • llms-full.txt (opcional): Versión completa del contenido.

En esta plataforma: generación dinámica, sin escritura manual.

Utilizamos el Route Handler en Next.js App Router para proporcionar los archivos `/llms.txt` y `/llms-full.txt`. Estos archivos no son archivos estáticos escritos a mano, sino que se generan dinámicamente a partir de la misma base de datos (archivos TypeScript que contienen información sobre servicios, casos y precios). Además, se utilizan la opción `force-static` durante la construcción para exportarlos. Esta solución aborda el principal problema de los archivos escritos a mano: la inconsistencia del contenido. Si los precios o los servicios cambian, el archivo `llms.txt` se sincronizará automáticamente en la próxima construcción, evitando que la información en la página web y en `llms.txt` sean diferentes. Esto es mejor que no tener el archivo, ya que evitaría que el sistema de IA proporcionara información obsoleta.

Una evaluación honesta de los resultados: Google no lo necesita

Esta es una parte que la mayoría de los cursos no te enseñan. Los documentos oficiales de Google especifican claramente que las funciones de IA no requieren ninguna barrera técnica adicional, y los miembros del equipo de búsqueda también han declarado públicamente que no utilizan archivos "llms.txt". En cuanto a otros plataformas de IA, si leen o no estos archivos y si esto afecta las citas, actualmente no hay ninguna declaración oficial al respecto. Hemos revisado nuestros registros de servidor y podemos ver que algunos programas de "web scraping" de IA han accedido a estos dos archivos, pero "ser accedido" y "afectar las citas" son dos cosas diferentes, y la segunda no puede ser verificada. Por lo tanto, nuestra conclusión es que "llms.txt" es una medida complementaria de bajo costo, y no es una tarea central de GEO: la verdadera tarea central sigue siendo el contenido indexable y la evidencia primaria.

¿Cuándo y cómo desplegar? Criterios de decisión.

Razones para hacerlo: costo muy bajo (un único archivo), sin riesgos conocidos, y si la plataforma adopta esta solución en el futuro, ya estará lista. Razones para no hacerlo: si alguien te pide pagar por ello como consultoría, o si lo comercializas como "imprescindible para cualquier plataforma de IA" – lo cual contradice la postura oficial de la plataforma –, se convierte en un indicador directo de la credibilidad del proveedor. Nuestra comunicación con los clientes es consistente: hazlo, pero priorízalo después de la optimización técnica, la evidencia de contenido y las mediciones.

¿Cómo verificar que la implementación ha sido exitosa?

Tres cosas: Primero, utilizar `curl` o un navegador para acceder directamente a `/llms.txt` y verificar que la respuesta sea 200 y que el contenido sea el más reciente; segundo, verificar que el contenido y el mapa del sitio sean consistentes: las páginas marcadas como "noindex" no deberían aparecer en `/llms.txt`, ya que esto implicaría que estás proporcionando activamente el contenido que no quieres que el AI procese; y tercero, revisar periódicamente los registros del servidor para registrar qué robots han extraído realmente el contenido. Esta es la única fuente de información que tienes para determinar si alguien está "leyendo" el contenido.

Referencias

Preguntas frecuentes

¿Cuáles son las diferencias entre «llms.txt» y «sitemap.xml»?
`sitemap.xml` es el estándar oficial respaldado por los motores de búsqueda, que enumera todas las URL indexables para que los rastreadores las descubran. `llms.txt` es una propuesta de la comunidad, que describe los puntos clave del sitio web en un formato de Markdown legible por humanos. El primero tiene un uso oficial claro, mientras que el segundo actualmente no cuenta con el compromiso de ninguna plataforma para su uso —ambos no son mutuamente sustitutivos.
¿Es imprescindible tener el archivo "llms-full.txt"?
No necesariamente. `llms-full.txt` es la versión completa del contenido, adecuada para sitios web con capacidad de almacenamiento controlada; sin embargo, para sitios web con muchas páginas, la versión completa puede resultar demasiado grande y diluir la información importante. En este sitio, utilizamos `llms.txt` para la lista estructurada y `llms-full.txt` para los párrafos completos que contienen información de servicios y casos.
¿Podría afectar la existencia de un archivo llamado "llms.txt" a las referencias que realiza la IA?
Según los documentos públicos disponibles en las diferentes plataformas, no. Google lo rechaza explícitamente; tampoco lo exige ninguna otra plataforma. La decisión de citar sigue basándose en si el contenido puede ser rastreado y si tiene un valor de autoridad. Se trata de un factor adicional, no de un requisito obligatorio.

¿Tiene alguna necesidad?

Contacte con nosotros