Falcon Information — Volver a la página principal

Lista de robots.txt y estrategias para el rastreo de sitios web con IA

¿Deberías o no permitir que los "crawlers" de IA accedan a tu sitio web? Esta pregunta no tiene una respuesta única, ya que los "crawlers" de IA no son una entidad homogénea. Son, en realidad, agentes utilizados para entrenamiento, búsqueda y lectura en tiempo real, y sus métodos de control y las consecuencias de bloquearlos son completamente diferentes. En este artículo, primero distinguimos los diferentes tipos de "crawlers" de IA, luego ofrecemos un marco de decisión, y finalmente, presentamos nuestras propias decisiones y razones.

Sección del artículo

  • ·Tres tipos de reptiles
  • ·Lista principal de reptiles
  • ·Marco de toma de decisiones
  • ·Opciones disponibles en esta plataforma.
  • ·Detalles prácticos y errores comunes

Primero, debemos distinguir claramente los tres usos, y luego podemos hablar sobre si se deben permitir o restringir.

La primera categoría es la de entrenamiento: recopila contenido para el entrenamiento de modelos, como GPTBot y ClaudeBot; su función es impedir que el contenido entre en los datos de entrenamiento futuros, pero no impide el uso de datos de entrenamiento ya existentes ni la retransmisión por terceros. La segunda categoría es la de indexación de búsqueda: establece índices y enlaces a fuentes para la búsqueda con IA, como OAI-SearchBot y PerplexityBot; su función es impedir que la plataforma pueda realizar búsquedas. La tercera categoría es la de agentes de usuario: captura en tiempo real de direcciones web específicas solicitadas por los usuarios durante una conversación, como ChatGPT-User y Perplexity-User; según la documentación oficial de Perplexity, estas solicitudes son consideradas como acciones del usuario y, por lo general, no están sujetas al control de robots.txt. Existen dos casos especiales: Google-Extended y Applebot-Extended no son robots independientes, sino códigos de control en robots.txt, que controlan si el contenido puede utilizarse para el entrenamiento de Gemini y de los modelos de Apple, respectivamente; en realidad, los robots que realizan la captura son Googlebot y Applebot.

Lista principal de herramientas de IA para web scraping

Según la documentación oficial de cada plataforma (utilizando las definiciones proporcionadas en la documentación oficial, que pueden cambiar según las políticas de la plataforma):

Principales impactos de la inteligencia artificial y el bloqueo de sitios web.
NombrePertenece aTipoLos principales efectos del bloqueo:
GPTBotOpenAIEntrenamientoEste contenido no se utiliza para el entrenamiento de modelos; no afecta a la búsqueda de ChatGPT.
OAI-SearchBotOpenAIÍndice de búsquedaEliminar los enlaces a las fuentes de búsqueda de ChatGPT
ChatGPT-UserOpenAIEncabezado de agente de usuarioEl usuario fue rechazado al intentar acceder a la información.
ClaudeBotAnthropicEntrenamientoEste contenido no debe utilizarse para entrenar a Claude.
PerplexityBotPerplexityÍndice de búsquedaIdentificar las causas de la confusión en Perplexity
Google-ExtendedGoogleCódigo de control de entrenamientoNo se utiliza para el entrenamiento de Gemini; no afecta a la búsqueda de Google ni a la vista general de la IA.
Applebot-ExtendedAppleCódigo de control de entrenamientoNo se utiliza para el entrenamiento de modelos de Apple.
AmazonbotAmazonÍndice/AsistenteEl uso de servicios como Alexa está sujeto a restricciones.
CCBotCommon CrawlConjunto de datos públicoSalir de Common Crawl (fuente de datos utilizada para entrenar muchos modelos).

Marco de decisión: Analizando el modelo de negocio del contenido

El eje de decisión es: "¿Qué obtienes y qué pierdes cuando la IA procesa el contenido?". El contenido de marketing (descripciones de servicios, casos de estudio, artículos): el objetivo principal es que sea fácilmente encontrado, con un riesgo mínimo de ser utilizado de forma no autorizada (búsqueda y acceso directo). Los contenidos de entrenamiento deben reflejar la postura de la marca. Los contenidos de pago y la base de datos original: el contenido en sí es el producto. El bloqueo de contenidos de entrenamiento es una medida razonable, mientras que para los contenidos de búsqueda, se debe evaluar si el valor de la derivación es mayor que el riesgo de fuga de información. Medios y publicaciones: las negociaciones de licencia son un factor clave, y el bloqueo a menudo es parte de la negociación. Principios comunes: esta es una decisión política reversible, no una decisión técnica única. Primero, se elige una postura, y luego se revisa cada trimestre.

Las opciones que ofrecemos en esta plataforma son: acceso completo, y las razones son las siguientes:

El archivo robots.txt de este sitio web permite el acceso a GPTBot, OAI-SearchBot, ChatGPT-User, ClaudeBot, PerplexityBot, Google-Extended, Applebot-Extended y Amazonbot. La razón es muy directa: somos una plataforma de servicios B2B, y el único propósito de nuestro contenido es que los clientes potenciales nos encuentren y evalúen si somos confiables. El uso de nuestro contenido por parte de plataformas de IA para responder preguntas de los usuarios es una forma de visibilidad, no una pérdida. Además, es importante aclarar que para las páginas que no queremos que se indexen (como borradores o páginas personales), utilizamos el control "noindex" a nivel de página, en lugar de robots.txt. La diferencia entre estos dos mecanismos se explica en el siguiente párrafo.

Detalles prácticos y errores comunes

El primer error común: tratar el archivo `robots.txt` como una herramienta de privacidad. El archivo `robots.txt` solo impide que los rastreadores accedan a ciertas páginas, no proporciona control de acceso; el contenido sensible debe protegerse con autenticación y permisos. Segundo: confundir el rastreo con la indexación. El archivo `robots.txt` impide el rastreo; para evitar que una página sea indexada, se utiliza la etiqueta `noindex`, pero si una página está bloqueada por el archivo `robots.txt`, Google no puede leer su etiqueta `noindex`. Tercero: bloquear incorrectamente. Bloquear a Google-Extended no afecta a los resultados de búsqueda, pero bloquear a Googlebot lo elimina directamente de los resultados de búsqueda. Además, es necesario verificar tanto el archivo `robots.txt` generado por GSC antes como después de modificarlo. Cuarto: bloquear erróneamente con un WAF. Las reglas del firewall pueden bloquear a los rastreadores mientras permiten el acceso a determinadas páginas. Para verificar el acceso real, es necesario consultar los registros del servidor y las listas de direcciones IP oficiales.

Referencias

Preguntas frecuentes

Si bloqueo GPTBot, ¿significa que el contenido que genera no aparecerá en ChatGPT?
No desaparecerán por completo. GPTBot se centra únicamente en la recopilación de nuevos datos de entrenamiento; las referencias que ChatGPT busca están indexadas por OAI-SearchBot, y los datos históricos entrenados y el contenido de terceros sitios web que se han incorporado al modelo también permanecen intactos. Para controlarlos de forma independiente, es necesario identificar claramente qué tipo de uso se desea bloquear.
¿La restricción de Google Extended afectará al posicionamiento en los resultados de búsqueda de Google?
Según la documentación oficial de Google, no es así. Google-Extended solo controla si el contenido se utiliza para entrenar modelos como Gemini, pero no afecta a la función de búsqueda de Google, ni a la indexación y clasificación de resultados, ni tampoco al uso de Googlebot para la creación de índices.
¿Cuánto tiempo tarda en surtir efecto un cambio en el archivo robots.txt?
Es necesario esperar a que Google vuelva a actualizar el archivo robots.txt, ya que la frecuencia varía según cada motor de búsqueda. Normalmente, Google lo actualiza en un plazo de 24 horas. Una vez realizado el cambio, se puede verificar la versión que Google ha obtenido utilizando el informe de robots.txt proporcionado por Google Search Console. Para otras plataformas, se puede observar los registros del servidor para verificar los cambios reales en el acceso.
¿Cómo puedo determinar si se trata de una verdadera serpiente o de una especie imitadora?
La cadena "User agent" puede ser falsificada. OpenAI, Google y Perplexity han publicado rangos de direcciones IP oficiales. La práctica más rigurosa es verificar la dirección IP del servidor o del WAF, y aplicar las reglas de autorización solo a las solicitudes que superen la verificación.

¿Tiene alguna necesidad?

Contacte con nosotros