Falcon Information — Voltar para a página inicial

Lista de crawlers de IA e decisões sobre o arquivo robots.txt

É permitido ou não que os "robôs" de IA acessem seu site? Essa questão não tem uma resposta única, pois "robôs de IA" não são uma única entidade – são agentes de diferentes tipos, utilizados para treinamento, busca e leitura em tempo real, e suas formas de controle e consequências de bloqueio são distintas. Neste artigo, primeiro classificamos os diferentes tipos de robôs de IA, em seguida, apresentamos um quadro de decisão, e finalmente, compartilhamos as escolhas e justificativas da nossa própria equipe.

Este trecho do artigo

  • ·Três tipos de répteis
  • ·Lista principal de répteis
  • ·Estrutura de tomada de decisões
  • ·Opções disponíveis neste site
  • ·Detalhes práticos e erros comuns

Primeiramente, vamos distinguir os três usos, e então discutiremos sobre a possibilidade de abertura ou restrição.

A primeira categoria é de treinamento: coleta de conteúdo para treinamento de modelos, como GPTBot e ClaudeBot; a restrição implica que o conteúdo não pode ser usado nos dados de treinamento futuros, mas não impede o uso de dados de treinamento já existentes ou a replicação por terceiros. A segunda categoria é de indexação de busca: criação de índices e links de fontes para busca de IA, como OAI-SearchBot e PerplexityBot; a restrição equivale a impedir que o sistema de busca da plataforma não esteja disponível. A terceira categoria é de agente de usuário: captura em tempo real quando o usuário solicita a leitura de um endereço específico em uma conversa, como ChatGPT-User e Perplexity-User; de acordo com a documentação oficial da Perplexity, essas solicitações são consideradas comportamento do usuário e geralmente não são controladas pelo arquivo robots.txt; a única forma de bloquear seria no nível do servidor. Há também dois casos especiais: Google-Extended e Applebot-Extended não são rastreadores independentes, mas sim códigos de controle no arquivo robots.txt, que controlam se o conteúdo pode ser usado para o treinamento do Gemini e do modelo da Apple, respectivamente; na prática, os rastreamentos ainda são realizados pelos Googlebot e pelo Applebot.

Principais ferramentas de web scraping baseadas em IA

Com base nos documentos oficiais de cada plataforma (utilizando os documentos oficiais como referência, que podem ser atualizados de acordo com as políticas da plataforma):

Principais impactos do uso de IA para rastreamento e bloqueio
NomePertencente aCategoriaOs principais impactos do bloqueio
GPTBotOpenAITreinamentoEste conteúdo não deve ser usado para treinamento de modelos; não afeta a busca do ChatGPT.
OAI-SearchBotOpenAIÍndice de pesquisaRemover os links das fontes utilizadas na pesquisa no ChatGPT
ChatGPT-UserOpenAIUser AgentO usuário foi impedido de acessar os dados.
ClaudeBotAnthropicTreinamentoEste conteúdo não deve ser utilizado para treinar o Claude.
PerplexityBotPerplexityÍndice de pesquisaIdentificação das causas da perplexidade
Google-ExtendedGoogleCódigo de controle de treinamentoNão deve ser utilizado para treinamento do Gemini; não afeta a pesquisa do Google e a visão geral da IA.
Applebot-ExtendedAppleCódigo de controle de treinamentoNão deve ser utilizado para treinamento de modelos Apple.
AmazonbotAmazonÍndice/AssistenteO uso de serviços como a Alexa está sujeito a restrições.
CCBotCommon CrawlConjunto de dados públicoSair do Common Crawl (fonte de dados utilizada para o treinamento de muitos modelos).

Estrutura de tomada de decisão: Analisando o modelo de negócios do conteúdo.

O eixo de avaliação é: "O que você obtém e perde ao ter o conteúdo lido por IA". Conteúdo de marketing (descrições de serviços, estudos de caso, artigos): O objetivo é ser encontrado, com a possibilidade de busca aberta e com pouca probabilidade de perda de dados. O treinamento foca na posição da marca. Conteúdo pago e banco de dados original: O conteúdo em si é o produto. O bloqueio para treinamento é uma premissa razoável, enquanto para busca, avalia-se se o valor de direcionamento é maior do que a divulgação do conteúdo. Mídia e publicações: A negociação de licenciamento é a principal consideração, e o bloqueio frequentemente faz parte da negociação. Princípios comuns: Esta é uma decisão política reversível, e não uma decisão técnica única – escolha uma posição e revise-a a cada trimestre.

Nossa escolha: Abertura total, pelos seguintes motivos:

O arquivo `robots.txt` deste site permite o acesso a GPTBot, OAI-SearchBot, ChatGPT-User, ClaudeBot, PerplexityBot, Google-Extended, Applebot-Extended e Amazonbot. A razão é bastante direta: somos uma plataforma de serviços B2B, e o objetivo principal do nosso conteúdo é permitir que potenciais clientes nos encontrem e avaliem se somos confiáveis. A referência ao nosso conteúdo por plataformas de IA para responder a perguntas dos usuários é benéfica para nós, pois aumenta a visibilidade, e não representa uma perda. Além disso, é importante esclarecer que, para páginas que não desejamos serem indexadas (como rascunhos ou páginas pessoais), utilizamos o controle `noindex` no nível da página, em vez de `robots.txt`. A diferença entre esses dois mecanismos será detalhada na próxima seção.

Detalhes práticos e erros comuns

Um erro comum: tratar o arquivo `robots.txt` como uma ferramenta de privacidade. O `robots.txt` apenas impede a indexação por robôs, não é um controle de acesso – conteúdo sensível requer autenticação e proteção de permissões. Em segundo lugar: confundir indexação com rastreamento. O `robots.txt` impede o rastreamento; para evitar a indexação, use a tag `noindex`, e as páginas bloqueadas pelo `robots.txt` não podem ser encontradas pelo Google, mesmo que contenham a tag `noindex`. Em terceiro lugar: bloquear o Googlebot incorretamente. Bloquear o Googlebot não afeta a pesquisa, mas bloquear o Googlebot diretamente o remove dos resultados de pesquisa. É necessário verificar tanto o `robots.txt` quanto o relatório do Google Search Console (GSC) antes e depois de modificar o `robots.txt`. Em quarto lugar: bloqueio incorreto por WAF. As regras de firewall podem bloquear o acesso de robôs, enquanto permitem o acesso, sendo necessário verificar o acesso real por meio de registros do servidor e listas de endereços IP oficiais.

Referências

Perguntas frequentes

Se eu bloquear o GPTBot, o conteúdo não aparecerá mais no ChatGPT?
Não desaparecerá completamente. O GPTBot se concentra apenas na coleta de novos dados para treinamento. O ChatGPT utiliza o índice do OAI-SearchBot, e os dados históricos e o conteúdo de sites de terceiros que já foram incorporados ao modelo também não serão afetados. Para controlar cada uso de forma independente, é preciso identificar qual tipo de uso você deseja bloquear.
Bloquear o acesso ao Google Extended terá impacto no ranking do Google?
De acordo com a documentação oficial do Google, isso não é o caso. O "Google-Extended" controla apenas se o conteúdo é utilizado para treinamento de modelos como o Gemini, mas não afeta a coleta, indexação e classificação de resultados do Google Search, nem o "AI Overview" (que utiliza o índice do Googlebot padrão).
Quanto tempo leva para que as alterações no arquivo robots.txt entrem em vigor?
É necessário aguardar o próximo momento em que o Google atualiza o arquivo robots.txt, pois a frequência varia de acordo com cada plataforma. Normalmente, o Google faz isso em até 24 horas. Após a alteração, você pode verificar a versão que o Google recebeu usando o relatório robots.txt do Google Search Console. Para outras plataformas, observe as alterações no registro do servidor.
Como verificar se o animal que chegou é realmente uma lagartixa e não uma espécie similar?
A string "User-Agent" pode ser falsificada. A OpenAI, Google e Perplexity divulgam intervalos de endereços IP oficiais. A prática recomendada é verificar o endereço IP do servidor ou do WAF, aplicando as regras de permissão apenas para solicitações que passam nessa verificação.

Você tem alguma necessidade?

Entre em contato conosco