먼저 세 가지 용도를 명확히 구분한 후, 개방 또는 차단에 대해 논의합시다.
첫 번째 유형은 훈련형입니다. GPTBot, ClaudeBot과 같이 콘텐츠를 수집하여 모델 훈련에 사용합니다. 이는 "특정 콘텐츠가 미래의 훈련 데이터에 포함되지 않도록" 차단하는 것을 의미하지만, 이미 발생한 훈련이나 제3자 재게시를 막을 수는 없습니다. 두 번째 유형은 검색 인덱싱형입니다. OAI-SearchBot, PerplexityBot과 같이 AI 검색의 인덱스와 소스 링크를 구축합니다. 이는 해당 플랫폼에서의 검색 가능성을 차단하는 것과 같습니다. 세 번째 유형은 사용자 에이전트형입니다. 사용자가 대화 중에 특정 웹사이트의 콘텐츠를 즉시 가져오는 경우, ChatGPT-User, Perplexity-User와 같이 작동합니다. Perplexity 공식 설명에 따르면, 이러한 요청은 사용자 행동에 해당하며, 일반적으로 robots.txt를 통해 차단할 수 없습니다. 서버 측에서만 차단할 수 있습니다. 추가적으로 Google-Extended와 Applebot-Extended는 독립적인 크롤러가 아니라, robots.txt에 정의된 제어 코드입니다. 이는 Gemini 훈련 및 Apple 모델 훈련에 콘텐츠를 사용할 수 있는지 여부를 제어하는 역할을 합니다. 실제로는 Googlebot과 Applebot이 콘텐츠를 수집합니다.
주요 AI 웹 크롤링 도구 목록
각 플랫폼의 공식 문서에 따라 용도 정의를 확인합니다 (정의는 공식 문서에 따라 결정되며, 플랫폼 정책에 따라 변경될 수 있습니다).
주요 AI 봇 및 차단 기술의 영향| 이름 | 소속 | 종류 | 주요 영향 |
|---|
| GPTBot | OpenAI | 훈련 | 이 내용은 모델 훈련에 사용되지 않으며, ChatGPT 검색에 영향을 미치지 않습니다. |
| OAI-SearchBot | OpenAI | 검색 인덱스 | ChatGPT 검색 결과에서 사용된 출처 링크 종료 |
| ChatGPT-User | OpenAI | 사용자 에이전트 | 사용자가 데이터를 읽으려고 시도했지만 거부당했습니다. |
| ClaudeBot | Anthropic | 훈련 | 클로드 훈련에 사용하지 마세요. |
| PerplexityBot | Perplexity | 검색 인덱스 | Perplexity의 원인 분석 |
| Google-Extended | Google | 훈련 제어 코드 | Gemini 훈련에는 사용하지 않으며, Google 검색 및 AI 개요 기능에 영향을 미치지 않습니다. |
| Applebot-Extended | Apple | 훈련 제어 코드 | 애플 모델 훈련에는 사용하지 마세요. |
| Amazonbot | Amazon | 색인/조수 | Alexa와 같은 서비스의 사용 제한 |
| CCBot | Common Crawl | 공개 데이터셋 | Common Crawl(많은 모델의 학습 데이터 소스)에서 이탈 |
의사 결정 프레임워크: 콘텐츠의 비즈니스 모델 분석
판단의 기준은 "AI가 콘텐츠를 읽고, 얻는 것과 잃는 것"입니다. 공개 마케팅 콘텐츠(서비스 설명, 사례, 기사): 목적은 콘텐츠를 찾도록 하여, 검색 기반 및 사용자 중심 방식은 거의 위험이 없으며, 훈련 기반은 브랜드 관점을 따릅니다. 유료 콘텐츠 및 원본 데이터베이스: 콘텐츠 자체가 상품이며, 훈련 기반은 합리적인 설정입니다. 검색 기반은 콘텐츠 유출보다 유도 효과가 더 큰지 여부를 고려합니다. 미디어 및 출판: 라이선스 협상은 핵심 고려 사항이며, 훈련 기반은 협상의 중요한 부분으로 활용될 수 있습니다. 공통 원칙: 이는 되돌릴 수 있는 정책 결정이며, 일회성 기술 결정이 아닙니다. 먼저 하나의 입장을 선택하고, 매 분기마다 검토합니다.
본 웹사이트의 선택 기준: 모든 항목을 개방하는 이유
본 웹사이트의 robots.txt 파일은 GPTBot, OAI-SearchBot, ChatGPT-User, ClaudeBot, PerplexityBot, Google-Extended, Applebot-Extended, Amazonbot 등 모든 봇에 대해 접근을 허용합니다. 그 이유는 매우 명확합니다. 저희는 B2B 서비스 웹사이트이며, 콘텐츠의 유일한 목적은 잠재 고객이 저희를 찾고, 저희의 신뢰도를 판단하도록 돕는 것입니다. AI 플랫폼에서 저희 콘텐츠를 활용하여 사용자에게 답변을 제공하는 것은 저희에게는 홍보 효과가 있습니다. 또한, 다음 사항을 명시합니다. 인덱싱되지 않기를 원하는 페이지(예: 초안, 개인 페이지)는 robots.txt가 아닌, 페이지 레벨의 noindex 기능을 사용하여 관리합니다. 이 두 가지 기능의 차이점은 다음 부분에서 설명하겠습니다.
실제 구현 세부 사항 및 일반적인 오류
가장 흔한 오류 1: robots.txt를 개인정보 보호 도구로 오해하는 경우. robots.txt는 웹 크롤러의 접근을 제한하는 도구일 뿐, 접근 제어 도구가 아닙니다. 민감한 정보는 로그인 및 권한 보호를 통해 보호해야 합니다. 2. 크롤링과 인덱싱 혼동: robots.txt는 크롤링을 제한하지만, "noindex"를 사용하여 특정 페이지가 검색 결과에 나타나지 않도록 할 수 있습니다. 그러나 robots.txt로 인해 차단된 페이지는 Google이 "noindex" 태그를 인식하지 못할 수 있습니다. 3. 잘못된 차단 대상: Google-Extended를 차단하면 검색에는 영향을 미치지 않지만, Googlebot을 잘못 차단하면 검색 결과에서 제외될 수 있습니다. 따라서 robots.txt를 변경하기 전후에는 GSC의 robots.txt 보고서를 통해 확인해야 합니다. 4. WAF 오탐: 방화벽 규칙이 robots.txt에서 허용된 웹 크롤러를 차단할 수 있습니다. 실제 접근 여부를 확인하기 위해 서버 로그 및 공식 IP 목록을 확인해야 합니다.