Zuerst sollten wir die drei verschiedenen Anwendungsbereiche klar trennen, bevor wir über die Frage der Offenheit oder des Schutzes sprechen.
Die erste Kategorie umfasst Trainingsmodelle: Diese sammeln Inhalte für das Training von Modellen wie GPTBot oder ClaudeBot. Der Schutzmechanismus bedeutet, dass Inhalte, die nicht in die zukünftigen Trainingsdaten aufgenommen werden, blockiert werden. Dies betrifft jedoch weder die bereits stattgefundenen Trainings noch die Weitergabe von Inhalten durch Dritte. Die zweite Kategorie umfasst Suchindexmodelle: Diese erstellen Indizes und Verbindungen zu Quellen für KI-basierte Suche, wie OAI-SearchBot oder PerplexityBot. Der Schutzmechanismus bedeutet, dass die Suchfunktion auf dieser Plattform nicht mehr genutzt werden kann. Die dritte Kategorie umfasst Benutzeragenten: Diese ermöglichen das sofortige Abrufen spezifischer URLs während eines Gesprächs, wie ChatGPT-User oder Perplexity-User. Laut der offiziellen Perplexity-Beschreibung sind solche Anfragen als Benutzerverhalten einzustufen und unterliegen in der Regel nicht der robots.txt-Regelung. Der Schutz muss auf Serverebene erfolgen. Es gibt zwei Sonderfälle: Google-Extended und Applebot-Extended sind keine eigenständigen Crawler, sondern lediglich Steuerzeichen in der robots.txt, die die Nutzung von Inhalten für Gemini- und Apple-Modelle regeln. Die eigentliche Abfrage erfolgt weiterhin über Googlebot und Applebot.
Hauptliste von KI-basierten Web-Scraping-Tools
Basierend auf den offiziellen Dokumenten der jeweiligen Plattform (die Verwendung definitionsgemäß den offiziellen Dokumenten entspricht und sich mit den Richtlinien der Plattform ändern kann):
Auswirkungen von KI-basierten Web-Crawlern und Blockierungsmechanismen| Name | Zugehörigkeit | Kategorie | Die Hauptauswirkungen der Blockade |
|---|
| GPTBot | OpenAI | Schulung | Der Inhalt darf nicht für das Training von Modellen verwendet werden; er beeinflusst die Suchfunktion von ChatGPT nicht. |
| OAI-SearchBot | OpenAI | Suchindex | Links zu den Suchquellen für ChatGPT, die Sie verlassen möchten |
| ChatGPT-User | OpenAI | Benutzeragent | Der Benutzer wurde beim Versuch, Daten abzurufen, abgelehnt. |
| ClaudeBot | Anthropic | Schulung | Dieser Inhalt darf nicht für das Training von Claude verwendet werden. |
| PerplexityBot | Perplexity | Suchindex | Ursachen für den Ausstieg aus Perplexity anzeigen |
| Google-Extended | Google | Trainings-Steuerungscode | Nicht für das Training von Gemini vorgesehen; hat keinen Einfluss auf die Google-Suche und die AI-Übersicht. |
| Applebot-Extended | Apple | Trainings-Steuerungscode | Nicht für das Training von Apple-Modellen geeignet. |
| Amazonbot | Amazon | Index/Assistent | Die Verwendung von Diensten wie Alexa ist eingeschränkt. |
| CCBot | Common Crawl | Öffentliche Datensätze | Austritt aus Common Crawl (eine wichtige Datenquelle für das Training vieler Modelle) |
Entscheidungsrahmen: Geschäftsmodelle basierend auf dem Inhalt
Die entscheidende Achse ist: „Was erhalten Sie und was verlieren Sie, wenn KI den Inhalt liest?“ Marketinginhalte (Dienstbeschreibungen, Fallstudien, Artikel): Ziel ist es, dass der Inhalt gefunden wird. Offene Marketinginhalte (mit Such- und Nutzerorientierung) bergen kaum Risiken, während Inhalte, die auf die Positionierung einer Marke ausgerichtet sind, eine andere Betrachtung erfordern. Bezahlte Inhalte und Originaldatenbanken: Der Inhalt selbst ist das Produkt. Die Sperrung von Inhalten, die auf die Positionierung einer Marke ausgerichtet sind, ist eine vernünftige Vorgehensweise. Bei Suchorientierten Inhalten sollte geprüft werden, ob der Wert der Weiterleitung den Verlust von Informationen übersteigt. Medien und Veröffentlichungen: Verhandlungen über Lizenzen sind ein zentraler Aspekt. Die Sperrung von Inhalten ist oft ein Teil der Verhandlung. Gemeinsame Prinzipien: Dies sind umkehrbare politische Entscheidungen, keine einmalige technische Entscheidung – wählen Sie zunächst eine Position und überprüfen Sie diese regelmäßig.
Unsere Auswahlkriterien: Vollständige Offenheit, aus folgenden Gründen:
Die robots.txt-Datei dieser Seite erlaubt die Indexierung von GPTBot, OAI-SearchBot, ChatGPT-User, ClaudeBot, PerplexityBot, Google-Extended, Applebot-Extended und Amazonbot. Der Grund dafür ist sehr einfach: Wir sind eine B2B-Dienstleistung, und das Ziel unserer Inhalte ist es, potenziellen Kunden dabei zu helfen, uns zu finden und zu beurteilen, ob wir vertrauenswürdig sind. Wenn KI-Plattformen unsere Inhalte verwenden, um Fragen von Nutzern zu beantworten, ist dies für uns eine Form der Sichtbarkeit, nicht eine Belastung. Darüber hinaus möchten wir betonen, dass wir Seiten, die nicht indexiert werden sollen (z. B. Entwürfe, persönliche Seiten), über die Funktion "noindex" im Seitenhierarchie-System steuern, anstatt über robots.txt. Die Unterschiede zwischen diesen beiden Mechanismen werden in dem nächsten Abschnitt erläutert.
Detaillierte Informationen und häufige Fehler
Ein häufiger Fehler: Die Verwendung von robots.txt als Datenschutz-Tool. robots.txt blockiert lediglich die Indexierung durch Suchmaschinen-Crawler, aber nicht den Zugriff – sensible Inhalte müssen durch Login- und Berechtigungsmechanismen geschützt werden. Zweitens: Verwechslung von Crawling und Indexierung. robots.txt blockiert das Crawling; um nicht indexiert zu werden, sollte man die Option "noindex" verwenden. Allerdings kann Google Seiten, die durch robots.txt blockiert werden, die "noindex"-Kennzeichnung nicht erkennen. Drittens: Falsche Blockierung von Suchmaschinen. Die Blockierung von Google-Extended hat keinen Einfluss auf die Suchergebnisse, aber eine falsche Blockierung von Googlebot führt dazu, dass diese direkt aus den Suchergebnissen entfernt wird. Es ist wichtig, sowohl vor als auch nach der Änderung der robots.txt-Datei die GSC-robots.txt-Berichte zu überprüfen. Viertens: Falsche Blockierung durch WAF. Firewall-Regeln können Crawler blockieren, während gleichzeitig Inhalte, die von robots.txt erlaubt sind, durchgelassen werden. Um den tatsächlichen Zugriff zu überprüfen, sollten Serverprotokolle und offizielle IP-Listen verwendet werden.