GPTBot: ein Trainings-Crawler, den OpenAI betreibt
GPTBot ist ein Trainings-Crawler. Er sammelt Seiten für den jeweiligen Zweck (künftige OpenAI-Modelle). Betrieben wird er von OpenAI.
Auf einen Blick
- Betreiber
- OpenAI
- robots.txt-Token
GPTBot- Zweck
- Training. Trainings-Crawler sammeln Seiten für künftige Modelle. Wenn Sie sie aussperren, halten Sie damit nicht die Crawler auf, die Seiten für Antworten abrufen. Diese haben eigene Namen.
- Wofür er Daten liefert
- künftige OpenAI-Modelle
Was sich durch das Blockieren ändert
Wenn Sie GPTBot aussperren, werden Ihre Seiten nicht für den jeweiligen Zweck (künftige OpenAI-Modelle) gesammelt. Die Crawler, die Seiten für Antworten abrufen, haben eigene Namen und können Ihre Website weiterhin lesen.
User-Agent
Der vollständige User-Agent aus der Dokumentation des Betreibers. Wenn GPTBot eine Anfrage sendet, enthält sie diesen Text. Er erscheint auch im Serverprotokoll.
Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko); compatible; GPTBot/1.4; +https://openai.com/gptbotrobots.txt-Zeilen für GPTBot
robots.txt ist eine reine Textdatei im Stammverzeichnis einer Website (yoursite.com/robots.txt). Eine Gruppe beginnt mit einer oder mehreren User-agent-Zeilen, die Crawler benennen. Darauf folgen Allow- und Disallow-Zeilen für Pfade. Ein Crawler, der in einer Gruppe namentlich genannt wird, befolgt die Gruppen mit seinem Namen und ignoriert die Gruppe für alle Crawler (User-agent: *).
Zulassen
User-agent: GPTBot
Allow: /Sperren
User-agent: GPTBot
Disallow: /Lässt Ihre Website den Crawler zu?
Die kostenlose Crawler-Prüfung liest Ihre robots.txt für GPTBot und ruft Ihre Seite mit dessen User-Agent auf. So zeigt sie, ob eine robots.txt-Regel oder eine Firewall den Crawler abweist.