Google-Extended: ein Trainings-Crawler, den Google betreibt
Google-Extended ist ein Trainings-Crawler. Er sammelt Seiten für den jeweiligen Zweck (Training und Fundierung von Gemini). Betrieben wird er von Google.
Auf einen Blick
- Betreiber
- robots.txt-Token
Google-Extended- Zweck
- Training. Trainings-Crawler sammeln Seiten für künftige Modelle. Wenn Sie sie aussperren, halten Sie damit nicht die Crawler auf, die Seiten für Antworten abrufen. Diese haben eigene Namen.
- Wofür er Daten liefert
- Training und Fundierung von Gemini
Was sich durch das Blockieren ändert
Wenn Sie Google-Extended aussperren, werden Ihre Seiten nicht für den jeweiligen Zweck (Training und Fundierung von Gemini) gesammelt. Die Crawler, die Seiten für Antworten abrufen, haben eigene Namen und können Ihre Website weiterhin lesen.
robots.txt-Zeilen für Google-Extended
robots.txt ist eine reine Textdatei im Stammverzeichnis einer Website (yoursite.com/robots.txt). Eine Gruppe beginnt mit einer oder mehreren User-agent-Zeilen, die Crawler benennen. Darauf folgen Allow- und Disallow-Zeilen für Pfade. Ein Crawler, der in einer Gruppe namentlich genannt wird, befolgt die Gruppen mit seinem Namen und ignoriert die Gruppe für alle Crawler (User-agent: *).
Zulassen
User-agent: Google-Extended
Allow: /Sperren
User-agent: Google-Extended
Disallow: /Lässt Ihre Website den Crawler zu?
Google-Extended ist ausschließlich ein Name für robots.txt-Regeln. Die Crawler-Prüfung liest dafür die robots.txt und sendet unter diesem Namen keine Anfrage.