Google-Extended: crawler per l’addestramento gestito da Google
Google-Extended è un crawler per l’addestramento. Raccoglie pagine per questo prodotto: addestramento e grounding di Gemini. È gestito da Google.
In breve
- Gestore
- Identificativo robots.txt
Google-Extended- Scopo
- Addestramento. I crawler per l’addestramento raccolgono pagine per i modelli futuri. Bloccarli non ferma i crawler che recuperano pagine per fornire risposte, perché hanno nomi distinti.
- Cosa alimenta
- addestramento e grounding di Gemini
Effetti del blocco
Se blocchi Google-Extended, le tue pagine resteranno fuori dai contenuti che raccoglie per questo prodotto: addestramento e grounding di Gemini. I crawler che recuperano pagine per fornire risposte hanno nomi distinti e potranno comunque leggere il tuo sito.
Regole robots.txt per Google-Extended
robots.txt è un file di testo semplice nella directory principale di un sito (yoursite.com/robots.txt). Un gruppo inizia con una o più righe User-agent che indicano i crawler, seguite da righe Allow e Disallow per i percorsi. Un crawler indicato in un gruppo segue i gruppi che lo nominano e ignora quello valido per tutti i crawler (User-agent: *).
Per consentire l’accesso
User-agent: Google-Extended
Allow: /Per bloccare l’accesso
User-agent: Google-Extended
Disallow: /Il tuo sito gli consente l’accesso?
Google-Extended è un nome usato solo nelle regole robots.txt. Il controllo dei crawler legge robots.txt per quel nome e non invia richieste fingendosi quel crawler.