El robot del Cercador, un cercador de pàgines en català.
Si heu arribat aquí és perquè heu vist cercadorbot als registres del
vostre servidor. Aquesta pàgina explica què és, què fa amb les vostres pàgines i
com aturar-lo. Si després de llegir-la voleu que no hi torni, hi ha les
instruccions més avall i no cal que ens ho digueu: n'hi ha prou amb el
robots.txt.
El Cercador és un cercador que només indexa pàgines en català. No n'hi ha cap altra mena de contingut, i el que no és en català es descarta un cop baixat i no es desa enlloc.
És un projecte petit i encara no és públic. El robot va per la versió 0.1 i rastreja una llista curta de llocs, sobretot mitjans i institucions dels territoris de llengua catalana.
La capçalera User-Agent és exactament aquesta:
cercadorbot/0.1 (+https://cercador.icarns.xyz/bot)
Per a regles de tallafoc o d'anàlisi de registres, la cadena que el distingeix és
cercadorbot. Les peticions surten sempre de les adreces IP que hi ha
a /bot/ips.json; qualsevol cosa que digui que és
cercadorbot i vingui d'una altra adreça no som nosaltres.
robots.txt abans que cap altra cosa, i el torna a mirar per a cada adreça.Crawl-delay si li'n demaneu més.| No executa JavaScript | Llegeix l'HTML tal com arriba. No carrega recursos, ni imatges, ni tipus de lletra. |
|---|---|
| No entra enlloc | No omple formularis, no prova contrasenyes i no visita res que demani identificar-se. |
| No baixa fitxers | Només HTML. Els PDF, els vídeos i les imatges es descarten en veure'n el tipus, sense baixar-los. |
| No entrena models | El text serveix per fer un índex de cerca i per ensenyar-ne fragments als resultats. No es ven, no es cedeix i no s'usa per entrenar cap model de llenguatge. |
| No recull dades personals | No hi ha galetes, ni seguiment, ni cap intent d'identificar qui hi ha darrere d'una pàgina. |
noindex, no s'indexa, encara que el
robots.txt ens hi hagi deixat entrar. També es respecta
nofollow, tant a la pàgina sencera com a un enllaç concret, i la
capçalera X-Robots-Tag.
Al vostre robots.txt:
User-agent: cercadorbot
Disallow: /
User-agent: cercadorbot
Disallow: /privat/
Disallow: /cerca
Allow: /
Amb això esperarà trenta segons entre peticions en comptes de cinc:
User-agent: cercadorbot
Crawl-delay: 30
<meta name="robots" content="noindex">
Els canvis al robots.txt es llegeixen al començament de cada
rastreig. Si voleu que deixem d'indexar de seguida una cosa que ja hi és,
escriviu-nos i la traiem.
Hi ha una persona a l'altra banda. Si el robot us fa nosa, si va massa de pressa, si voleu que retirem una pàgina o si simplement voleu saber què n'hem fet, podeu escriure a bot@icarns.xyz i us contestarem.
Si el robot s'ha comportat malament —massa peticions, no fer cas del
robots.txt, qualsevol cosa— és un error i el volem saber. Digueu-nos
l'hora i el vostre domini i ho mirarem als registres.
cercadorbot is the crawler for a search engine that indexes Catalan-language pages only. Anything not in Catalan is discarded after fetching and never stored.
User agent:
cercadorbot/0.1 (+https://cercador.icarns.xyz/bot)
It reads robots.txt before anything else and honours
Disallow, Allow and Crawl-delay, plus
noindex, nofollow and X-Robots-Tag. It
waits five seconds between requests to the same host and never makes two at
once. It does not execute JavaScript, submit forms, attempt logins, or download
non-HTML files. The text is used to build a search index. It is not
sold, shared, or used to train language models.
To block it completely:
User-agent: cercadorbot
Disallow: /
Requests come only from the addresses listed at /bot/ips.json. Questions, complaints or removal requests: bot@icarns.xyz.