cercadorbot

El robot del Cercador, un cercador de pàgines en català.

Si heu arribat aquí és perquè heu vist cercadorbot als registres del vostre servidor. Aquesta pàgina explica què és, què fa amb les vostres pàgines i com aturar-lo. Si després de llegir-la voleu que no hi torni, hi ha les instruccions més avall i no cal que ens ho digueu: n'hi ha prou amb el robots.txt.

Què és

El Cercador és un cercador que només indexa pàgines en català. No n'hi ha cap altra mena de contingut, i el que no és en català es descarta un cop baixat i no es desa enlloc.

És un projecte petit i encara no és públic. El robot va per la versió 0.1 i rastreja una llista curta de llocs, sobretot mitjans i institucions dels territoris de llengua catalana.

Com identificar-lo

La capçalera User-Agent és exactament aquesta:

cercadorbot/0.1 (+https://cercador.icarns.xyz/bot)

Per a regles de tallafoc o d'anàlisi de registres, la cadena que el distingeix és cercadorbot. Les peticions surten sempre de les adreces IP que hi ha a /bot/ips.json; qualsevol cosa que digui que és cercadorbot i vingui d'una altra adreça no som nosaltres.

Què fa

Què no fa

No executa JavaScriptLlegeix l'HTML tal com arriba. No carrega recursos, ni imatges, ni tipus de lletra.
No entra enllocNo omple formularis, no prova contrasenyes i no visita res que demani identificar-se.
No baixa fitxersNomés HTML. Els PDF, els vídeos i les imatges es descarten en veure'n el tipus, sense baixar-los.
No entrena modelsEl text serveix per fer un índex de cerca i per ensenyar-ne fragments als resultats. No es ven, no es cedeix i no s'usa per entrenar cap model de llenguatge.
No recull dades personalsNo hi ha galetes, ni seguiment, ni cap intent d'identificar qui hi ha darrere d'una pàgina.
Si una pàgina porta noindex, no s'indexa, encara que el robots.txt ens hi hagi deixat entrar. També es respecta nofollow, tant a la pàgina sencera com a un enllaç concret, i la capçalera X-Robots-Tag.

Com aturar-lo

Del tot

Al vostre robots.txt:

User-agent: cercadorbot
Disallow: /

Només algunes parts

User-agent: cercadorbot
Disallow: /privat/
Disallow: /cerca
Allow: /

Que vingui més a poc a poc

Amb això esperarà trenta segons entre peticions en comptes de cinc:

User-agent: cercadorbot
Crawl-delay: 30

Una pàgina concreta

<meta name="robots" content="noindex">

Els canvis al robots.txt es llegeixen al començament de cada rastreig. Si voleu que deixem d'indexar de seguida una cosa que ja hi és, escriviu-nos i la traiem.

Contacte

Hi ha una persona a l'altra banda. Si el robot us fa nosa, si va massa de pressa, si voleu que retirem una pàgina o si simplement voleu saber què n'hem fet, podeu escriure a bot@icarns.xyz i us contestarem.

Si el robot s'ha comportat malament —massa peticions, no fer cas del robots.txt, qualsevol cosa— és un error i el volem saber. Digueu-nos l'hora i el vostre domini i ho mirarem als registres.


In English

cercadorbot is the crawler for a search engine that indexes Catalan-language pages only. Anything not in Catalan is discarded after fetching and never stored.

User agent:

cercadorbot/0.1 (+https://cercador.icarns.xyz/bot)

It reads robots.txt before anything else and honours Disallow, Allow and Crawl-delay, plus noindex, nofollow and X-Robots-Tag. It waits five seconds between requests to the same host and never makes two at once. It does not execute JavaScript, submit forms, attempt logins, or download non-HTML files. The text is used to build a search index. It is not sold, shared, or used to train language models.

To block it completely:

User-agent: cercadorbot
Disallow: /

Requests come only from the addresses listed at /bot/ips.json. Questions, complaints or removal requests: bot@icarns.xyz.