For the complete documentation index, see llms.txt. This page is also available as Markdown.

OpenCity AI Crawler

Cos'è l'OpenCity AI Crawler?

Il crawler di OpenCity AI è un web scraper sviluppato da OpenCity Labs per leggere e indicizzare contenuti web pubblici.

Viene utilizzato per alimentare la base di conoscenza del Chatbot AI, per analisi di siti web e per ricerca di contenuti pubblici.

Come identificarlo nei log

Se vedi il nostro crawler nei log del tuo server, lo riconosci dalla seguente stringa User-Agent:

Mozilla/5.0 (compatible; OpenCityAI-Crawler/1.0; +https://link.opencitylabs.it/ai-chatbot-crawler)

Il token da usare nelle regole robots.txt è OpenCityAI-Crawler.

Cosa fa

  • Scoperta pagine: parte dalla root del sito e dalla sitemap XML, poi segue i link interni per scoprire nuove pagine.

  • Frequenza adattiva: ogni pagina viene ri-scansionata periodicamente, in genere ogni 24–168 ore, in base alla frequenza di aggiornamento dichiarata nella sitemap e alla variazione effettiva del contenuto.

  • Rate limiting automatico: in caso di errori 429 o 503, il crawler rallenta automaticamente e rispetta l'eventuale header Retry-After.

  • Solo contenuto pubblico: non accede ad aree autenticate, non compila form e non interagisce con elementi che richiedono login.

Comportamento

Il nostro crawler:

  • rispetta rigorosamente il Web Robots Exclusion Protocol, inclusi Disallow, Allow e Crawl-delay;

  • adatta automaticamente la velocità di scansione in base alle risposte del server;

  • mantiene un intervallo minimo tra le richieste allo stesso host.

Come controllare il crawler tramite robots.txt

Bloccare sezioni specifiche

Impostare un ritardo tra le richieste

Bloccare completamente il crawler

Se il tuo sito ha Disallow: / per User-agent: * e vuoi che il nostro crawler possa comunque accedere, aggiungi un blocco specifico:

Verifica dell'autenticità

Il crawler proviene da questi IP:

  • 3.250.32.208

  • 3.253.249.121

Contatti

Per domande, segnalazioni di comportamenti anomali o supporto nella configurazione del robots.txt:

Last updated

Was this helpful?