Tutorial WordPress affidabili, quando ne hai più bisogno.
Guida per principianti a WordPress
WPB Cup
30 milioni+
Siti web che utilizzano i nostri plugin
20+
Anni di esperienza con WordPress
3000+
Tutorial WordPress di esperti

Come risolvere il problema del budget di scansione SEO in WordPress

Il budget di scansione è il limite che Google impone su quante pagine scansionerà sul tuo sito web.

Oltre ai tuoi post e pagine, WordPress genera diversi URL aggiuntivi che i motori di ricerca possono scansionare e indicizzare. Ciò significa che Google potrebbe spendere il tuo budget di scansione su pagine non necessarie invece che sui tuoi contenuti importanti.

In questo articolo, ti mostreremo come ottimizzare il tuo budget di scansione in WordPress, in modo che Google trovi prima i tuoi contenuti importanti.

Ottimizzazione del crawl budget SEO in WordPress

Risposta rapida: Come correggere il budget di scansione in WordPress

Bloccare URL non necessari con le impostazioni di pulizia della scansione del tuo plugin SEO o robots.txt garantisce che il tuo budget di scansione non venga sprecato.

La maggior parte dei piccoli siti web potrebbe non esaurire mai il budget di scansione. Tuttavia, WordPress crea molti più URL di quanti ne pubblichi. Google potrebbe finire per sprecare il budget di scansione su questi URL, e le tue pagine importanti potrebbero non essere scansionate rapidamente o frequentemente.

Utilizza i collegamenti rapidi qui sotto per passare direttamente alla correzione di cui hai bisogno:

Cos'è il crawl budget e come verificarlo?

Il budget di scansione è il numero di pagine che un motore di ricerca come Google scansionerà sul tuo sito web entro un determinato periodo di tempo. Ci sono due fattori principali:

  • Capacità di scansione: Quante richieste Google può effettuare senza bloccare o rallentare il tuo server. Se il tuo server è veloce e affidabile, la tua capacità è alta.
  • Domanda di scansione: Quanto Google desidera scansionare il tuo sito in base alla sua popolarità, qualità generale e frequenza di pubblicazione di contenuti freschi.

Quando pagine di basso valore o server lenti consumano il tuo budget di scansione, Google scansiona meno e ci vuole più tempo per indicizzare i tuoi nuovi contenuti.

Vale la pena dedicare un momento all'esame del tuo report Statistiche di scansione in Google Search Console. Ti dice quando e quanto spesso Googlebot visita il tuo sito web. Apri semplicemente Google Search Console e vai su Impostazioni » Statistiche di scansione » Apri report per visualizzarlo.

Apertura del report Crawl Stats di Google Search Console

Una volta nel report, Google suddivide le richieste di scansione in quattro modi. Ecco cosa mostra ciascuna:

  • Per risposta. Come il tuo server ha risposto a ciascuna richiesta, inclusi 'OK (200)', 'Non trovato (404)', reindirizzamenti ed errori del server (5XX).
  • Per tipo di file. Cosa ha scaricato Googlebot tra pagine HTML, immagini, CSS e JavaScript.
  • Per scopo. 'Scoperta' significa che Google sta scansionando un URL per la prima volta, mentre 'Aggiornamento' significa che sta riesaminando pagine che già conosce.
  • Per tipo di Googlebot. Mostra quale crawler ha effettuato la richiesta. Una quota elevata di 'Smartphone' è normale, poiché Google scansiona principalmente la versione mobile del tuo sito.
Ripartizione delle richieste di scansione di Google Search Console

Fai clic su qualsiasi riga in questi report per visualizzare gli URL specifici e le loro statistiche di scansione individuali. Questi dati ti mostreranno anche esattamente quali correzioni necessita il tuo sito:

  • Una quota elevata di risposte 'Non trovato (404)' o 'Errore del server (5XX)' significa che URL non validi stanno consumando richieste. Puoi risolvere questo problema pulendo le tue catene di reindirizzamento e correggendo i link interrotti.
  • Un numero elevato di 'Syndication' significa che Google sta spendendo richieste su feed invece che sui tuoi contenuti. Puoi facilmente interrompere questo spreco bloccando quegli URL non necessari.
  • Se la tua statistica di scansione 'Scoperta' rimane alta anche quando non stai pubblicando nuovi contenuti, è probabile che Google stia perdendo tempo su URL generati automaticamente, come pagine di ordinamento e filtro. Puoi interrompere questo applicando le stesse regole di blocco di robots.txt.
  • Tempi di risposta medi lenti o errori del server ripetuti limitano l'intero tuo budget. Questo è un chiaro segnale che è ora di velocizzare il tuo server.

Infine, controlla la metrica 'Scoperto - attualmente non indicizzato' nel tuo report di indicizzazione delle pagine. Google la utilizza quando ritarda una scansione per evitare di bloccare il tuo server. Un conteggio elevato qui è un indicatore diretto che la scansione del tuo sito è limitata.

Blocca gli URL che sprecano la scansione con robots.txt o il tuo plugin SEO

La maggior parte del budget di scansione sprecato proviene da URL che WordPress e i tuoi plugin generano automaticamente, non dagli articoli che scrivi.

Questi URL non necessari includono feed, link di risposta ai commenti, risultati di ricerca interni, parametri di tracciamento dalle tue campagne e pubblicità, e parametri di filtro di WooCommerce.

Prima di iniziare a disabilitare gli URL, tieni a mente due cose:

  • Non disabilitare mai CSS o JS. Google ha bisogno di caricare questi file per visualizzare correttamente le tue pagine.
  • Non bloccare un URL che intendi noindexare. Un tag noindex chiede a Google di escludere una pagina dai risultati di ricerca. Tuttavia, Google deve eseguire la scansione della pagina WordPress per vedere quel tag, quindi bloccare l'URL in robots.txt significa che Google non lo leggerà mai.
Scrivi le tue regole robots.txt a mano

Il file robots.txt è un file di testo normale che si trova nella root del tuo sito web. Indica ai bot dei motori di ricerca quali URL non devono visitare.

Puoi modificare manualmente il tuo file robots.txt tramite il tuo account di hosting. Tuttavia, utilizzare l'editor integrato nel tuo plugin SEO è molto più semplice.

Ad esempio, in All in One SEO, lo troverai sotto All in One SEO » Strumenti » Editor Robots.txt.

Editor del file robots.txt di All in One SEO

Altri plugin popolari come Yoast SEO e Rank Math offrono editor robots.txt simili.

Inizia identificando i pattern di URL che non vuoi vengano scansionati, come /?s= per la ricerca interna, ?replytocom= aggiunto agli URL dei post per i link di risposta ai commenti e /feed/ per i feed RSS.

Prima di bloccare i tuoi feed RSS, assicurati di non averne bisogno per un podcast, una newsletter via email automatizzata o lettori di feed. Una volta che sai che non vengono utilizzati, aggiungi una regola Disallow per ciascuno.

User-agent: *
Disallow: /*?s=
Disallow: /*?replytocom=
Disallow: /*/feed/

Una volta salvate le tue regole, verificane la correttezza con il report robots.txt di Google Search Console prima di procedere.

Google Search Console - strumento robots.txt

Conferma che le tue nuove regole Disallow compaiano lì senza errori di sintassi segnalati.

Configura Crawl Cleanup nel tuo plugin SEO

Se preferisci non scrivere manualmente le regole robots.txt, le impostazioni di pulizia della scansione del tuo plugin SEO possono svolgere lo stesso lavoro con semplici interruttori.

Se stai usando AIOSEO, lo troverai sotto All in One SEO » Aspetto della ricerca » Avanzate. Quindi attiva ‘Pulizia scansione’. Lo strumento Pulizia scansione ti consente di disabilitare feed RSS non necessari (come quelli che WordPress genera automaticamente per commenti, autori e allegati), bloccare bot indesiderati e interrompere la scansione degli URL di ricerca interni.

Assicurati di lasciare attivo il feed principale del tuo sito. Ecco perché AIOSEO lo contrassegna come ‘sconsigliato da disabilitare’.

Abilitazione della funzionalità Pulizia scansione di AIOSEO nelle impostazioni Avanzate dell'aspetto della ricerca

Yoast SEO ha la stessa funzionalità sotto Yoast SEO » Impostazioni » Avanzate » Ottimizzazione scansione, con le proprie opzioni di rimozione feed e pulizia parametri URL.

Una volta attivate queste opzioni, controlla il tuo file robots.txt per confermare che le nuove regole siano effettivamente attive.

Come gestire i parametri di tracciamento

Campagne email, annunci e strumenti di marketing spesso aggiungono parametri di tracciamento ai tuoi URL (come utm_source, fbclid o gclid) per vedere da dove provengono i visitatori.

Monitoraggio Argomenti Query di AIOSEO ti mostra quali di questi argomenti di query (i valori aggiuntivi dopo un punto interrogativo in un URL) Googlebot sta effettivamente scansionando. Lo troverai in fondo alla stessa schermata ‘Avanzate’ in AIOSEO.

Monitoraggio argomenti query AIOSEO

Nella maggior parte dei casi, non è necessario bloccare o reindirizzare i link di tracciamento.

Mentre AIOSEO offre un'opzione ‘Ottimizza parametri UTM’ che riscrive questi link tramite reindirizzamenti, consigliamo vivamente di lasciarla disattivata per non interrompere accidentalmente i dati di monitoraggio.

Tuttavia, se noti argomenti di query nel tuo monitor che non hanno assolutamente alcuno scopo, puoi aggiungerli in sicurezza all'elenco di blocco in questa sezione. Gli utenti avanzati possono anche utilizzare le espressioni regolari (regex) per bloccare più URL simili contemporaneamente.

Pulisci gli URL dei filtri e del carrello di WooCommerce

I negozi WooCommerce aggiungono i propri parametri che sprecano risorse di scansione oltre a tutto quanto sopra, principalmente orderby=, filter_, min_price= e max_price=, e add-to-cart=.

Puoi bloccare quelli senza valore di ricerca usando lo stesso approccio robots.txt, o aggiungerli come argomenti di query in Monitoraggio argomenti di query dalla sezione sopra.

Blocco del parametro di query aggiungi al carrello nel Monitoraggio argomenti query di AIOSEO

Bloccare add-to-cart= è sicuro poiché attiva un'azione anziché fornire contenuti univoci.

Fai lo stesso per i filtri di ordinamento e intervallo di prezzo, con un'eccezione: un filtro che genera traffico di ricerca da solo, come una singola taglia o colore popolare.

Deindicizza contenuti sottili – Archivi di tag, date e autori

Deindicizzare significa rimuovere una pagina dai risultati di ricerca di Google. Lo fai aggiungendo un tag noindex, che chiede ai motori di ricerca di non mostrare quella pagina quando le persone cercano.

WordPress crea automaticamente pagine di archivio che raggruppano i tuoi post per tag, data e autore. Questi archivi ripetono per lo più contenuti già esistenti sul tuo sito, motivo per cui gli esperti SEO li definiscono pagine 'sottili'.

Ecco quattro tipi di archivi che di solito è sicuro deindicizzare:

  • Archivi autore, se il tuo sito ha un unico scrittore
  • Archivi tag che non funzionano come vere pagine di destinazione
  • Archivi data, che raramente hanno un valore di ricerca da soli
  • Pagine allegato, che i vecchi siti WordPress creano per ogni immagine caricata (WordPress 6.4 ha smesso di crearle per le nuove installazioni nel novembre 2023)

Puoi impostare ciascuno dei tipi di archivio su noindex dalle impostazioni di archivio del tuo plugin SEO. La maggior parte dei plugin SEO per WordPress include questa impostazione nelle loro versioni gratuite.

In AIOSEO, la troverai sotto All in One SEO » Aspetto della ricerca » Archivi.

Impostazione dell'archivio autore su noindex in AIOSEO

Prima di salvare, ricontrolla di non aver accidentalmente deindicizzato una pagina importante, o un intero tipo di post.

Mantieni pulita la tua sitemap XML

La tua sitemap XML dice a Google quali URL consideri importanti e recenti. Mantenendo la tua sitemap priva di disordine, ti assicuri che i motori di ricerca si concentrino sui tuoi contenuti più preziosi anziché sprecare tempo su archivi paginati.

Per impostazione predefinita, WordPress crea una sitemap XML per il tuo sito. Per un maggiore controllo, consigliamo di generare una sitemap personalizzata con un plugin SEO.

Una sitemap personalizzata aggiunge date di ultima modifica e rimuove da essa le pagine che hai impostato su noindex. AIOSEO, Yoast SEO e Rank Math ti consentono tutti di creare una sitemap nelle loro versioni gratuite.

Correggi errori di scansione e catene di reindirizzamento

URL morti e reindirizzati consumano comunque richieste di scansione perché Google scopre che un URL è morto solo recuperandolo. Su un tipico sito WordPress, queste richieste di scansione sprecate provengono solitamente da tre colpevoli principali:

  • Catene di reindirizzamento. Questo accade quando l'URL A reindirizza a B, che a sua volta reindirizza a C. Per risolvere questo problema, accorcia la catena instradando l'URL originale direttamente alla destinazione finale con un singolo reindirizzamento 301 (permanente).
  • Errori Soft 404. Questo si verifica quando una pagina viene rimossa, ma il tuo server restituisce ancora un normale codice di successo "200 OK". Google continuerà a scansionare l'URL perché il server non ha esplicitamente indicato che il contenuto è stato rimosso. Puoi risolvere questo problema assicurandoti che le pagine eliminate restituiscano un codice di stato 404 (Non trovato) o 410 (Andato) appropriato.
  • Link interni obsoleti. Ogni volta che Google segue un link interno che porta a una pagina non funzionante o a un reindirizzamento, consuma il tuo crawl budget. Dovresti controllare regolarmente i tuoi link interni e rimuoverli o aggiornarli per puntare direttamente all'URL live finale.

Puoi anche leggere la nostra guida su come creare un reindirizzamento in WordPress, che ti guida attraverso l'intero processo.

Accelera il tuo server per aumentare il tuo tasso di scansione

Un server veloce incoraggia Google a scansionare più pagine, mentre un server in difficoltà lo costringe a rallentare. Per migliorare i tempi di risposta, hai bisogno di due cose: un hosting WordPress robusto e una configurazione di caching attiva.

Tuttavia, gli errori del server possono danneggiare il tuo crawl budget ancora più della velocità della pagina. Se Googlebot incontra frequentemente timeout, riduce drasticamente la scansione ed è lento a riprendersi.

Puoi monitorare i tempi di risposta e gli errori del server nel report Statistiche di scansione di Google Search Console. Gli errori sono solitamente causati da un piano di hosting al limite o da un plugin difettoso.

Vedi la nostra guida per risolvere gli errori interni del server 500 per assistenza con i log degli errori e i limiti di hosting.

Blocca i crawler AI che sprecano le risorse del tuo server

I crawler AI come GPTBot, ClaudeBot e PerplexityBot non utilizzano il tuo crawl budget di Google. Tuttavia, colpiscono lo stesso server e uno scraping aggressivo può rallentare il tuo sito abbastanza da trascinare verso il basso anche il tuo tasso di scansione di Google.

La soluzione più rapida per risolvere questo problema è la pulizia della scansione che viene fornita con la maggior parte dei plugin SEO. La pulizia della scansione di AIOSEO include impostazioni di blocco dei bot che fermano i bot AI indesiderati a livello di WordPress.

Per una protezione più forte, il Controllo scansioni AI gratuito di Cloudflare ti consente di bloccare crawler individuali dalla sua scheda Crawler. Blocca i crawler prima ancora che raggiungano il tuo server di hosting.

Controlli crawler AI di Cloudflare

Tuttavia, usa cautela quando configuri la tua blocklist. Molti di questi 'bot' potrebbero essere assistenti di ricerca AI che generano traffico verso il tuo sito, quindi bloccarli indiscriminatamente danneggerà la tua visibilità complessiva.

Domande frequenti sul budget di scansione di WordPress

Ecco le domande che riceviamo più spesso sul crawl budget.

Puoi impostare o aumentare il tuo crawl budget?

Non esiste un numero fisso che puoi impostare. Puoi aumentare la tua capacità di scansione con un server più veloce e affidabile, e puoi aumentare la domanda di scansione con contenuti freschi e non duplicati che Google vuole effettivamente rivisitare.

Come posso impedire a Google di scansionare gli URL /feed/ che appaiono come duplicati in Search Console?

Disabilita i feed ridondanti con la pulizia della scansione di AIOSEO, oppure aggiungi una regola Disallow per gli URL dei tuoi feed al tuo robots.txt. Quel contenuto è già indicizzato altrove sul tuo sito, quindi bloccare i feed non ti costa nulla in termini di traffico organico.

Il tag noindex salva il crawl budget?

Non direttamente, perché Google deve comunque eseguire la scansione della pagina per vedere il tag. Invece, impedisci a Google di eseguire la scansione tramite un file robots.txt.

Una pagina 404 personalizzata con link utili migliorerà il mio crawl budget?

No, migliora l'esperienza utente. Per garantire che il crawl budget non venga sprecato, assicurati che il tuo server invii il codice di stato 404 o 410 corretto per una pagina che non esiste più.

Speriamo che questo articolo ti abbia aiutato a trovare e correggere ciò che sta sprecando il tuo crawl budget. Dai qualche settimana alle modifiche, quindi controlla di nuovo le statistiche di scansione per vedere il miglioramento.

Potresti anche voler leggere la nostra guida definitiva all'ottimizzazione per i motori di ricerca su WordPress o come impedire ai motori di ricerca di eseguire la scansione di un sito WordPress.

Se ti è piaciuto questo articolo, iscriviti al nostro Canale YouTube per tutorial video su WordPress. Puoi trovarci anche su Twitter e Facebook.

Divulgazione: Il nostro contenuto è supportato dai lettori. Ciò significa che se fai clic su alcuni dei nostri link, potremmo guadagnare una commissione. Vedi come è finanziato WPBeginner, perché è importante e come puoi supportarci. Ecco il nostro processo editoriale.

Il Toolkit WordPress Definitivo

Ottieni l'accesso GRATUITO al nostro toolkit - una raccolta di prodotti e risorse relative a WordPress che ogni professionista dovrebbe avere!

Interazioni del lettore

8 CommentiLascia una risposta

  1. Questo è davvero nuovo per me perché non sapevo cosa fosse il budget di scansione SEO. Dopo aver letto questa guida, ho capito le ragioni per cui alcuni dei cambiamenti che ho apportato a volte impiegano tempo per riflettersi sulla ricerca di Google. Ogni blogger deve saperlo, impararlo e sapere come utilizzare al meglio il proprio budget di scansione SEO.
    Questo è un articolo istruttivo, ho imparato un nuovo concetto qui, grazie

  2. Ho una pagina 404 personalizzata impostata e qui, oltre a scusarmi con i lettori, ho anche link a contenuti interessanti sul sito che potrebbero interessarli. Questa opzione può aiutare?

  3. Questo è un concetto completamente nuovo per me e sono venuto a conoscenza del budget di scansione e della sua importanza.
    poiché il budget di scansione è dato da Google stesso e indicizza le pagine web sulla sua base, quali sono i criteri per siti web grandi e piccoli e quali sono i fattori che contribuiscono al budget di scansione?

    • Per il momento non sono informazioni condivise pubblicamente, motivo per cui consigliamo di dare un'occhiata al rapporto di scansione per farsi un'idea di ciò che si ha per il proprio sito.

      Amministratore

  4. come posso dire a Google di non scansionare /feed/ link? la maggior parte dei nostri post è indicizzata. ma lo stesso o più numero di postlink/feed/ viene scansionato da Google. in GSC questi link diventano link duplicati.

    • Dovresti noindexare il tuo feed per impedire a Google di scansionarlo; se hai un plugin SEO sul tuo sito, questi normalmente avrebbero impostazioni per noindexare rapidamente il tuo feed.

      Amministratore

Lascia un commento

Grazie per aver scelto di lasciare un commento. Tieni presente che tutti i commenti sono moderati secondo la nostra politica sui commenti e il tuo indirizzo email NON verrà pubblicato. Si prega di NON utilizzare parole chiave nel campo del nome. Avviamo una conversazione personale e significativa.