L'Enhanced Web Crawler offre alla Conversation AI di HITLEAD una nuova capacità: apprendere da siti web interattivi con la stessa facilità con cui lo fa su pagine statiche. Raccogliendo automaticamente fino al 50% di contenuto in più per pagina (inclusi tab, accordion e sezioni a caricamento lazy), il tuo bot può rispondere a più domande con maggiore precisione.


INDICE


Cos'è l'Enhanced Web Crawler?

L'Enhanced Web Crawler è il motore di acquisizione siti web aggiornato all'interno del Bot Training. Simula le interazioni di un visitatore reale — apre accordion, clicca sui tab, scorre la pagina e rivela i dati caricati dinamicamente — per estrarre ogni informazione presente nel tuo sito. Questa conoscenza più ricca viene poi aggiunta al set di addestramento del bot, insieme alle opzioni già esistenti di crawling per Exact URL, Domain e Path.


Vantaggi principali

  • Cattura testuale più profonda: Estrae dal 30 al 50% di contenuto in più per pagina da moderne SPA (React, Vue, Angular, Gutenberg, ecc.).
  • Consapevolezza dei contenuti nascosti: Legge accordion, tab, modal, sezioni con lazy-load e infinite scroll.
  • Parsing multi-strategia veloce: Esegue 12+ strategie di rilevamento contenuto in parallelo per massimizzare la velocità.
  • Motore di interazione sicuro: Evita click rischiosi come invio di form, modifiche ai filtri e azioni sul carrello.
  • Estrazione parallelizzata: Riduce il tempo totale di crawling su siti grandi e complessi.
  • Metriche di crawling utili: Traccia tempo, interazioni, lunghezza del contenuto e memoria per diagnosticare e ottimizzare.

Estrazione intelligente di contenuti dinamici

  • Espande automaticamente gli accordion, naviga tra i tab, attiva il lazy-loading e rivela i contenuti nascosti.
  • 2+ strategie di rilevamento intelligenti (contenuto semantico, dati strutturati, metadata) in esecuzione parallela per un'estrazione rapidissima.
  • Motore di interazione sicuro che evita azioni disruptive come l'invio di form o i cambi di filtro.

  • Crawling ricorsivo della sitemap: Scopre ed elabora in modo ricorsivo le sitemap annidate per migliorare la scoperta degli URL su strutture sito a più livelli.
  • Supporto sitemap compressa: Gestisce file sitemap compressi (ad esempio .xml.gz e .gzip) per ridurre l'uso di banda e migliorare l'efficienza del crawling.
  • Navigation guard: Rileva i confini di navigazione per ridurre la deriva del crawler e mantenere la scoperta all'interno del perimetro della knowledge base.
  • Rilevamento multi-sorgente: Parsing HTML + valutazione JavaScript + scoperta basata sulle interazioni.
  • Individua link nascosti dietro sezioni espandibili e contenuti dinamici.
  • Deduplicazione intelligente con conservazione del testo descrittivo dei link.

Supporto universale per qualsiasi sito

  • Funziona con qualsiasi tipo di sito: HTML statico, WordPress, SPA React, app Vue, applicazioni Angular.
  • Crawling più veloce grazie all'estrazione parallela dei contenuti.
  • Osservabilità completa con metriche dettagliate (tempo di elaborazione, interazioni, lunghezza del contenuto, utilizzo della memoria).

Come usare l'Enhanced Web Crawler

Step 1: Vai alla Knowledge Base

  1. Clicca su AI Agents dal tuo sub-account.
  2. Clicca sulla scheda Knowledge Base.
  3. Crea una nuova Knowledge Base oppure modifica una esistente.
  4. Clicca sul pulsante + Add Source.
  5. Clicca su Web Crawler.

Schermata 1 — Knowledge Base - Web Crawler

Step 2: Scegli il tipo di dominio e inserisci il dominio

  1. Puoi scegliere tra più tipi di dominio da sottoporre a crawling per addestrare il tuo bot. Il tipo di dominio scelto determina quanti URL verranno analizzati.

    • Exact URL: Esegue il crawling di una specifica pagina web per usarne i dati nell'addestramento. Ad esempio, inserendo https://www.example.com/ il crawling si limita esattamente a quella pagina.
    • All URLs with the Path: Esegue il crawling di tutte le pagine all'interno di un percorso specifico. Ad esempio, inserendo https://www.example.com/marketing vengono incluse tutte le pagine che usano quel percorso URL, come /marketing/offerte o /marketing/promozioni.
    • All URLs in this Domain: Esegue il crawling di tutte le pagine all'interno di un dominio. Ad esempio, inserendo https://www.example.com/promo vengono incluse tutte le pagine con il dominio radice www.example.com.
  2. Aggiungi l'URL.

  3. Clicca sul pulsante Extract Data.

Schermata 2 — Knowledge Base - Web Crawler

Step 3: Seleziona gli URL trovati dal crawler

  1. Al termine del crawling, clicca sull'opzione View All Pages.
  2. Puoi selezionare tutti gli URL oppure selezionare singoli URL cliccando la casella di spunta accanto all'URL che vuoi aggiungere ai tuoi dati di addestramento.
  3. Dopo aver selezionato, clicca sul pulsante Train Bot.

Schermata 3 — Knowledge Base - Web Crawler


Domande frequenti

D: Cosa significa "scoperta di contenuti più intelligente"? Il crawler ora cattura fino a 5,2 volte più contenuto del sito web, inclusi testimonianze, funzionalità, dettagli di contatto e descrizioni dei servizi che in precedenza venivano spesso tralasciati.

D: Quanto è affidabile l'addestramento con il nuovo crawler? Il tasso di successo è migliorato dall'81,6% al 94,7% su tutti i tipi di sito — business, e-commerce e moderni siti interattivi — quindi le acquisizioni falliscono molto meno spesso.

D: Devo configurare qualcosa per estrarre le sezioni principali? No. 6+ strategie di rilevamento parallele trovano automaticamente sezioni hero, testimonianze, descrizioni prodotto, bio del team, tabelle prezzi e informazioni di contatto.

D: Riesce a leggere contenuti interattivi o nascosti? Sì. Espande gli accordion, naviga tra i tab e rivela sezioni con lazy-load o nascoste, per catturare testimonianze complete e informazioni dettagliate sui servizi.

D: Che dati strutturati estrae e perché è importante? Estrae il 94% in più di dati strutturati (orari di apertura, dettagli di contatto, prezzi, servizi), fornendo alla tua AI una comprensione più ricca e precisa della tua attività.

D: Cliccherà sul pulsante di checkout o invierà dei form? No. Il motore di interazione sicuro ignora gli elementi dei form, garantendo che non vengano effettuati invii accidentali.

D: Cosa succede se il crawler non riesce a raggiungere una sezione nascosta dietro un login? Il motore di interazione funziona solo con i contenuti pubblicamente accessibili. I dati privati o accessibili solo dopo il login non verranno sottoposti a crawling.


Articoli correlati

  • Configurare Conversation AI
  • Conversation AI Bot - Spiegazione
  • Panoramica Impostazioni avanzate – Conversation AI
  • Conversation AI - Azione di handover all'operatore umano