Strumenti

Nove strumenti: la ricerca, l'account e sette per i cluster, cioè elenchi salvati di siti web che l'assistente può creare, combinare e da cui può estrarre dati. L'assistente sceglie gli argomenti in base a ciò che chiedi; questa pagina descrive tra cosa può scegliere e cosa torna indietro.

StrumentoArgomentiCosa fa
search query (obbligatorio), rows, page, snippets Cerca nel codice sorgente delle pagine con la sintassi delle query abituale. rows vale 20 per impostazione predefinita, fino al numero di righe per query del tuo piano. snippets: true aggiunge per ogni sito fino a tre brevi frammenti di codice sorgente (circa 300 caratteri) intorno alla corrispondenza.
account nessuno Piano, ricerche usate e rimaste oggi, righe per query, cluster e punti di estrazione, limite di frequenza. Non consuma nulla.
list_clusters nessuno I cluster dell'account, dal più recente. Non consuma nulla.
get_cluster cluster (obbligatorio), page, rows Una pagina dei domini di un cluster, fino a 1.000 alla volta. Non consuma nulla.
create_cluster query o domains, name Salva come cluster i risultati di una ricerca (costa una ricerca) oppure un elenco di domini (non costa nulla; si conservano solo i siti presenti nell'indice).
combine_clusters operation and, or o diff, clusters (ID), name Un nuovo cluster: i domini presenti in tutti i cluster, in almeno uno, oppure nel primo ma non nel secondo. Non consuma nulla.
extract_from_cluster cluster (obbligatorio), presets, regex, offset, limit, include_empty Ricava valori dal codice sorgente delle pagine dei siti di un cluster, fino a 100 siti per chiamata. Consuma punti di estrazione. Vedi sotto.
rename_cluster cluster, name Dà un nuovo nome a un cluster.
delete_cluster cluster Elimina un cluster definitivamente. È contrassegnato come distruttivo, quindi l'assistente ti chiede conferma prima di eseguirlo.

search, account, list_clusters e get_cluster si limitano a leggere. Un risultato torna due volte nella stessa risposta: come dati strutturati per il codice dell'assistente e come testo JSON per il modello.

Un risultato di ricerca

{
  "query": "\"angular.min.js\"",
  "total": 73665,
  "page": 1,
  "rows": 3,
  "returned": 3,
  "truncated": false,
  "index_complete": true,
  "took_ms": 6,
  "results": [
    { "domain": "imgbox.com", "url": "https://imgbox.com/", "rank": 4229 },
    { "domain": "uc.edu", "url": "https://www.uc.edu/", "rank": 5861 },
    { "domain": "sharemods.com", "url": "https://sharemods.com/", "rank": 10962 }
  ]
}

I campi hanno lo stesso significato che hanno nell'API:

Con snippets: true ogni risultato contiene anche snippets, un elenco di fino a tre stringhe di codice sorgente intorno alla corrispondenza. Sono codice scritto da altri, trasmesso come dati.

Ottenere più di una pagina

page e rows scorrono i risultati: page: 2, rows: 20 corrisponde ai risultati da 21 a 40. page per rows non può superare le righe per query del tuo piano: vedi Limiti ed errori.

Cluster ed estrazione

Chiedi a parole semplici e l'assistente concatena gli strumenti: «Trova i siti che usano Hotjar, salvali come cluster e ricava le loro email di contatto» diventa create_cluster con una query, poi extract_from_cluster con i modelli predefiniti email e hotjar, una parte dopo l'altra.

I modelli predefiniti sono espressioni già pronte, scelte per nome: email, phone, whatsapp, telegram, skype, facebook, instagram, twitter, linkedin, gtm, ga4, ua, hotjar, adsense, bitcoin. Per tutto il resto serve un'espressione regolare tra barre (o barre verticali), il cui primo gruppo di cattura è il valore: fino a dieci espressioni in tutto.

{
  "cluster": 7, "name": "\"hotjar.com\"", "size": 100,
  "offset": 0, "scanned": 100, "in_index": 100, "with_matches": 87,
  "next_offset": null,
  "regex": ["/mailto:(...)/i", "/hjid['\"]?\\s*[:=]\\s*([0-9]{4,10})/"],
  "points_used": 131.4, "points_left": 0,
  "rows": [
    { "domain": "example.com", "values": [["hello@example.com"], ["1234567"]], "matches": 2 }
  ]
}

next_offset indica dove parte la chiamata successiva; null significa che l'intero cluster è stato elaborato. Ogni sito trovato nell'indice costa tanti punti di estrazione quanti sono i valori trovati, 0,1 se non ce ne sono. Anche un account gratuito può usare i cluster, con i limiti gratuiti del sito web: fino a 100 domini per cluster e 100 punti di estrazione al giorno. Un account conserva fino a 100 cluster; oltre questo numero create_cluster risponde cluster_limit e non elimina nulla. Le stesse operazioni da codice sono descritte nell'API.

Successivo Limiti ed errori