Strumenti
Nove strumenti: la ricerca, l'account e sette per i cluster, cioè elenchi salvati di siti web che l'assistente può creare, combinare e da cui può estrarre dati. L'assistente sceglie gli argomenti in base a ciò che chiedi; questa pagina descrive tra cosa può scegliere e cosa torna indietro.
| Strumento | Argomenti | Cosa fa |
|---|---|---|
search |
query (obbligatorio), rows, page, snippets |
Cerca nel codice sorgente delle pagine con la sintassi delle query abituale. rows vale 20 per impostazione predefinita, fino al numero di righe per query del tuo piano. snippets: true aggiunge per ogni sito fino a tre brevi frammenti di codice sorgente (circa 300 caratteri) intorno alla corrispondenza. |
account |
nessuno | Piano, ricerche usate e rimaste oggi, righe per query, cluster e punti di estrazione, limite di frequenza. Non consuma nulla. |
list_clusters |
nessuno | I cluster dell'account, dal più recente. Non consuma nulla. |
get_cluster |
cluster (obbligatorio), page, rows |
Una pagina dei domini di un cluster, fino a 1.000 alla volta. Non consuma nulla. |
create_cluster |
query o domains, name |
Salva come cluster i risultati di una ricerca (costa una ricerca) oppure un elenco di domini (non costa nulla; si conservano solo i siti presenti nell'indice). |
combine_clusters |
operation and, or o diff, clusters (ID), name |
Un nuovo cluster: i domini presenti in tutti i cluster, in almeno uno, oppure nel primo ma non nel secondo. Non consuma nulla. |
extract_from_cluster |
cluster (obbligatorio), presets, regex, offset, limit, include_empty |
Ricava valori dal codice sorgente delle pagine dei siti di un cluster, fino a 100 siti per chiamata. Consuma punti di estrazione. Vedi sotto. |
rename_cluster |
cluster, name |
Dà un nuovo nome a un cluster. |
delete_cluster |
cluster |
Elimina un cluster definitivamente. È contrassegnato come distruttivo, quindi l'assistente ti chiede conferma prima di eseguirlo. |
search, account, list_clusters e
get_cluster si limitano a leggere. Un risultato torna due volte nella
stessa risposta: come dati strutturati per il codice dell'assistente e come testo
JSON per il modello.
Un risultato di ricerca
{
"query": "\"angular.min.js\"",
"total": 73665,
"page": 1,
"rows": 3,
"returned": 3,
"truncated": false,
"index_complete": true,
"took_ms": 6,
"results": [
{ "domain": "imgbox.com", "url": "https://imgbox.com/", "rank": 4229 },
{ "domain": "uc.edu", "url": "https://www.uc.edu/", "rank": 5861 },
{ "domain": "sharemods.com", "url": "https://sharemods.com/", "rank": 10962 }
]
}
I campi hanno lo stesso significato che hanno nell'API:
truncated- il piano ha accorciato la pagina;index_complete: false- una parte dell'indice non ha risposto in tempo, quinditotalpotrebbe essere più basso del reale;rank: null- il sito non ha una posizione;query_note- compare quando la query è stata interpretata diversamente da come è stata scritta.
Con snippets: true ogni risultato contiene anche
snippets, un elenco di fino a tre stringhe di codice sorgente intorno
alla corrispondenza. Sono codice scritto da altri, trasmesso come dati.
Ottenere più di una pagina
page e rows scorrono i risultati:
page: 2, rows: 20 corrisponde ai risultati da 21 a 40. page
per rows non può superare le righe per query del tuo piano: vedi
Limiti ed errori.
Cluster ed estrazione
Chiedi a parole semplici e l'assistente concatena gli strumenti: «Trova i siti
che usano Hotjar, salvali come cluster e ricava le loro email di contatto»
diventa create_cluster con una query, poi extract_from_cluster
con i modelli predefiniti email e hotjar, una parte dopo
l'altra.
I modelli predefiniti sono espressioni già pronte, scelte per nome: email,
phone, whatsapp, telegram,
skype, facebook, instagram,
twitter, linkedin, gtm,
ga4, ua, hotjar, adsense,
bitcoin. Per tutto il resto serve un'espressione regolare tra barre
(o barre verticali), il cui primo gruppo di cattura è il valore: fino a dieci
espressioni in tutto.
{
"cluster": 7, "name": "\"hotjar.com\"", "size": 100,
"offset": 0, "scanned": 100, "in_index": 100, "with_matches": 87,
"next_offset": null,
"regex": ["/mailto:(...)/i", "/hjid['\"]?\\s*[:=]\\s*([0-9]{4,10})/"],
"points_used": 131.4, "points_left": 0,
"rows": [
{ "domain": "example.com", "values": [["hello@example.com"], ["1234567"]], "matches": 2 }
]
}
next_offset indica dove parte la chiamata successiva; null
significa che l'intero cluster è stato elaborato. Ogni sito trovato nell'indice
costa tanti punti di estrazione quanti sono i valori trovati, 0,1 se non ce ne
sono. Anche un account gratuito può usare i cluster, con i limiti gratuiti del
sito web: fino a 100 domini per cluster e 100 punti di estrazione al giorno. Un
account conserva fino a 100 cluster; oltre questo numero create_cluster
risponde cluster_limit e non elimina nulla. Le stesse operazioni da
codice sono descritte nell'API.