Estrattore di Link (href)
Incolla il codice sorgente HTML ed estrai ogni link — tutti gli URL href, deduplicati ed elencati uno per riga, pronti da copiare o scaricare.
1.058 visualizzazioni
0 link univoci
Nessun link trovato.
Come Funziona
Incolla il codice sorgente HTML — l'output di "visualizza sorgente", un file .html salvato o qualsiasi snippet copiato — e lo strumento affida quel testo al motore di analisi HTML del browser stesso, non a un'espressione regolare scritta a mano. Questa distinzione conta più di quanto sembri. L'HTML del mondo reale è disordinato in modi con cui una regex ingenua fatica: un attributo può essere racchiuso tra doppi apici, apici singoli o senza alcun apice (href=chi-siamo.html è tecnicamente HTML valido), un tag può essere autochiudente o meno, e i tag possono annidarsi su molti livelli, estendersi su più righe, o trovarsi dentro commenti e blocchi <script> che a loro volta contengono parentesi angolari. Un motore di analisi di livello browser ha passato due decenni ad assorbire ognuno di questi casi limite, perché deve renderizzare qualunque pagina gli venga passata per quanto malformato sia il markup — costruire l'estrattore su questo stesso motore, invece di reinventare il pattern matching per i tag, è ciò che lo rende affidabile su markup che non hai scritto tu, come una pagina concorrente estratta o un vecchio export di campagna.
Una volta che l'analizzatore ha costruito un albero strutturale dal markup incollato, l'href di ogni elemento <a> viene letto direttamente come proprietà di quell'elemento anziché come testo grezzo estratto da una stringa — il che elimina alla radice le stranezze di quotatura e le parentesi angolari vaganti dentro i commenti che potrebbero altrimenti ingannare un pattern matching. L'elenco di URL risultante viene poi deduplicato e scritto uno per riga, pronto da copiare negli appunti o scaricare come file di testo semplice.
Esempio concreto: l'HTML di una pagina contiene <a href='/prezzi'>, <a href="https://esempio.com/blog"> e un nudo <a href=mailto:[email protected]> senza alcun apice — tre stili di quotatura diversi in tre righe. Una regex scritta per riconoscere href="..." ignorerebbe silenziosamente i casi con apice singolo e senza apici; l'analizzatore li legge tutti e tre allo stesso modo, perché per un browser sono semplicemente valori di attributo, indipendentemente da come — o se — sono quotati.
Cosa Dovresti Sapere
- Gli URL relativi come
/prezzio../blog/articolovengono estratti esattamente come scritti, non risolti in indirizzihttps://...completi. Trasformare un percorso relativo in un URL assoluto richiede di conoscere l'URL di base della pagina — di norma l'indirizzo da cui l'HTML è stato originariamente recuperato, o un tag<base>esplicito — e uno snippet incollato non porta con sé nessuno dei due. - Lo strumento non recupera mai da solo un URL; legge soltanto l'HTML che fornisci tu. È un confine deliberato: verificare i link in uscita di una pagina in questo modo non richiede alcuna richiesta lato server da questo sito, solo dal browser che hai già usato per visualizzare o salvare il sorgente.
- I link
mailto:etel:vengono estratti esattamente come qualsiasi altrohref, poiché l'analizzatore non fa distinzioni in base allo schema — tutto ciò che si trova in un attributohrefconta come link da elencare.
Domande Frequenti
Recupera la pagina da solo, o devo fornire l'HTML?
Fornisci tu l'HTML — incolla l'output di "visualizza sorgente", il contenuto di un file .html salvato o qualsiasi frammento HTML. Lo strumento non recupera mai da solo alcun URL (servirebbe una richiesta al server che questo sito non effettua).
I link relativi sono inclusi?
Sì, esattamente come scritti nella sorgente (es. /chi-siamo o ../pagina.html) — non vengono risolti in URL assoluti, perché ciò richiederebbe di conoscere l'URL di base della pagina.
Include anche i link mailto: e tel:?
Sì — qualunque valore href viene estratto, a prescindere dallo schema.
Perché analizza con il motore DOM del browser invece di una regex — fa davvero differenza?
Fa la differenza soprattutto su HTML disordinato e reale. Una regex calibrata per uno stile di quotatura (diciamo, href="..." tra doppi apici) ignorerà silenziosamente attributi con apice singolo o senza apici, varianti autochiudenti e href sepolti in markup profondamente annidato o malformato. L'analizzatore DOM gestisce tutto questo esattamente come farebbe un browser nel renderizzare la pagina, perché è lo stesso motore sottostante.
Riesce comunque a individuare i link in HTML minificato o gravemente rotto?
Quasi sempre sì. I browser sono costruiti per renderizzare pagine tutt'altro che perfettamente formate — tag di chiusura mancanti, annidamento incoerente, markup minificato su una sola riga — e qui si applica la stessa analisi tollerante, che è esattamente il vantaggio rispetto a una regex rigida che si aspetta un input pulito e ben formattato.
Strumenti Simili
Segnala un Problema
Estrattore di Link (href)
Commenti
Ancora nessun commento — scrivi il primo!