Extrator de Links (href)
Cole o código-fonte HTML e extraia todos os links — todas as URLs de href, sem duplicatas e listadas uma por linha, prontas para copiar ou baixar.
1.047 visualizações
0 links únicos
Nenhum link encontrado.
Como Funciona
Cole o código-fonte HTML — a saída de "ver código-fonte", o conteúdo de um arquivo .html salvo, ou qualquer trecho copiado — e a ferramenta entrega esse texto ao analisador HTML nativo do navegador, em vez de uma expressão regular escrita à mão. Essa diferença importa mais do que parece. O HTML do mundo real é confuso de maneiras que uma regex simples tem dificuldade em tratar: um atributo pode vir entre aspas duplas, aspas simples ou sem aspas alguma (href=sobre.html é tecnicamente HTML válido), uma tag pode se autofechar ou não, e as tags podem se aninhar em muitos níveis, se estender por várias linhas, ou estar dentro de comentários e blocos <script> que por si só contêm sinais de maior/menor. Um analisador de nível de navegador passou duas décadas absorvendo cada uma dessas exceções, porque precisa renderizar qualquer página que receba, por mais malformada que seja a marcação — construir o extrator sobre esse mesmo motor, em vez de reinventar o casamento de padrões para tags, é o que o torna confiável em marcação que você não escreveu, como uma página raspada de um concorrente ou uma exportação antiga de campanha.
Depois que o analisador constrói uma árvore estrutural a partir da marcação colada, o href de cada elemento <a> é lido diretamente como uma propriedade desse elemento, e não como texto bruto extraído de uma string — o que já evita as peculiaridades de aspas e os sinais de maior/menor perdidos dentro de comentários que poderiam enganar uma correspondência de padrão. A lista de URLs resultante é então filtrada para remover duplicatas e escrita uma por linha, pronta para copiar para a área de transferência ou baixar como arquivo de texto simples.
Exemplo concreto: o HTML de uma página contém <a href='/precos'>, <a href="https://exemplo.com/blog">, e um <a href=mailto:[email protected]> sem aspas nenhuma — três estilos de aspas diferentes em três linhas. Uma regex escrita para casar com href="..." perderia silenciosamente os casos entre aspas simples e sem aspas; o analisador lê os três da mesma forma, porque para um navegador eles são simplesmente valores de atributo, independentemente de como — ou se — estão entre aspas.
O Que Você Deve Saber
- URLs relativas como
/precosou../blog/postsão extraídas exatamente como escritas, sem serem resolvidas para endereçoshttps://...completos. Transformar um caminho relativo em uma URL absoluta exige saber a URL base da página — normalmente o endereço de onde o HTML foi originalmente obtido, ou uma tag<base>explícita — e um trecho colado não carrega nenhum dos dois por conta própria. - A ferramenta nunca busca uma URL por conta própria; ela apenas lê o HTML que você fornece. Esse é um limite deliberado: auditar os links de saída de uma página dessa forma não exige nenhuma requisição do lado do servidor deste site — apenas do navegador que você já usou para visualizar ou salvar o código-fonte.
- Links
mailto:etel:passam exatamente como qualquer outrohref, já que o analisador não discrimina por esquema — tudo que estiver em um atributohrefconta como um link a ser listado.
Perguntas Frequentes
A ferramenta busca a página sozinha, ou eu preciso fornecer o HTML?
Você fornece o HTML — cole a saída de "ver código-fonte", o conteúdo de um arquivo .html salvo ou qualquer trecho de HTML. A ferramenta nunca busca URLs por conta própria (isso exigiria uma requisição ao servidor que este site não faz).
Os links relativos são incluídos, e são convertidos em URLs completas?
Os links relativos (ex.: /sobre ou ../pagina.html) são extraídos exatamente como escritos na fonte, nunca resolvidos para URLs absolutas. Resolvê-los exigiria saber a URL base da página — normalmente o endereço de onde o HTML foi obtido — o que um trecho colado não carrega por conta própria.
Ela também inclui links mailto: e tel:?
Sim — qualquer valor de href é extraído, independentemente do esquema, já que o analisador lê o próprio atributo em vez de filtrar por tipo de link.
Por que analisar com o motor DOM do navegador em vez de uma regex — isso realmente importa?
Importa mais em HTML confuso e real. Uma regex ajustada para um único estilo de aspas (digamos, href="..." entre aspas duplas) vai ignorar silenciosamente atributos entre aspas simples ou sem aspas, variações de autofechamento, e hrefs enterrados em marcação profundamente aninhada ou malformada. O analisador DOM trata tudo isso da mesma forma que um navegador trataria ao renderizar a página, porque é exatamente o mesmo motor por baixo.
Ela ainda captura links em HTML minificado ou muito quebrado?
Em quase todos os casos, sim. Os navegadores são construídos para renderizar páginas que estão longe de ser perfeitamente formadas — tags de fechamento ausentes, aninhamento inconsistente, marcação minificada em uma única linha — e a mesma análise tolerante se aplica aqui, o que é exatamente a vantagem sobre uma regex rígida que espera uma entrada limpa e bem formatada.
Ferramentas Semelhantes
Reportar um Problema
Extrator de Links (href)
Comentários
Ainda não há comentários — seja o primeiro a escrever um!