Extractor de Enlaces (href)
Pega el código fuente HTML y extrae todos los enlaces — todas las URL de href, sin duplicados y listadas una por línea, listas para copiar o descargar.
1.046 visitas
0 enlaces únicos
No se encontraron enlaces.
Cómo Funciona
Pega el código fuente HTML — el resultado de "ver código fuente", el contenido de un archivo .html guardado o cualquier fragmento copiado — y la herramienta entrega ese texto al propio analizador HTML del navegador en lugar de a una expresión regular escrita a mano. Esa diferencia importa más de lo que parece. El HTML del mundo real es desordenado de formas con las que un regex ingenuo tiene dificultades: un atributo puede ir entre comillas dobles, comillas simples o sin comillas en absoluto (href=about.html es HTML técnicamente válido), una etiqueta puede autocerrarse o no, y las etiquetas pueden anidarse muchos niveles, ocupar varias líneas o aparecer dentro de comentarios y bloques <script> que a su vez contienen corchetes angulares. Un analizador de nivel navegador lleva dos décadas absorbiendo cada uno de estos casos límite, porque tiene que renderizar cualquier página que reciba sin importar lo mal formado que esté el marcado — construir el extractor sobre ese mismo motor, en lugar de reinventar el reconocimiento de patrones para etiquetas, es lo que lo hace fiable con marcado que tú no escribiste, como una página de la competencia extraída o una exportación de una campaña antigua.
Una vez que el analizador ha construido un árbol estructural a partir del marcado pegado, el href de cada elemento <a> se lee directamente como una propiedad de ese elemento en lugar de como texto sin procesar extraído de una cadena — lo que ya evita rarezas de comillas y corchetes angulares sueltos dentro de comentarios que podrían engañar a una coincidencia de patrones. La lista de URL resultante se deduplica y se escribe una por línea, lista para copiar al portapapeles o descargar como archivo de texto plano.
Ejemplo concreto: el HTML de una página contiene <a href='/precios'>, <a href="https://ejemplo.com/blog"> y un <a href=mailto:[email protected]> sin comillas en absoluto — tres estilos de comillas distintos en tres líneas. Un regex escrito para coincidir con href="..." pasaría por alto en silencio los casos con comillas simples y sin comillas; el analizador lee los tres de forma idéntica, porque para un navegador son simplemente valores de atributo, sin importar cómo — o si — están entre comillas.
Lo Que Deberías Saber
- Las URL relativas como
/precioso../blog/entradase extraen exactamente como están escritas, sin resolverse a direccioneshttps://...completas. Convertir una ruta relativa en una URL absoluta requiere conocer la URL base de la página — normalmente la dirección desde la que se obtuvo originalmente el HTML, o una etiqueta<base>explícita — y un fragmento pegado no lleva ninguna de las dos por sí solo. - La herramienta nunca obtiene una URL por sí misma; solo lee el HTML que tú le proporcionas. Es un límite deliberado: auditar los enlaces salientes de una página de esta forma no necesita ninguna petición del lado del servidor de este sitio, solo del navegador que ya usaste para ver o guardar el código fuente.
- Los enlaces
mailto:ytel:pasan igual que cualquier otrohref, ya que el analizador no discrimina por esquema — cualquier cosa que esté en un atributohrefcuenta como un enlace que vale la pena listar.
Preguntas Frecuentes
¿La herramienta obtiene la página por sí misma, o necesito darle el HTML?
Tú proporcionas el HTML — pega el resultado de "ver código fuente", el contenido de un archivo .html guardado o cualquier fragmento HTML. La herramienta nunca obtiene URLs por sí sola (eso requeriría una petición al servidor que este sitio no hace).
¿Se incluyen los enlaces relativos, y se convierten en URLs completas?
Los enlaces relativos (p. ej. /nosotros o ../pagina.html) se extraen exactamente como están escritos en el origen, nunca se resuelven a URLs absolutas. Resolverlos requeriría conocer la URL base de la página — normalmente la dirección desde la que se obtuvo el HTML — y un fragmento pegado no la lleva por sí solo.
¿Incluye también enlaces mailto: y tel:?
Sí — se extrae cualquier valor href sin importar el esquema, ya que el analizador lee el atributo en sí en lugar de filtrar por tipo de enlace.
¿Por qué analiza con el motor DOM del navegador en lugar de un regex — realmente importa?
Importa sobre todo en HTML desordenado del mundo real. Un regex ajustado a un único estilo de comillas (digamos, href="..." con comillas dobles) pasará por alto en silencio los atributos con comillas simples o sin comillas, las variantes de autocierre y los href enterrados en marcado profundamente anidado o mal formado. El analizador DOM gestiona todo eso igual que lo haría un navegador al renderizar la página, porque es el mismo motor subyacente.
¿Sigue detectando enlaces en HTML minificado o muy roto?
Prácticamente siempre, sí. Los navegadores están construidos para renderizar páginas que distan mucho de estar perfectamente formadas — etiquetas de cierre faltantes, anidación inconsistente, marcado minificado en una sola línea — y aquí se aplica ese mismo análisis tolerante, que es precisamente la ventaja frente a un regex estricto que espera una entrada limpia y bien formateada.
Herramientas Similares
Reportar un Problema
Extractor de Enlaces (href)
Comentarios
Aún no hay comentarios — ¡sé el primero en escribir uno!