Conversor de Texto a Binario

Convierte texto a binario (bytes UTF-8 de 8 bits) y viceversa — ambos cuadros son en vivo y bidireccionales.

1.138 visitas

Cómo Funciona

El texto no se convierte a binario carácter por carácter, sino byte por byte, después de codificarse primero como UTF-8. Esa distinción importa porque un solo carácter no siempre ocupa un solo byte. Si escribes un carácter ASCII (las letras, dígitos y signos de puntuación normales del inglés, puntos de código 0-127), este cabe exactamente en un byte, así que A se convierte en un único grupo de 8 bits: 01000001. La mayoría de los caracteres no ingleses necesitan más espacio. La É mayúscula (Unicode U+00C9), por ejemplo, se codifica en UTF-8 como dos bytes, no uno: 11000011 10001001 — dos grupos de 8 bits independientes. Un emoji como 😀 (U+1F600) necesita cuatro bytes: 11110000 10011111 10011000 10000000. Esta herramienta ejecuta exactamente ese proceso — texto → bytes UTF-8 → un grupo binario de 8 bits por byte, separados por espacios — así que una palabra que contenga "É", "ñ" o un emoji produce visiblemente más grupos de los que predeciría la suposición ingenua de "un carácter, un byte".

Los bytes adicionales no son arbitrarios; siguen un patrón de bits fijo que cualquier descodificador consciente de UTF-8 (incluida esta herramienta, cuando ejecuta la conversión a la inversa) puede reconocer. El primer byte de una secuencia multibyte empieza con una serie de bits en 1 seguida de un 0 que anuncia cuántos bytes forman el carácter — 110xxxxx significa "2 bytes en total", 1110xxxx significa "3 bytes", 11110xxx significa "4 bytes" — mientras que cada byte que le sigue, un byte de continuación, siempre empieza con el prefijo fijo 10xxxxxx. Al leer 11000011 10001001 para É: el descodificador ve 110 (un byte inicial de 2 bytes) seguido de un byte que empieza con 10 (exactamente un byte de continuación), confirma que la secuencia está completa y reconstruye el único punto de código Unicode U+00C9 a partir de los bits restantes de ambos bytes combinados. Por eso también un byte suelto o corrupto en medio de un carácter multibyte rompe la descodificación — el prefijo del byte de continuación tiene que coincidir, o el carácter no puede reconstruirse.

Lo Que Deberías Saber

Convertir el binario de vuelta a texto invierte el mismo proceso: los grupos de 8 bits se leen en orden, se reagrupan en secuencias completas de bytes UTF-8 comprobando el prefijo de cada byte inicial para saber cuántos bytes de continuación le pertenecen, y luego se descodifican de nuevo en caracteres — así que una cadena binaria correctamente generada siempre vuelve al texto original exacto, con caracteres acentuados y emoji incluidos, no una aproximación. Esto solo funciona porque el binario aquí es específicamente UTF-8: el binario producido por otra codificación (UTF-16, o una codificación de un solo byte como ISO-8859-1/Windows-1252) usa cantidades de bytes y patrones de bits distintos para los mismos caracteres, y pegarlo aquí se descodificará como texto incorrecto o fallará directamente — no es una herramienta universal de binario a texto, es una herramienta específicamente de UTF-8. Como toda la conversión se ejecuta del lado del cliente en el navegador, ningún texto ni binario que escribas se envía jamás a ningún sitio.

Preguntas Frecuentes

¿Por qué un carácter a veces produce más de 8 bits?

El texto se codifica primero como UTF-8. Los caracteres ASCII ocupan 1 byte (8 bits), pero las letras acentuadas y los emoji pueden ocupar de 2 a 4 bytes — cada byte se muestra como su propio grupo de 8 bits, así que un solo carácter puede legítimamente expandirse a 16, 24 o 32 bits.

¿Por qué letras acentuadas como É, Ñ o Ü necesitan dos grupos binarios en lugar de uno?

Quedan fuera del rango ASCII 0-127, así que UTF-8 las codifica como secuencias de 2 bytes: un byte inicial que empieza con 110xxxxx seguido de un byte de continuación que empieza con 10xxxxxx. É, por ejemplo, es 11000011 10001001 — dos grupos que representan un solo carácter.

¿Puedo convertir emoji, y cuántos bits necesitan?

Sí. La mayoría de los emoji están lo bastante altos en Unicode como para necesitar la forma UTF-8 completa de 4 bytes: un byte inicial que empieza con 11110xxx seguido de tres bytes de continuación que empiezan cada uno con 10xxxxxx — 32 bits en total para un solo carácter emoji.

¿Qué pasa si mi entrada binaria tiene grupos inválidos?

Los grupos deben tener exactamente 8 caracteres de 0 y 1, separados por espacios. Los grupos inválidos o incompletos — y los bytes de continuación que no coinciden con un byte inicial válido — se omiten en lugar de interrumpir la conversión.

¿Esta herramienta funciona con codificaciones distintas de UTF-8?

No, y no debería pretenderlo. UTF-16 y las codificaciones heredadas de un solo byte (como ISO-8859-1 o Windows-1252) asignan cantidades de bytes y patrones de bits distintos a los mismos caracteres. El binario de esas codificaciones no se descodificará correctamente aquí — esta herramienta es específicamente un conversor de texto a binario en UTF-8.

Comentarios

Aún no hay comentarios — ¡sé el primero en escribir uno!

Herramientas Similares