Conversor de Texto para Binário
Converta texto para binário (bytes UTF-8 de 8 bits) e vice-versa — ambas as caixas são em tempo real e bidirecionais.
1.119 visualizações
Como Funciona
O texto não é convertido em binário caractere por caractere — é convertido byte por byte, depois de primeiro ser codificado como UTF-8. Essa distinção importa porque um único caractere nem sempre ocupa um único byte. Digite um caractere ASCII (as letras simples do inglês, dígitos e pontuação, pontos de código 0-127) e ele cabe em exatamente um byte, então A vira um grupo de 8 bits: 01000001. A maioria dos caracteres não ingleses precisa de mais espaço. O A maiúsculo com cedilha ou acento, como o É (Unicode U+00C9), é codificado em UTF-8 como dois bytes, não um: 11000011 10001001 — dois grupos de 8 bits separados. Um emoji como 😀 (U+1F600) precisa de quatro bytes: 11110000 10011111 10011000 10000000. Esta ferramenta executa exatamente esse fluxo — texto → bytes UTF-8 → um grupo binário de 8 bits por byte, separados por espaço — então uma palavra contendo "É", "ç" ou um emoji produz visivelmente mais grupos do que a suposição ingênua de um-caractere-igual-a-um-byte preveria.
Os bytes extras não são arbitrários; eles seguem um padrão de bits fixo que qualquer decodificador ciente de UTF-8 (incluindo esta ferramenta, ao rodar a conversão ao contrário) consegue reconhecer. O primeiro byte de uma sequência multibyte começa com uma sequência de bits 1 seguida de um 0 que anuncia quantos bytes compõem o caractere — 110xxxxx significa "2 bytes no total", 1110xxxx significa "3 bytes", 11110xxx significa "4 bytes" — enquanto todo byte que vem depois dele, um byte de continuação, sempre começa com o prefixo fixo 10xxxxxx. Lendo 11000011 10001001 para É: o decodificador vê 110 (um byte inicial de 2 bytes) seguido de um byte começando com 10 (exatamente um byte de continuação), confirma que a sequência está completa e reconstrói o único ponto de código Unicode U+00C9 a partir dos bits restantes de ambos os bytes combinados. É também por isso que um byte perdido ou corrompido no meio de um caractere multibyte quebra a decodificação — o prefixo do byte de continuação precisa se alinhar, ou o caractere não pode ser remontado.
O Que Você Deve Saber
Converter binário de volta em texto reverte o mesmo fluxo: os grupos de 8 bits são lidos em ordem, reagrupados em sequências completas de bytes UTF-8 verificando o prefixo de cada byte inicial para saber quantos bytes de continuação pertencem a ele, e então decodificados de volta em caracteres — então uma string binária corretamente gerada sempre retorna exatamente ao texto original, incluindo caracteres acentuados e emojis, não uma aproximação dele. Isso só funciona porque o binário aqui é especificamente UTF-8: binário produzido por uma codificação diferente (UTF-16, ou uma codificação de byte único como ISO-8859-1) usa contagens de bytes e padrões de bits diferentes para os mesmos caracteres, e colar esse binário aqui vai decodificar para o texto errado ou falhar completamente — não é uma ferramenta universal de binário para texto, é uma ferramenta UTF-8. Como toda a conversão roda no lado do cliente, no navegador, nenhum texto ou binário que você digitar é enviado para lugar nenhum.
Perguntas Frequentes
Por que um caractere às vezes gera mais de 8 bits?
O texto é codificado primeiro como UTF-8. Caracteres ASCII ocupam 1 byte (8 bits), mas letras acentuadas, cedilha e emojis podem ocupar de 2 a 4 bytes — cada byte aparece como seu próprio grupo de 8 bits, então um único caractere pode legitimamente se expandir para 16, 24 ou 32 bits.
Por que letras acentuadas como É, ç e ã precisam de dois grupos binários em vez de um?
Elas ficam fora do intervalo ASCII 0-127, então o UTF-8 as codifica como sequências de 2 bytes: um byte inicial começando com 110xxxxx seguido de um byte de continuação começando com 10xxxxxx. É, por exemplo, é 11000011 10001001 — dois grupos representando um caractere.
Posso converter emojis, e quantos bits eles precisam?
Sim. A maioria dos emojis está posicionada alto o suficiente no Unicode para precisar da forma UTF-8 completa de 4 bytes: um byte inicial começando com 11110xxx seguido de três bytes de continuação começando com 10xxxxxx cada — 32 bits no total para um único caractere emoji.
E se minha entrada binária tiver grupos inválidos?
Os grupos devem ter exatamente 8 caracteres de 0 e 1, separados por espaços. Grupos inválidos ou incompletos — e bytes de continuação que não se alinham com um byte inicial válido — são ignorados em vez de travar a conversão.
Isso funciona com codificações diferentes de UTF-8?
Não, e nem deveria alegar isso. UTF-16 e codificações legadas de byte único (como ISO-8859-1) atribuem contagens de bytes e padrões de bits diferentes aos mesmos caracteres. Binário dessas codificações não será decodificado corretamente aqui — esta ferramenta é especificamente um conversor de texto para binário em UTF-8.
Ferramentas Semelhantes
Reportar um Problema
Conversor de Texto para Binário
Comentários
Ainda não há comentários — seja o primeiro a escrever um!