Text-Binär-Konverter

Text in Binärcode (8-Bit-UTF-8-Bytes) umwandeln und zurück — beide Felder sind live und bidirektional.

1.139 Aufrufe

So funktioniert es

Text wird nicht Zeichen für Zeichen in Binär umgewandelt, sondern Byte für Byte, nachdem er zuerst als UTF-8 kodiert wurde. Dieser Unterschied ist wichtig, denn ein einzelnes Zeichen belegt nicht immer nur ein Byte. Geben Sie ein ASCII-Zeichen ein (die einfachen englischen Buchstaben, Ziffern und Satzzeichen, Codepunkte 0-127), passt es genau in ein Byte, sodass A zu einer einzigen 8-Bit-Gruppe wird: 01000001. Die meisten Nicht-ASCII-Zeichen brauchen mehr Platz. Das türkische Großbuchstabe-mit-Punkt İ (Unicode U+0130) wird in UTF-8 nicht als ein, sondern als zwei Bytes kodiert: 11000100 10110000 — zwei getrennte 8-Bit-Gruppen. Ein Emoji wie 😀 (U+1F600) benötigt vier Bytes: 11110000 10011111 10011000 10000000. Dieses Tool führt genau diese Pipeline aus — Text → UTF-8-Bytes → eine 8-Bit-Binärgruppe pro Byte, durch Leerzeichen getrennt — sodass ein Wort mit „İ“, „ü“ oder einem Emoji sichtbar mehr Gruppen erzeugt, als die naive Annahme „ein Zeichen gleich ein Byte" vorhersagen würde.

Die zusätzlichen Bytes sind nicht willkürlich; sie folgen einem festen Bitmuster, das jeder UTF-8-fähige Dekoder (einschließlich dieses Tools, wenn es die Umwandlung rückwärts durchführt) erkennen kann. Das erste Byte einer mehrbytigen Sequenz beginnt mit einer Folge von 1-Bits, gefolgt von einer 0, die ankündigt, aus wie vielen Bytes das Zeichen besteht — 110xxxxx bedeutet „insgesamt 2 Bytes", 1110xxxx bedeutet „3 Bytes", 11110xxx bedeutet „4 Bytes" — während jedes darauffolgende Byte, ein Fortsetzungsbyte, immer mit dem festen Präfix 10xxxxxx beginnt. Beim Lesen von 11000100 10110000 für İ: Der Dekoder erkennt 110 (ein 2-Byte-Startbyte), gefolgt von einem Byte, das mit 10 beginnt (genau ein Fortsetzungsbyte), bestätigt, dass die Sequenz vollständig ist, und rekonstruiert aus den restlichen Bits beider Bytes den einzelnen Unicode-Codepunkt U+0130. Das erklärt auch, warum ein fehlerhaftes oder beschädigtes Byte mitten in einem mehrbytigen Zeichen die Dekodierung zerstört — das Fortsetzungsbyte-Präfix muss passen, sonst kann das Zeichen nicht wieder zusammengesetzt werden.

Was Sie wissen sollten

Die Rückumwandlung von Binär zu Text kehrt dieselbe Pipeline um: 8-Bit-Gruppen werden der Reihe nach gelesen, anhand des Präfixes jedes Startbytes wird ermittelt, wie viele Fortsetzungsbytes dazugehören, sie werden zu vollständigen UTF-8-Byte-Sequenzen neu gruppiert und dann in Zeichen zurückverwandelt — eine korrekt erzeugte Binärfolge ergibt also immer exakt den ursprünglichen Text, türkische Zeichen und Emojis eingeschlossen, keine Annäherung daran. Das funktioniert nur, weil das Binär hier speziell UTF-8 ist: Binär, das mit einer anderen Kodierung erzeugt wurde (UTF-16 oder eine Einzelbyte-Kodierung wie ISO-8859-9/Windows-1254), verwendet andere Bytezahlen und Bitmuster für dieselben Zeichen, und wenn Sie es hier einfügen, wird es zu falschem Text dekodiert oder schlägt ganz fehl — dies ist kein universelles Binär-Text-Tool, sondern ein UTF-8-spezifisches. Da die gesamte Umwandlung clientseitig im Browser läuft, wird kein von Ihnen eingegebener Text oder Binärcode jemals irgendwohin gesendet.

Häufig gestellte Fragen

Warum erzeugt ein Zeichen manchmal mehr als 8 Bit?

Der Text wird zuerst als UTF-8 kodiert. ASCII-Zeichen benötigen 1 Byte (8 Bit), aber Buchstaben mit Akzenten, türkische Zeichen und Emojis können 2-4 Bytes benötigen — jedes Byte erscheint als eigene 8-Bit-Gruppe, sodass ein einzelnes Zeichen sich legitim auf 16, 24 oder 32 Bit ausdehnen kann.

Warum brauchen türkische Zeichen wie İ, ğ und ş zwei Binärgruppen statt einer?

Sie liegen außerhalb des ASCII-Bereichs 0-127, daher kodiert UTF-8 sie als 2-Byte-Sequenzen: ein Startbyte, das mit 110xxxxx beginnt, gefolgt von einem Fortsetzungsbyte, das mit 10xxxxxx beginnt. İ etwa ist 11000100 10110000 — zwei Gruppen, die ein Zeichen darstellen.

Kann ich Emojis umwandeln, und wie viele Bits benötigen sie?

Ja. Die meisten Emojis liegen im Unicode-Bereich hoch genug, um die volle 4-Byte-UTF-8-Form zu benötigen: ein Startbyte, das mit 11110xxx beginnt, gefolgt von drei Fortsetzungsbytes, die jeweils mit 10xxxxxx beginnen — insgesamt 32 Bit für ein einzelnes Emoji-Zeichen.

Was passiert, wenn meine Binäreingabe ungültige Gruppen enthält?

Gruppen müssen aus genau 8 Zeichen aus 0 und 1 bestehen, durch Leerzeichen getrennt. Ungültige oder unvollständige Gruppen — und Fortsetzungsbytes, die nicht zu einem gültigen Startbyte passen — werden übersprungen, statt die Umwandlung abzubrechen.

Funktioniert das Tool auch mit anderen Kodierungen als UTF-8?

Nein, und das sollte es auch nicht behaupten. UTF-16 und ältere Einzelbyte-Kodierungen (wie ISO-8859-9 für Türkisch) weisen denselben Zeichen unterschiedliche Bytezahlen und Bitmuster zu. Binärcode aus diesen Kodierungen wird hier nicht korrekt dekodiert — dieses Tool ist speziell ein UTF-8-Text-Binär-Konverter.

Kommentare

Noch keine Kommentare — schreiben Sie den ersten!

Ähnliche Tools