Tekst naar ASCII/Unicode-code-converter
Zet tekst om naar een lijst decimale tekencodes en terug — dekt het volledige Unicode-bereik, niet alleen 7-bit ASCII.
1.083 weergaven
Hoe het werkt
Elk teken dat u typt wordt één voor één doorlopen en omgezet naar het bijbehorende Unicode-codepunt — hetzelfde nummeringssysteem waarvan de eerste 128 waarden, 0 tot en met 127, de oorspronkelijke ASCII-tabel vormen. Binnen dat bereik vormen codes 32-126 het afdrukbare blok: letters, cijfers, leestekens en het spatieteken. Codes 0-31 zijn controletekens, een historische laag die is overgebleven van telexmachines en typemachines die specifieke codes gebruikten om de printkop of het papier te verplaatsen in plaats van een teken af te drukken — code 13 (carriage return) stuurde de kop terug naar het begin van de regel, en code 10 (line feed) verplaatste het papier één regel — een splitsing die de reden is waarom platte-tekstbestanden op verschillende besturingssystemen nog steeds van mening verschillen over hoe een regeleinde wordt opgeslagen.
Voorbeeld: het typen van "Hi!" levert de codelijst 72, 105, 33 op — hoofdletter H is 72, kleine letter i is 105, en het uitroepteken is 33, allemaal binnen het afdrukbare bereik van 32-126. Diezelfde lijst terug in de decoder plakken herbouwt "Hi!" exact, teken voor teken.
Waar deze tool verder gaat dan een schoolboek-ASCII-tabel, is bij codes 128 en hoger. Dat hogere bereik, informeel "extended ASCII" genoemd, is nooit gestandaardiseerd: verschillende leveranciers en regio's bouwden verschillende code pages met 256 waarden, waarbij ze verschillende glyphs toekenden aan dezelfde byte. Een byte die op de ene Turkse code page "ğ" betekende, kon op het codepage van een ander systeem een compleet ander teken betekenen, of helemaal niets afdrukbaars. Die inconsistentie is precies het probleem dat UTF-8 en volledige Unicode-codepunten moesten oplossen: in plaats van één byte per teken met een van de code page afhankelijke betekenis, krijgt elk teken een stabiele numerieke identiteit die overal hetzelfde betekent. Daarom codeert deze converter elk teken als een volledig Unicode-codepunt in plaats van af te kappen tot één byte, zodat Turkse letters zoals ğ, ş, ı, ö, ü, ç en emoji allemaal betrouwbaar worden omgezet.
Wat u moet weten
- Afdrukbaar bereik: codes 32-126 komen op elk systeem altijd overeen met een zichtbaar teken; al het andere heeft context nodig (een lettertype, een code page, of volledige Unicode) om correct te worden geïnterpreteerd.
- Controlecodes hebben geen glyph: het decoderen van een waarde van 0-31 (of 127, DEL) terug naar tekst toont geen afdrukbaar teken — dat is te verwachten, geen fout, want deze codes waren nooit bedoeld om te worden weergegeven.
- Voorbij byte 255: Unicode-codepunten gaan ver voorbij het oude plafond van 256 waarden — emoji bijvoorbeeld leven in de honderdduizenden — en deze tool verwerkt het volledige bereik, niet slechts de waarde van één byte.
- Verliesvrije heen-en-terugreis: coderen en vervolgens decoderen levert altijd exact uw originele tekst weer op, omdat elk codepunt op precies één teken wordt afgebeeld zonder enige benadering of compressie.
- Werkt volledig in uw browser: er wordt nergens tekst naartoe gestuurd, dus het is veilig om gevoelige strings, tokens of wachtwoorden te converteren voor het debuggen.
Veelgestelde vragen
Is dit echt ASCII, of iets meer?
Echte 7-bit ASCII dekt alleen codes 0-127 (Engelse letters, cijfers, basisleestekens). Deze tool gebruikt hetzelfde idee maar breidt het uit naar volledige Unicode-codepunten, zodat letters met accenten (é, ë, ç) en emoji correct worden omgezet in plaats van kapot te gaan.
Welk scheidingsteken gebruikt de codelijst?
Standaard komma's met een spatie erna — maar de decoder accepteert ook codes die enkel door spaties of regeleinden zijn gescheiden.
Wat is het verschil tussen code 10 en code 13?
Beide zijn historische regeleinde-controletekens: code 10 is "line feed" (één regel naar beneden), en code 13 is "carriage return" (naar het begin van de regel). Unix gebruikt alleen LF, klassieke Mac gebruikte alleen CR, en Windows gebruikt beide samen (CRLF) — een splitsing die rechtstreeks teruggaat op fysieke teletype-hardware.
Waarom zien codes boven 127 er anders uit in andere tools?
Omdat dat bereik nooit is gestandaardiseerd. Elke leverancier kende in zijn eigen "extended ASCII" code page eigen glyphs toe aan bytes 128-255, waardoor dezelfde bytewaarde op verschillende systemen tot verschillende tekens kan worden gedecodeerd. Deze tool omzeilt dat volledig door met volledige Unicode te werken in plaats van een vaste tabel met 256 waarden.
Kan dit emoji en andere multi-byte tekens verwerken?
Ja — emoji en veel andere symbolen bevinden zich op codepunten ver boven 255, en deze tool zet elk daarvan om naar de volledige decimale Unicode-waarde (sommige emoji, zoals vlaggen, zijn eigenlijk opgebouwd uit twee codepunten, die de lijst als twee aparte getallen zal tonen).
Vergelijkbare tools
Probleem melden
Tekst naar ASCII/Unicode-code-converter
Reacties
Nog geen reacties — schrijf de eerste!