Im Inneren jedes Systems wird Text nicht als Buchstaben gespeichert, sondern jeder Buchstabe ist eine Zahl. Der Text/Binär-Konverter macht genau das sichtbar: Geben Sie beliebigen Text ein, und er liefert die exakten Gruppen aus 0 und 1, mit denen der Computer arbeitet, und wandelt diese Gruppen wieder in lesbaren Text zurück. Dieser Guide führt mit echten Beispielen durch die Umwandlung, zeigt, wie man die Ausgabe Bit für Bit liest, erklärt, warum manche Zeichen mehr als 8 Bits benötigen, und vergleicht Binär mit den verwandten Kodierungen aus derselben Werkzeugfamilie.
Der Weg durch den Artikel: der Mechanismus vom Codepoint zur 8 Bit Gruppe mit A, H und i als durchgehendes Beispiel, 01001000 01101001 zurück in Hi lesen, warum das Smiley Emoji 17 Bits statt 8 braucht, die Rückrichtung und ihr einziger Fehlerfall, und wo Binär neben Morse, Base64, URL-Encoding und String-Escaping steht.
Wie Text zu Binär wird: Codepoints und 8 Bit Gruppen
Jedes Zeichen entspricht einem Codepoint, einer einzigen Ganzzahl, die Unicode zuordnet. Der Konverter schreibt diese Ganzzahl in Basis 2 und füllt das Ergebnis mit führenden Nullen auf 8 Bits auf. Der Buchstabe A hat den Codepoint 65 und wird zu 01000001. H ist 72 und wird zu 01001000, während i 105 ist und zu 01101001 wird, sodass Hi zu 01001000 01101001 mit einem Leerzeichen zwischen den beiden Gruppen wird. Das Leerzeichen selbst hat den Code 32 und wird zu 00100000, dadurch bleiben Originaltext und binäre Form Zeichen für Zeichen ausgerichtet. Da jedes Zeichen seine eigene Gruppe erzeugt, kann man die Ausgabe auch als Liste von Zahlen in Basis 2 lesen; wenn man häufig mit anderen Basen arbeitet, wendet der Zahlensystem-Umrechner dieselbe Idee auf Oktal, Hexadezimal und jede Basis von 2 bis 36 an.
Die Ausgabe Bit für Bit Lesen
Um das Ergebnis zurückzulesen, teilen Sie die Zeichenkette an Leerzeichen auf und rechnen Sie jede 8 Bit Gruppe in ihre Zahl um. 01000001 ist 65, 01001000 ist 72 und 01101001 ist 105, und der Blick in die Codetabelle ergibt A, H und i, oder Hi, wenn das erste Zeichen weggelassen wird. Bei längerem Text passiert hier der Fehler am häufigsten, also zählen Sie zuerst die Gruppen: Die Gruppenganzahl muss mit der Zeichenzahl der Eingabe übereinstimmen, Leerzeichen inklusive. Der Zeichenzähler und -Analyseur liefert genau diese Zählung inklusive Leerzeichen und dient als schnelle Gegenprüfung, bevor man von Hand zu decodieren beginnt.
Unicode Codepoints, die Mehr als 8 Bits Brauchen
Das Auffüllen auf 8 Bits deckt den klassischen Bereich von 0 bis 255 ab, aber Unicode ist viel größer. Das Smiley Emoji hat den Codepoint 128512, und seine binäre Form ist 11111011000000000, eine 17 Bit Kette, die kein einziges Byte fassen kann. Der Konverter kürzt sie nicht ab und wickelt sie nicht um; die Gruppe wird einfach so lang, wie der Codepoint es verlangt, und die Rückrichtung liest sie auf dieselbe Weise. Wenn der Text normales ASCII mit Emoji oder CJK Zeichen mischt, sieht man eine Mischung aus 8 Bit Gruppen und längeren Gruppen. Wenn man die Ansicht auf Byte Ebene statt auf Codepoint Ebene braucht, zeigt der Hex UTF-8 Base64 Umrechner exakt, wie jedes Zeichen als UTF-8 Bytes gespeichert wird, die Schicht, die die meisten Protokolle tatsächlich übertragen.
Binär Zurück in Text Umwandeln
Wechseln Sie das Werkzeug auf Binär zu Text und fügen Sie die Gruppen ein. Der Konverter teilt an Leerzeichen auf, liest jede Gruppe als Zahl in Basis 2 und ordnet ihr ein Zeichen zu, sodass 01001000 01101001 wieder Hi ergibt. Einfügen über mehrere Zeilen funktioniert ebenfalls, denn jede Folge aus Leerzeichen oder Zeilenumbrüchen zählt als Trenner. Der Fehlerfall ist einfach: Eine Gruppe, die weder mit 0 noch mit 1 beginnt, lässt sich nicht als Binär lesen, und das Werkzeug stoppt mit einem Fehler für ungültiges Binär, statt zu raten. Das verhindert, dass ein Tippfehler mitten in einem langen Einfügen alle folgenden Zeichen still verschiebt.
Wo Binär Sich in der Familie der Kodierungen Einordnet
Binär ist die direkteste Kodierung der Familie: Die Zahlen sind die Daten. Andere Kodierungen hüllen dieselben Informationen in andere Alphabete. Der Morse-Code-Kodierer/Dekodierer bildet Buchstaben auf Punkte und Striche ab, gut für den Demonstrationswert jedes Zeichens, verliert aber auf andere Weise Information, weil Groß und Kleinschreibung sowie die meisten Satzzeichen fallen. Der Base64-Encoder/-Decoder packt drei Bytes in vier Buchstaben, sodass das Ergebnis E-Mails und JSON sicher durchläuft, aber es entspricht nicht mehr Zeichen für Zeichen dem Original. Der URL-Encoder/Decoder schreibt nur die Bytes um, die eine URL nicht transportieren kann, wie Leerzeichen und Symbole, und lässt den Rest unangetastet. Und String Maskieren/Entmaskieren wendet sich an Text in Code und wandelt Anführungszeichen und Rückschrägstriche in Sequenzen um, die in einem Kontext mit Anführungszeichen überleben. Zu wissen, welche passt, ist oft das eigentliche Problem, das die binäre Ausgabe hilft zu lösen.
Häufige Fehler und Wie man Sie Vermeidet
Drei Fehler erklären fast alle Fehlschläge beim Decodieren. Erstens, die Ausgabe als eine lange Zahl zu behandeln statt als Liste von Gruppen: 01000001 01001000 sind zwei Zeichen, kein 16 Bit Wert. Zweitens, die führenden Nullen beim manuellen Editieren wegzulassen, was den Wert und damit das decodierte Zeichen mitverschiebt. Drittens, vorauszusetzen, dass jede Gruppe 8 Bits hat; Emoji und andere Codepoints über 255 erzeugen längere Gruppen, und der Decoder erwartet exakt das, was der Encoder geschrieben hat. Behalten Sie die Leerzeichen, die Nullen und die Gruppengrenzen bei, und die Umwandlung läuft in beide Richtungen sauber hin und zurück.