$ check_utf8 --validate --extract-payload
Informationsmanagement • NLP & Zeichensätze • UTF-8 Engine

UTF-8 Bitfolgen-Checker & Validierungs-Labor

Schritt-für-Schritt Prüfung von Bitfolgen auf UTF-8 Konformität: Header-Analyse (1–4 Bytes), Folge-Byte Validierung (`10...`), Nutzbit-Extraktion, Erkennung von Overlong Encodings, Surrogates und Klausur-Trainer.

⌨️ Bitfolge eingeben

Binär (0 & 1), Hexadezimal oder Zeichen

16 Bits (2 Bytes)

Klausur-Presets & Testfälle

Gültige UTF-8 Sequenzen:
Typische Klausurfallen:

🔍 Schritt-für-Schritt Analyse

Exakte Prüfung nach Informationsmanagement-Schema

Gültig
1 Schritt 1: Aufteilung in 8-Bit Blöcke (Bytes)
2 Schritt 2: Start-Byte & Erwartete Sequenzlänge
3 Schritt 3: Folge-Bytes Präfix-Prüfung (`10...`)
4 Schritt 4: Nutzbits extrahieren & Codepoint berechnen
5 Schritt 5: Overlong-Encoding & Bereichsprüfung

UTF-8 Spezifikationstabelle (Spickzettel)

Länge Byte 1 (Start) Byte 2 Byte 3 Byte 4 Codepoint-Bereich
1 Byte 0xxxxxxx - - - U+0000 – U+007F (0–127)
2 Bytes 110xxxxx 10xxxxxx - - U+0080 – U+07FF
3 Bytes 1110xxxx 10xxxxxx 10xxxxxx - U+0800 – U+FFFF
4 Bytes 11110xxx 10xxxxxx 10xxxxxx 10xxxxxx U+10000 – U+10FFFF