TanodTools
DE

Detektor für unsichtbare Zeichen und Decoder für ASCII smuggling

Fügen Sie einen Text ein, um die Zeichen zu finden, die Sie nicht sehen, und um Text zu lesen, der in unsichtbaren Unicode-Tag-Zeichen versteckt ist: Leerzeichen mit Breite null, Steuerzeichen für die Textrichtung, versteckte Unicode-Tag-Zeichen und Wörter, die lateinische Buchstaben mit zum Verwechseln ähnlichen kyrillischen oder griechischen mischen.

Läuft in Ihrem Browser; nichts, was Sie eingeben, verlässt Ihr Gerät

Fügen Sie einen Text zur Prüfung ein.

Zeichen mit Breite null
0
Steuerzeichen für die Textrichtung
0
Unicode-Tag-Zeichen
0
Steuerzeichen
0
Sonstige unsichtbare Zeichen
0
Ungewöhnliche Leerzeichen
0
Wörter mit gemischten Schriften
0

Text bis zu einigen Millionen Zeichen. Die Prüfung betrachtet Unicode-Codepunkte: Sie findet versteckte Zeichen, kann aber nicht erkennen, ob ein bestimmtes davon in Ihrem Text harmlos ist. Echte Emoji-Sequenzen, etwa Flaggen und Familien-Emoji, werden nicht gemeldet.

So finden Sie unsichtbare Zeichen

  1. Fügen Sie den zu prüfenden Text ein oder wählen Sie Beispiel laden, um zu sehen, was das Tool findet.
  2. Lesen Sie die Anzahl je Zeichenart, den markierten Text und die Tabelle mit Zeile, Spalte und Codepunkt jedes Fundes.
  3. Wählen Sie Bereinigten Text kopieren, um den Text ohne die unsichtbaren Zeichen zu erhalten.

So werden versteckte Zeichen gefunden

Unicode definiert viele Zeichen, die nichts drucken: Leerzeichen und Verbinder mit Breite null, Marken, die die Textrichtung umkehren, weiche Trennstriche, Leerzeichen ungewöhnlicher Breite und die Tag-Zeichen, die ASCII spiegeln. An der richtigen Stelle sind sie nützlich, an der falschen ein Ärgernis oder eine Waffe. Dieses Tool liest Ihren Text Codepunkt für Codepunkt und ordnet jeden Fund einer Art zu, damit Sie sehen, was vorhanden ist, bevor Sie entscheiden, was zu tun ist.

Es werden sieben Arten gemeldet. Zu den Zeichen mit Breite null gehören das Leerzeichen mit Breite null, die Verbinder und die Bytereihenfolge-Marke. Steuerzeichen für die Textrichtung sind die Einbettungen, Überschreibungen, Isolierungen und Marken, die bei Trojan-Source-Angriffen auf Quellcode eingesetzt werden. Unicode-Tag-Zeichen sind der Block U+E0000, mit dem unsichtbare Anweisungen in Texte für KI-Assistenten geschmuggelt werden; jede Folge wird decodiert, sodass Sie den ASCII-Text lesen können, den sie buchstabiert. Steuerzeichen sind die C0- und C1-Codes außer Tabulator und Zeilenumbrüchen. Sonstige unsichtbare Zeichen umfassen den weichen Trennstrich, unsichtbare mathematische Operatoren, Füllzeichen und Variationsselektoren, und ungewöhnliche Leerzeichen sind das geschützte Leerzeichen, das Geviert- und das Halbgeviertleerzeichen sowie das ideographische Leerzeichen. Schließlich sind Wörter mit gemischten Schriften Wörter, die lateinische Buchstaben mit kyrillischen, griechischen oder armenischen kombinieren, der übliche Weg, einen Domainnamen oder Benutzernamen zu fälschen.

Leerzeichen mit Breite null tauchen auch in KI-generiertem Text auf. Chat-Assistenten und Textpipelines lassen in ihrer Ausgabe manchmal solche Leerzeichen oder Verbinder zurück, und dieselben Zeichen können als unsichtbares Wasserzeichen dienen, sodass eine eingefügte Antwort mehr enthalten kann, als Sie sehen. Wenn Sie den Text durch diese Prüfung schicken, sehen Sie genau, was darin versteckt ist.

Manche dieser Zeichen gehören in echten Text, deshalb lässt das Tool sie dort in Ruhe, wo sie normal sind. Eine vollständige Flagge von England, Schottland oder Wales (eine schwarze Flagge, gefolgt von einigen Tag-Buchstaben und einem Abbruch-Tag), ein Zero Width Joiner zwischen zwei Emoji und ein Emoji-Darstellungsselektor nach einem Emoji sind normal. Ein Verbinder oder Nichtverbinder in persischen, Hindi- oder arabischen Wörtern ist ebenfalls normal, wird aber gemeldet, weil das Tool die Sprache Ihres Textes nicht kennt.

Die bereinigte Kopie entfernt Zeichen mit Breite null sowie Richtungs-, Tag-, Steuer- und andere unsichtbare Zeichen. Wörter mit gemischten Schriften ändert sie nie, weil das Ersetzen eines Buchstabens den Text verändern würde; korrigieren Sie sie von Hand, nachdem Sie das markierte Wort geprüft haben.

Tipps

  • Zählen Sie, was übrig bleibt, mit dem Zeichenzähler, der Zeichen, Bytes und Zeilen zählt.
  • Vergleichen Sie das Original mit dem bereinigten Text unter Texte vergleichen.
  • Um ein bestimmtes Zeichen überall zu entfernen, nutzen Sie Suchen und Ersetzen.

Häufige Fragen

Was sind Zeichen mit Breite null?

Das sind Zeichen, die auf dem Bildschirm keinen Platz einnehmen, etwa das Leerzeichen mit Breite null (U+200B), der Nulltreiber (U+200C), der Wortverbinder (U+2060) und die Bytereihenfolge-Marke (U+FEFF). Sie schleichen sich in Text ein, der von Webseiten und aus Chat-Apps kopiert wird, und können Suchen, Passwörter, Code und Dateinamen ohne sichtbares Anzeichen zerstören. Der Verbinder und der Nichtverbinder werden in manchen Schriften wie Persisch und Hindi auch absichtlich verwendet, prüfen Sie also, bevor Sie sie entfernen.

Was ist ein Trojan-Source-Angriff?

Unicode kennt Steuerzeichen, die die Anzeigerichtung von Text ändern, etwa die Rechts-nach-links-Überschreibung (U+202E). Im Quellcode können sie eine Zeile anders aussehen lassen, als der Compiler sie liest, sodass ein harmlos wirkender Kommentar echten Code verbirgt. Das Tool listet jedes bidirektionale Steuerzeichen auf, damit Sie es sehen können.

Was sind Unicode-Tag-Zeichen und warum sind sie wichtig?

Die Tag-Zeichen (U+E0000 bis U+E007F) spiegeln ASCII, werden aber nicht angezeigt. Mit ihnen geschriebener Text ist für Lesende unsichtbar, kann aber von Software gelesen werden, auch von KI-Assistenten. So lassen sich versteckte Anweisungen in einen Prompt oder ein Dokument einschleusen. Das Tool decodiert jede Folge von Tag-Zeichen zurück in den ASCII-Text, den sie buchstabiert, und zeigt ihn deutlich an. Das nennt man ASCII smuggling. Die Flagge von England, Schottland oder Wales besteht absichtlich aus einigen Tag-Zeichen, daher wird eine vollständige Flaggensequenz nicht gemeldet.

Warum wird ein Wort als Mischschrift markiert?

Kyrillisch und Griechisch haben Buchstaben, die lateinischen gleichen, etwa das kyrillische а und das lateinische a. Ein Wort, das beides mischt, wie pаypal mit kyrillischem а, kann als echter Name durchgehen und doch woandershin führen. Das Tool listet jedes Wort auf, das lateinische Buchstaben mit kyrillischen, griechischen oder armenischen kombiniert, und zeigt, welche Buchstaben nicht dazugehören.

Werden Emoji gemeldet?

Nein. Ein Zero Width Joiner zwischen zwei Emoji, wie bei Familien- oder Berufs-Emoji, und der Variationsselektor nach einem Emoji gehören zum Aufbau von Emoji und bleiben deshalb unbeachtet. Dieselben Zeichen an anderer Stelle, etwa zwischen zwei Buchstaben, werden gemeldet.

Wird mein Text hochgeladen?

Nein. Der Text wird in Ihrem Browser geprüft und verlässt Ihr Gerät nie.