Restring

Unicodeインスペクタ

入力文字をUnicodeコードポイント単位で解析するインスペクタ。文字化け、異体字、絵文字、不可視文字の正体をコード表現から確認できる。

使い方

  1. 調べたい文字列を入力する。
  2. 各文字のコードポイント、UTF-8、UTF-16、UTF-32を確認する。
  3. 文字化け、異体字、不可視文字の調査に使う。

Unicodeインスペクタ

AU+0041U+0041UTF-8 41UTF-16 0041UTF-32 00000041Basic Latin
U+3042U+3042UTF-8 E3 81 82UTF-16 3042UTF-32 00003042Hiragana
😀U+1F600U+1F600UTF-8 F0 9F 98 80UTF-16 D83D DE00UTF-32 0001F600Emoticons

仕組み

  • 入力をUnicodeコードポイント単位で分解。
  • 各文字をUTF表現へ変換し、代表的なUnicodeブロック名と併せて表示。

手元でやるには

コードポイントと文字名を表示

必要環境: Python 3
python3 -c 'import sys,unicodedata; [print(f"{c}\tU+{ord(c):04X}\t{unicodedata.name(c, "UNKNOWN")}") for c in sys.stdin.read()]'

関連ツール