Restring

テキスト正規化

余分な空白、改行コード、Unicode表現をまとめて整えるテキスト正規化ツール。コピペ由来の揺れやデータ投入前の表記ぶれを減らせる。

使い方

  1. 入力欄へ整えたい文字列を貼り付ける。
  2. 出力欄で正規化結果を確認する。
  3. コピーまたは保存で再利用する。

テキスト正規化

Hello Restring

こんな用途に

  • 前後空白や連続スペースを整えたいとき。
  • CRLF、CR、LFが混在したテキストを統一したいとき。
  • Unicode正規化で見た目が同じ文字の揺れを減らしたいとき。

仕組み

  • UnicodeをNFCへ正規化。
  • 連続する空白を1文字に圧縮し、CRLF/CRをLFへ統一して前後空白を削除。

確認ポイント

  • 比較前に正規化すると、空白や改行だけの差分を減らせる。
  • データ投入前の下処理として使う場合は、変換後の内容を必ず確認する。

手元でやるには

空白・改行・Unicodeを正規化

必要環境: Python 3
python3 -c 'import re,sys,unicodedata; s=sys.stdin.read().replace("\r\n","\n").replace("\r","\n"); s=unicodedata.normalize("NFC",s); print(re.sub(r"[^\S\r\n]+"," ",s).strip())' < input.txt

関連ツール

よくある質問

Unicode正規化とは?

同じ見た目でも内部表現が異なる文字を、一定の形式へ揃える処理。

改行コードも変換できる?

CRLFとCRをLFへ統一する。任意の改行コードへ変換したい場合は改行コード変換を使う。