テキスト正規化
余分な空白、改行コード、Unicode表現をまとめて整えるテキスト正規化ツール。コピペ由来の揺れやデータ投入前の表記ぶれを減らせる。
使い方
- 入力欄へ整えたい文字列を貼り付ける。
- 出力欄で正規化結果を確認する。
- コピーまたは保存で再利用する。
テキスト正規化
Hello Restring
こんな用途に
- 前後空白や連続スペースを整えたいとき。
- CRLF、CR、LFが混在したテキストを統一したいとき。
- Unicode正規化で見た目が同じ文字の揺れを減らしたいとき。
仕組み
- UnicodeをNFCへ正規化。
- 連続する空白を1文字に圧縮し、CRLF/CRをLFへ統一して前後空白を削除。
確認ポイント
- 比較前に正規化すると、空白や改行だけの差分を減らせる。
- データ投入前の下処理として使う場合は、変換後の内容を必ず確認する。
手元でやるには
空白・改行・Unicodeを正規化
必要環境: Python 3python3 -c 'import re,sys,unicodedata; s=sys.stdin.read().replace("\r\n","\n").replace("\r","\n"); s=unicodedata.normalize("NFC",s); print(re.sub(r"[^\S\r\n]+"," ",s).strip())' < input.txt関連ツール
よくある質問
Unicode正規化とは?
同じ見た目でも内部表現が異なる文字を、一定の形式へ揃える処理。
改行コードも変換できる?
CRLFとCRをLFへ統一する。任意の改行コードへ変換したい場合は改行コード変換を使う。