文字列類似度
2つの文字列間の編集距離と類似度を計算。
距離
3
類似度
57.1%
操作
7
類似度
編集操作 (7)
1. 置換 'k' → 's'
2. 一致 'i'
3. 一致 't'
4. 一致 't'
5. 置換 'e' → 'i'
6. 一致 'n'
7. 挿入 'g'
🐛
問題を報告
バグを見つけましたか?提案がありますか?このツールの改善にご協力ください。
これはどんなツールですか?
文字列類似度計算機は、複数のアルゴリズムを用いて2つのテキスト文字列を比較し、それらの類似度を測定します。Levenshtein 距離(編集距離)、Jaccard 類似度、コサイン類似度、最長共通部分列をサポート。ファジーマッチ、剽窃検出、スペルチェック、データ重複除去に有用です。
使い方
- 1
最初の文字列を入力
比較する最初のテキストを入力します。
- 2
2番目の文字列を入力
比較する2番目のテキストを入力します。
- 3
結果を確認
複数のアルゴリズムからの類似度スコアを表示します。
よくある質問
Levenshtein 距離とは何ですか?
Levenshtein 距離は、ある文字列を別の文字列に変換するために必要な単一文字の編集(挿入、削除、置換)の最小回数をカウントします。距離が 0 は同一文字列を意味します。低い距離ほど類似しています。
どのアルゴリズムを使うべきですか?
Levenshtein は誤字用、Cosine はテキスト用。
大量のテキストを処理できますか?
ブラウザは数 MB までのテキストを処理できます。非常に大きなファイルは事前に分割することを検討してください。
どの文字列類似度アルゴリズムを使えばいいですか?
短い文字列のタイポ耐性マッチングにはLevenshtein距離(編集操作)を。集合や長い文書にはJaccard(集合の重複度)やトークン/文字n-gramのコサイン類似度を。距離計算の前に必ず正規化(小文字化、trim、Unicode正規化)をしてください。