🧰 UtlKit

文字列類似度

2つの文字列間の編集距離と類似度を計算。

距離
3
類似度
57.1%
操作
7
類似度
編集操作 (7)
1. 置換 'k' → 's'
2. 一致 'i'
3. 一致 't'
4. 一致 't'
5. 置換 'e' → 'i'
6. 一致 'n'
7. 挿入 'g'
🐛

問題を報告

バグを見つけましたか?提案がありますか?このツールの改善にご協力ください。

📊 データサマリー(自動入力)

ツール: string-similarity · /tools/string-similarity/

str1: kitten

str2: sitting

これはどんなツールですか?

文字列類似度計算機は、複数のアルゴリズムを用いて2つのテキスト文字列を比較し、それらの類似度を測定します。Levenshtein 距離(編集距離)、Jaccard 類似度、コサイン類似度、最長共通部分列をサポート。ファジーマッチ、剽窃検出、スペルチェック、データ重複除去に有用です。

使い方

  1. 1

    最初の文字列を入力

    比較する最初のテキストを入力します。

  2. 2

    2番目の文字列を入力

    比較する2番目のテキストを入力します。

  3. 3

    結果を確認

    複数のアルゴリズムからの類似度スコアを表示します。

よくある質問

Levenshtein 距離とは何ですか?

Levenshtein 距離は、ある文字列を別の文字列に変換するために必要な単一文字の編集(挿入、削除、置換)の最小回数をカウントします。距離が 0 は同一文字列を意味します。低い距離ほど類似しています。

どのアルゴリズムを使うべきですか?

Levenshtein は誤字用、Cosine はテキスト用。

大量のテキストを処理できますか?

ブラウザは数 MB までのテキストを処理できます。非常に大きなファイルは事前に分割することを検討してください。

どの文字列類似度アルゴリズムを使えばいいですか?

短い文字列のタイポ耐性マッチングにはLevenshtein距離(編集操作)を。集合や長い文書にはJaccard(集合の重複度)やトークン/文字n-gramのコサイン類似度を。距離計算の前に必ず正規化(小文字化、trim、Unicode正規化)をしてください。