🧰 UtlKit

Similarité de Chaînes

Comparez deux chaînes et calculez la distance de Levenshtein et le pourcentage de similarité.

Distance
3
Similarité
57.1%
Opérations
7
Similarité
Opérations d'Édition (7)
1. Remplacer 'k' → 's'
2. Correspondance 'i'
3. Correspondance 't'
4. Correspondance 't'
5. Remplacer 'e' → 'i'
6. Correspondance 'n'
7. Insérer 'g'
🐛

Signaler un Problème

Vous avez trouvé un bug ou avez une suggestion ? Aidez-nous à améliorer cet outil.

📊 Résumé des Données (rempli automatiquement)

Outil: string-similarity · /tools/string-similarity/

str1: kitten

str2: sitting

Qu'est-ce que cet outil ?

La Similarité de Chaînes compare deux chaînes de texte et mesure leur degré de ressemblance à l'aide de plusieurs algorithmes. Prend en charge la distance de Levenshtein (distance d'édition), la similarité de Jaccard, la similarité cosinus et la plus longue sous-séquence commune. Utile pour l'appariement flou, la détection de plagiat, la correction orthographique et la déduplication de données.

Comment l'utiliser

  1. 1

    Saisir la première chaîne

    Saisissez le premier texte à comparer.

  2. 2

    Saisir la deuxième chaîne

    Saisissez le deuxième texte à comparer.

  3. 3

    Voir les résultats

    Consultez les scores de similarité de plusieurs algorithmes.

Foire aux questions

Qu'est-ce que la distance de Levenshtein ?

La distance de Levenshtein compte le nombre minimal de modifications d'un caractère (insertions, suppressions, substitutions) nécessaires pour transformer une chaîne en une autre. Une distance de 0 signifie des chaînes identiques. Plus la distance est faible, plus les chaînes sont similaires.

Quel algorithme choisir ?

Levenshtein pour les fautes de frappe, Cosinus pour le texte.

Puis-je traiter un texte très volumineux ?

Le navigateur peut gérer un texte de plusieurs mégaoctets. Pour les très grands fichiers, envisagez de les diviser d'abord.

Which string similarity algorithm should I use?

For typo-tolerant matching of short strings, use Levenshtein distance (edit operations). For sets or longer documents, use Jaccard (set overlap) or cosine similarity over token/character n-grams. Normalize first (lowercase, trim, unicode normalization) before any distance calculation.