🧰 UtlKit

Similarité de Chaînes

Comparez deux chaînes et calculez la distance de Levenshtein et le pourcentage de similarité.

Distance
3
Similarité
57.1%
Opérations
7
Similarité
Opérations d'Édition (7)
1. Remplacer 'k' → 's'
2. Correspondance 'i'
3. Correspondance 't'
4. Correspondance 't'
5. Remplacer 'e' → 'i'
6. Correspondance 'n'
7. Insérer 'g'
🐛

Signaler un Problème

Vous avez trouvé un bug ou avez une suggestion ? Aidez-nous à améliorer cet outil.

📊 Résumé des Données (rempli automatiquement)

Outil: string-similarity · /tools/string-similarity/

str1: kitten

str2: sitting

Qu'est-ce que cet outil ?

La Similarité de Chaînes compare deux chaînes de texte et mesure leur degré de ressemblance à l'aide de plusieurs algorithmes. Prend en charge la distance de Levenshtein (distance d'édition), la similarité de Jaccard, la similarité cosinus et la plus longue sous-séquence commune. Utile pour l'appariement flou, la détection de plagiat, la correction orthographique et la déduplication de données.

Comment l'utiliser

  1. 1

    Saisir la première chaîne

    Saisissez le premier texte à comparer.

  2. 2

    Saisir la deuxième chaîne

    Saisissez le deuxième texte à comparer.

  3. 3

    Voir les résultats

    Consultez les scores de similarité de plusieurs algorithmes.

Foire aux questions

Qu'est-ce que la distance de Levenshtein ?

La distance de Levenshtein compte le nombre minimal de modifications d'un caractère (insertions, suppressions, substitutions) nécessaires pour transformer une chaîne en une autre. Une distance de 0 signifie des chaînes identiques. Plus la distance est faible, plus les chaînes sont similaires.

Quel algorithme choisir ?

Levenshtein pour les fautes de frappe, Cosinus pour le texte.

Puis-je traiter un texte très volumineux ?

Le navigateur peut gérer un texte de plusieurs mégaoctets. Pour les très grands fichiers, envisagez de les diviser d'abord.

Quel algorithme de similarité de chaînes dois-je utiliser ?

Pour l'appariement tolérant aux fautes sur des chaînes courtes, utilisez la distance de Levenshtein (opérations d'édition). Pour des ensembles ou de longs documents, utilisez Jaccard (chevauchement d'ensembles) ou la similarité cosinus sur n-grammes de jetons/caractères. Normalisez d'abord (minuscules, suppression des espaces en début/fin, normalisation Unicode) avant tout calcul de distance.