🧰 UtlKit

Similaridade de Strings

Compare duas strings e calcule a distância de Levenshtein e porcentagem de similaridade.

Distância
3
Similaridade
57.1%
Operações
7
Similaridade
Operações de Edição (7)
1. Substituir 'k' → 's'
2. Correspondência 'i'
3. Correspondência 't'
4. Correspondência 't'
5. Substituir 'e' → 'i'
6. Correspondência 'n'
7. Inserir 'g'
🐛

Reportar um Problema

Encontrou um bug ou tem uma sugestão? Ajude-nos a melhorar esta ferramenta.

📊 Resumo de Dados (preenchido automaticamente)

Ferramenta: string-similarity · /tools/string-similarity/

str1: kitten

str2: sitting

O que é esta ferramenta?

A Similaridade de Strings compara duas strings de texto e mede o quão parecidas são usando múltiplos algoritmos. Suporta distância de Levenshtein (distância de edição), similaridade de Jaccard, similaridade de cosseno e maior subseqüência comum. Útil para correspondência aproximada, detecção de plágio, correção ortográfica e desduplicação de dados.

Como usar

  1. 1

    Inserir a primeira string

    Insira o primeiro texto para comparar.

  2. 2

    Inserir a segunda string

    Insira o segundo texto para comparar.

  3. 3

    Ver resultados

    Veja as pontuações de similaridade de vários algoritmos.

Perguntas frequentes

O que é a distância de Levenshtein?

A distância de Levenshtein conta o número mínimo de edições de um caractere (inserções, exclusões, substituições) necessárias para transformar uma string em outra. Distância 0 significa strings idênticas. Menor distância = mais similar.

Qual algoritmo usar?

Levenshtein para erros de digitação, Cosine para texto.

Posso processar textos muito grandes?

O navegador pode lidar com texto de vários megabytes. Para arquivos muito grandes, considere dividí-los antes.

Qual algoritmo de similaridade de strings devo usar?

Para correspondência tolerante a erros de digitação em strings curtas, use a distância de Levenshtein (operações de edição). Para conjuntos ou documentos longos, use Jaccard (sobreposição de conjuntos) ou similaridade de cosseno sobre n-gramas de tokens/caracteres. Normalize primeiro (minúsculas, trim, normalização Unicode) antes de qualquer cálculo de distância.