🧰 UtlKit

Combinador de Áudio: Como Combinar 3 Clips em Um Arquivo — 30 s + 45 s + 15 s em 1:30, a Unificação da Taxa de Amostragem e a Brecha de Tamanho WAV/MP3 de 11 para 1

Combine trechos de audio no navegador: 30 s, 45 s e 15 s viram um arquivo de 1:30 apos a decodificacao, o recorte, a reordenacao e a unificacao da taxa de amostragem, exportado como WAV estereo de 16 bits a 176.400 bytes por segundo ou como MP3 de 128 kbps a 16.000 bytes por segundo, um hiato de tamanho de 11 para 1, com toda a linha em local e sem envio.

Combinar áudio é uma decodificação, não um cálculo: cada arquivo é decodificado na mesma cadeia de números crus, as partes mantidas são colocadas uma após a outra, e o resultado é re-codificado como um único arquivo. O Combinador de Áudio executa essa linha de trabalho inteira no navegador. Solte três clipes —uma introdução de 0:30, um trecho central de 0:45 e um encerramento de 0:15—, ajuste cada um com os controles deslizantes, ordene-os com os botões de subir e descer, e a saída da combinação será um arquivo de 1:30, exportado como WAV estéreo de 16 bits a 176.400 bytes por segundo ou como MP3 de 128 kbps a 16.000 bytes por segundo, um hiato de tamanho de 11 para 1. Nada é enviado: a Web Audio API decodifica, re-amostra e codifica na máquina que tem os arquivos.

Antes de combinar: aparar, cortar e reordenar

Cada faixa desenha uma forma de onda com dois controles deslizantes. O controle esquerdo move a posição inicial, o direito move a posição final, a janela selecionada fica destacada, e junto a cada controle segue um rótulo de tempo no formato M:SS. A janela selecionável mais curta é de 0,05 segundos, que a 44100 hertz são exatamente 2205 amostras, assim todo corte tem um limite duro abaixo do qual o aparador não desce. Os botões de subir e descer reordenam a lista de faixas, e a ordem da lista é a ordem de saída: o clipe que está no topo toca primeiro no arquivo combinado. Ao clicar na forma de onda define-se um cursor de reprodução, e o botão de reprodução da faixa parte desse cursor, que é a forma de ouvir um corte antes de confirmá-lo. Se você já tem um arquivo único que quer encurtar, o aparador de áudio faz o mesmo arrasto de controles como um passo independente e devolve o resultado como arquivo, pronto para ser combinado com outros.

Os formatos que o navegador consegue decodificar

O combinador aceita o que o decodificador do navegador aceitar: MP3, WAV, OGG, AAC e M4A nas plataformas comuns, todos decodificados pelo mesmo caminho Web Audio até a mesma forma intermediária. Um arquivo que falhe ao decodificar é omitido em vez de ser tratado como erro fatal —as faixas restantes ainda assim se combinam—, e essa é uma assimetria deliberada. A ferramenta otimiza para que os clipes utilizáveis entrem em um único arquivo, e o custo de um arquivo ruim é um trecho a menos, que pode ser reimportado depois de corrigi-lo. Quando um formato fica fora da janela do decodificador, ou um contêiner é pouco comum na plataforma onde você está, a correção é convertê-lo antes para WAV ou MP3 com o conversor de áudio e então combinar. Converter antes de combinar também normaliza as taxas de amostragem adiantado, encurta o passo de re-amostragem e deixa a linha inteira com um único relógio desde o início.

Uma taxa de amostragem para todos os relógios

A concatenação precisa de um único relógio. Dois clipes em taxas diferentes contêm números diferentes de amostras por segundo, e colar um após o outro esticaria ou comprimiria a taxa que você não escolheu. O combinador resolve isso tomando a taxa de amostragem mais alta entre as faixas e re-amostrando o restante até ela: um clipe de 0:30 a 48000 hertz ao lado de um clipe de 0:45 a 44100 hertz faz a combinação inteira correr a 48000 hertz, e o clipe de 44100 é re-amostrado para cima. O re-amostrador é o OfflineAudioContext do navegador, que aplica um filtro passa-baixa ao mudar a taxa. Esse filtro importa, porque a redução simples —descartar uma de cada duas amostras ao dividir a taxa por dois— produz aliasing e acrescenta uma borda metálica aos agudos. Quando a saída é MP3, o codificador só reconhece uma lista fixa de taxas, assim as fontes de alta resolução seguem uma cadeia limpa de metades: 96000 vira 48000, 88200 vira 44100, 192000 vira 96000 e depois 48000, e 176400 vira 88200 e depois 44100.

A divisão de saída: WAV contra MP3

As duas saídas guardam as mesmas amostras em duas estruturas de custo diferentes. O WAV grava PCM de 16 bits atrás de um cabeçalho RIFF de 44 bytes: a 44100 hertz em estéreo são 176.400 bytes por segundo, assim a combinação de 1:30 dá 15.876.044 bytes, cerca de 15,1 MiB, e o tamanho é exato —duração por taxa por dois canais por dois bytes, mais o cabeçalho. O MP3 codifica a 128 kbps, o que dá 16.000 bytes por segundo, assim o mesmo 1:30 cai em 1.440.000 bytes, cerca de 1,4 MiB. A proporção é de 11 para 1, e se mantém 11 para 1 para qualquer duração porque ambos os formatos crescem linearmente com a duração. A troca é sem perda contra com perda: o WAV guarda cada amostra, o MP3 guarda o que o modelo psicoacústico considera audível. Uma fonte mono é duplicada nos dois canais em vez de ser preenchida com silêncio, assim a panorâmica fica neutra. Escolha WAV para um mestre de arquivo ou uma passada de edição extra, e MP3 para enviar, embutir em vídeo ou subir a um host. O conversor de tamanho de arquivo faz a mesma multiplicação por segundo quando você precisa estimar o tamanho de uma duração que a ferramenta não mostra.

Da gravação à combinação

O passo de combinar é a segunda metade de um fluxo de captura. A gravadora de voz capta takes no mesmo caminho Web Audio dentro do navegador, assim um segmento gravado pode ser salvo, colocado no combinador junto a arquivos existentes, aparado para tirar a entrada errada, e combinado na montagem final sem sair do site e sem um envio intermediário a um serviço de gravação. O padrão é o que editores de podcast e narração fazem à mão: gravar separado e depois montar. Fazer a montagem no cliente significa que os takes crus nunca precisam ser passados a ninguém, e isso importa quando a gravação é uma sessão com cliente, um ensaio, ou algo que o dono preferiria não colar em um formulário web.

Onde mais o padrão de combinar aparece

Combinar é um padrão geral: decodificar para uma forma comum, reordenar, concatenar, re-codificar —e o formato do arquivo é só a embalagem nas pontas. A mesma forma atravessa também documentos e imagens no navegador. O combinador de PDF une páginas de vários arquivos PDF na ordem que você escolher, o conversor de imagem para PDF monta uma pilha de imagens em um único documento, e o guia de recorte de imagem cobre o passo de preparação vizinho, onde uma imagem é reduzida à região que importa antes de ser empacotada. A propriedade compartilhada entre todas elas é que a forma intermediária comum faz o trabalho enquanto os formatos ficam nas bordas, e que a linha inteira roda em local: o áudio, as páginas e os pixels nunca saem da máquina, que é exatamente a propriedade que uma ferramenta de combinação deve ter.

Ferramentas Relacionadas

Perguntas Frequentes

Posso combinar arquivos MP3 e WAV em uma única saída?

Sim. O combinador decodifica cada arquivo na mesma cadeia crua de amostras, assim um MP3 de 0:30 e um WAV de 0:45 estão na mesma forma antes de serem colocados um após o outro. A saída é um único arquivo em um único formato: WAV estéreo de 16 bits a 176.400 bytes por segundo, ou MP3 de 128 kbps a 16.000 bytes por segundo. A entrada mista é o caso normal, não uma exceção.

Por que o arquivo combinado sempre é estéreo?

O buffer de saída é construído com dois canais, não importa o que entre. Uma fonte mono é duplicada nos dois canais — mono duplo — em vez de ser preenchida com silêncio de um lado, assim a mistura fica centralizada e a panorâmica se mantém neutra. Uma fonte estéreo conserva seus dois canais intactos. Por isso um arquivo mono da mesma duração pesa o mesmo que um estéreo.

Por que meus clipes são re-amostrados antes de combinar?

A concatenação exige uma taxa de amostragem única para todas as faixas. O combinador escolhe a taxa mais alta entre as faixas e re-amostra o restante até ela com o OfflineAudioContext do navegador, que aplica um filtro passa-baixa ao mudar a taxa. A redução simples sem esse filtro produziria aliasing. Um clipe de 44100 hertz ao lado de um de 48000 hertz acaba assim a 48000 hertz, e o lado de 44100 é re-amostrado para cima em vez de ao contrário.

De que tamanho será o arquivo combinado?

Linear com a duração. O WAV a 44100 hertz em estéreo dá 176.400 bytes por segundo, assim a combinação de 1:30 dá 15.876.044 bytes, cerca de 15,1 MiB. O MP3 a 128 kbps dá 16.000 bytes por segundo, assim o mesmo 1:30 dá 1.440.000 bytes, cerca de 1,4 MiB. O hiato se mantém em 11 para 1 para qualquer duração, que é a razão pela qual nas combinações longas é onde a escolha de formato de verdade aparece.

Meu áudio é enviado a um servidor?

Não. A linha inteira roda no navegador: a decodificação, o re-amostrador e o codificador são Web Audio e APIs web na máquina local. Os arquivos nunca a abandonam, e é isso que torna a ferramenta utilizável para sessões com clientes, ensaios e outras gravações que o dono preferiria não enviar a lugar nenhum.

Artigos Relacionados