🧰 UtlKit

Combineur Audio : Comment Fusionner 3 Extraits en Un Fichier — 30 s + 45 s + 15 s en 1:30, l'Uniformisation du Taux d'Échantillonnage et l'Écart de Taille WAV/MP3 de 11 à 1

Fusionnez des extraits audio dans le navigateur : 30 s, 45 s et 15 s deviennent un fichier de 1:30 après le décodage, la découpe, le réordonnancement et l'unification du taux d'échantillonnage, exporté en WAV stéréo 16 bits à 176 400 octets par seconde ou en MP3 128 kbps à 16 000 octets par seconde, un écart de taille de 11 à 1, toute la chaîne en local et sans téléversement.

Fusionner de l'audio est une décodification, pas un calcul : chaque fichier est décodé dans le même flux de nombres bruts, les parties conservées sont posées l'une à la suite de l'autre, et le résultat est ré-encodé en un fichier unique. Combineur Audio exécute cette chaîne complète dans le navigateur. Déposez trois extraits — une intro de 0:30, un morceau central de 0:45, un final de 0:15 —, ajustez chacun avec les poignées, ordonnez-les avec les boutons monter et descendre, et la sortie de la fusion est un fichier de 1:30, exporté en WAV stéréo 16 bits à 176 400 octets par seconde ou en MP3 128 kbps à 16 000 octets par seconde, un écart de taille de 11 à 1. Rien n'est téléversé : la Web Audio API décode, ré-échantillonne et encode sur la machine qui détient les fichiers.

Avant la fusion : couper, roter et réordonner

Chaque piste dessine une forme d'onde avec deux poignées. La poignée gauche déplace la position de début, la poignée droite déplace la position de fin, la fenêtre sélectionnée est mise en évidence, et une étiquette de temps au format M:SS suit chaque poignée. La fenêtre sélectionnable la plus courte est de 0,05 seconde, soit exactement 2205 échantillons à 44100 hertz, si bien que chaque coupe a un plancher dur en dessous duquel le découpeur ne descend pas. Les boutons monter et descendre réordonnent la liste des pistes, et l'ordre de la liste est l'ordre de sortie : l'extrait en tête sonne en premier dans le fichier fusionné. Un clic sur la forme d'onde fixe un curseur de lecture, et le bouton lecture de la piste démarre depuis ce curseur, ce qui permet d'écouter une coupe avant de la confirmer. Si vous avez déjà un fichier unique à raccourcir, le découpeur audio exécute le même glissement de poignées comme une étape indépendante et rend le résultat comme fichier, prêt à être fusionné avec d'autres.

Les formats que le navigateur peut décoder

Le combineur accepte ce que le décodeur du navigateur accepte : MP3, WAV, OGG, AAC et M4A sur les plateformes habituelles, tous décodés par le même chemin Web Audio vers la même forme intermédiaire. Un fichier qui échoue au décodage est omis au lieu d'être traité comme erreur fatale — les pistes restantes se fusionnent quand même —, et c'est une asymétrie délibérée. L'outil optimise pour que les extraits utilisables entrent dans un seul fichier, et le coût d'un fichier défectueux est un passage manquant que l'on peut réimporter après l'avoir corrigé. Quand un format se trouve hors de la fenêtre du décodeur, ou qu'un conteneur est peu commun sur la plateforme où vous êtes, la correction consiste à le convertir d'abord en WAV ou MP3 avec le convertisseur audio puis à fusionner. Convertir avant de fusionner normalise aussi les taux d'échantillonnage en amont, raccourcit l'étape de ré-échantillonnage et laisse toute la chaîne à une seule horloge dès le départ.

Un taux d'échantillonnage pour toutes les horloges

La concaténation a besoin d'une seule horloge. Deux extraits à des taux différents contiennent des nombres différents d'échantillons par seconde, et coller l'un à la suite de l'autre étirerait ou comprimerait le taux que vous n'avez pas choisi. Le combineur résout en prenant le taux d'échantillonnage le plus élevé parmi les pistes et en ré-échantillonnant le reste jusqu'à lui : un extrait de 0:30 à 48000 hertz à côté d'un extrait de 0:45 à 44100 hertz fait courir toute la fusion à 48000 hertz, et l'extrait de 44100 est ré-échantillonné vers le haut. Le ré-échantillonneur est l'OfflineAudioContext du navigateur, qui applique un filtre passe-bas en changeant le taux. Ce filtrage compte, parce que la décimation simple — jeter un échantillon sur deux en divisant le taux par deux — produit du repliement et ajoute un liseré métallique aux aigus. Quand la sortie est en MP3, l'encodeur ne reconnaît qu'une liste fixe de taux, si bien que les sources haute résolution suivent une chaîne propre de moitiés : 96000 devient 48000, 88200 devient 44100, 192000 devient 96000 puis 48000, et 176400 devient 88200 puis 44100.

La division de sortie : WAV face à MP3

Les deux sorties contiennent les mêmes échantillons dans deux structures de coût différentes. Le WAV écrit du PCM 16 bits derrière un en-tête RIFF de 44 octets : à 44100 hertz en stéréo, ce sont 176 400 octets par seconde, si bien que la fusion de 1:30 fait 15 876 044 octets, environ 15,1 MiB, et la taille est exacte — durée fois taux fois deux canaux fois deux octets, plus l'en-tête. Le MP3 encode à 128 kbps, ce qui donne 16 000 octets par seconde, si bien que le même 1:30 tombe à 1 440 000 octets, environ 1,4 Mio. Le ratio est de 11 à 1, et il reste 11 à 1 pour n'importe quelle durée parce que les deux formats croissent linéairement avec la durée. L'échange est sans perte contre avec perte : le WAV garde chaque échantillon, le MP3 garde ce que le modèle psychoacoustique juge audible. Une source mono est dupliquée sur les deux canaux au lieu d'être garnie de silence, si bien que la panoramique reste neutre. Choisissez le WAV pour un maître d'archive ou un passage de montage supplémentaire, et le MP3 pour l'envoi, l'intégration dans une vidéo ou le téléversement vers un hôte. Le convertisseur de taille de fichier fait la même multiplication par seconde quand vous avez besoin d'estimer la taille d'une durée que l'outil n'affiche pas.

De la prise de son à la fusion

L'étape de fusion est la seconde moitié d'un flux de captation. Le enregistreur vocal capture des prises sur le même chemin Web Audio dans le navigateur, si bien qu'un segment enregistré peut être sauvegardé, déposé dans le combineur à côté de fichiers existants, roter pour supprimer le départ raté, et fusionné dans le montage final sans quitter le site et sans téléversement intermédiaire vers un service d'enregistrement. Le schéma est celui que les monteurs de podcast et de narration font à la main : enregistrer séparément, puis assembler. Assembler côté client signifie que les prises brutes n'ont jamais à être remises à quiconque, et cela compte quand l'enregistrement est une session client, une répétition, ou quelque chose que son propriétaire préférerait ne pas coller dans un formulaire web.

Où le schéma de fusion apparaît ailleurs

Fusionner est un schéma général : décoder vers une forme commune, réordonner, concaténer, ré-encoder — et le format du fichier n'est que l'emballage aux deux bouts. La même forme traverse aussi les documents et les images dans le navigateur. Le combineur PDF joint les pages de plusieurs fichiers PDF dans l'ordre de votre choix, le convertisseur d'image en PDF assemble une pile d'images en un document unique, et le guide de rognage d'image couvre l'étape de préparation voisine, où une image est réduite à la région qui compte avant d'être emballée. La propriété partagée par toutes est que la forme intermédiaire commune fait le travail tandis que les formats restent aux bords, et que toute la chaîne tourne en local : l'audio, les pages et les pixels ne quittent jamais la machine, ce qui est exactement la propriété qu'un outil de fusion doit avoir.

Outils Associés

Questions Fréquentes

Puis-je fusionner des fichiers MP3 et WAV en une seule sortie ?

Oui. Le combineur décode chaque fichier dans le même flux cru d'échantillons, si bien qu'un MP3 de 0:30 et un WAV de 0:45 sont dans la même forme avant d'être posés l'un à la suite de l'autre. La sortie est un fichier unique dans un seul format : WAV stéréo 16 bits à 176 400 octets par seconde, ou MP3 128 kbps à 16 000 octets par seconde. L'entrée mixte est le cas normal, pas une exception.

Pourquoi le fichier fusionné est-il toujours en stéréo ?

Le tampon de sortie est construit avec deux canaux, quelle que soit l'entrée. Une source mono est dupliquée sur les deux canaux — du dual mono — au lieu d'être garnie de silence d'un côté, si bien que le mix reste centré et la panoramique neutre. Une source stéréo conserve ses deux canaux intacts. C'est pourquoi un fichier mono de la même durée pèse le même poids qu'un stéréo.

Pourquoi mes extraits sont-ils ré-échantillonnés avant la fusion ?

La concaténation exige un taux d'échantillonnage unique pour toutes les pistes. Le combineur choisit le taux le plus élevé parmi les pistes et ré-échantillonne le reste jusqu'à lui avec l'OfflineAudioContext du navigateur, qui applique un filtre passe-bas en changeant le taux. La décimation simple sans ce filtre produirait du repliement. Un extrait de 44100 hertz à côté d'un extrait de 48000 hertz finit ainsi à 48000 hertz, et le côté 44100 est ré-échantillonné vers le haut plutôt que l'inverse.

Quelle sera la taille du fichier fusionné ?

Linéaire avec la durée. Le WAV à 44100 hertz en stéréo fait 176 400 octets par seconde, si bien que la fusion de 1:30 fait 15 876 044 octets, environ 15,1 MiB. Le MP3 à 128 kbps fait 16 000 octets par seconde, si bien que le même 1:30 fait 1 440 000 octets, environ 1,4 MiB. L'écart reste de 11 à 1 pour n'importe quelle durée, ce qui est la raison pour laquelle c'est dans les fusions longues que le choix du format se voit vraiment.

Mon audio est-il téléversé sur un serveur ?

Non. Toute la chaîne tourne dans le navigateur : la décodification, le ré-échantillonneur et l'encodeur sont de la Web Audio et des API web sur la machine locale. Les fichiers ne la quittent jamais, et c'est cette propriété qui rend l'outil utilisable pour les sessions clients, les répétitions et les autres enregistrements que leur propriétaire préférerait ne pas envoyer n'importe où.

Articles Associés