🧰 UtlKit

Audio-Zusammenfüger: 3 Audio-Clips in eine Datei Mergen — 30 s + 45 s + 15 s zu 1:30, die Abtastraten-Vereinheitlichung und die WAV-zu-MP3-Größendifferenz von 11 zu 1

Fügen Sie Audioclips im Browser zusammen: 30 s, 45 s und 15 s werden nach Dekodierung, Zuschneiden, Neuordnung und Vereinheitlichung der Abtastrate zu einer Datei von 1:30, exportiert als 16-bit-Stereo-WAV mit 176.400 Byte pro Sekunde oder als 128-kbps-MP3 mit 16.000 Byte pro Sekunde, ein Größenverhältnis von 11 zu 1, die ganze Pipeline lokal und ohne Upload.

Audioclips zusammenfügen ist ein Dekodieren, keine Berechnung: Jede Datei wird in denselben Strom roher Zahlen dekodiert, die behalteten Teile werden aneinandergelegt, und das Ergebnis wird als eine einzige Datei neu kodiert. Der Audio-Zusammenfüger läuft diese komplette Pipeline im Browser. Ziehen Sie drei Clips hinein — eine 0:30-Einführung, einen 0:45-Mittelteil, ein 0:15-Aus —, passen Sie jeden mit den Griffen an, ordnen Sie sie mit den Hoch- und runter-Buttons an, und die Merge-Ausgabe ist eine 1:30-Datei, exportiert als 16-bit-Stereo-WAV mit 176.400 Byte pro Sekunde oder als 128-kbps-MP3 mit 16.000 Byte pro Sekunde, ein Größenverhältnis von 11 zu 1. Nichts wird hochgeladen: Die Web Audio API dekodiert, resamplet und kodiert auf dem Gerät, auf dem die Dateien liegen.

Vor dem Zusammenfügen: Zuschneiden, Schneiden und Neuordnen

Jede Spur zeichnet eine Wellenform mit zwei Griffen. Der linke Griff verschiebt die Startposition, der rechte Griff die Endposition, das gewählte Fenster ist hervorgehoben, und an jedem Griff hängt ein Zeitlabel im M:SS-Format. Das kürzeste wählbare Fenster ist 0,05 Sekunden, was bei 44100 Hertz genau 2205 Abtastwerte sind, so dass jeder Schnitt eine harte Untergrenze hat, unter die der Zusneider nicht geht. Die Hoch- und runter-Buttons ordnen die Spurliste neu, und die Listenreihenfolge ist die Ausgabereihenfolge: Der oberste Clip erklingt in der zusammengeführten Datei zuerst. Ein Klick auf die Wellenform setzt einen Wiedergabecursor, und der Play-Button der Spur startet ab diesem Cursor, womit man einen Schnitt vor der Bestätigung abhören kann. Wenn Sie schon eine einzelne Datei haben, die kürzer werden soll, erledigt der Audio-Zusneider denselben Griffzug als eigenständigen Schritt und gibt das Ergebnis als Datei zurück, bereit zum Zusammenführen mit anderen.

Die Formate, die der Browser dekodieren kann

Der Zusammenfüger akzeptiert, was der Browser-Decoder akzeptiert: MP3, WAV, OGG, AAC und M4A auf den üblichen Plattformen, alle dekodiert über denselben Web-Audio-Weg in dieselbe Zwischenform. Eine Datei, die beim Dekodieren fehlschlägt, wird übersprungen, statt als fataler Fehler behandelt zu werden — die übrigen Spuren werden trotzdem zusammengeführt —, und das ist eine bewusste Asymmetrie. Das Tool optimiert darauf, dass die verwertbaren Clips in eine einzige Datei kommen, und der Preis einer kaputten Datei ist ein fehlender Abschnitt, den man nach der Reparatur neu importieren kann. Wenn ein Format außerhalb des Decoder-Fensters liegt, oder ein Container auf Ihrer Plattform ungewöhnlich ist, besteht die Korrektur darin, es zuerst mit dem Audio-Konverter in WAV oder MP3 umzuwandeln und dann zusammenzuführen. Vorab konvertieren normalisiert auch die Abtastraten im Voraus, verkürzt den Resample-Schritt und lässt die ganze Pipeline von Anfang an auf einem einzigen Takt laufen.

Eine Abtastrate für alle Takte

Konkatenation braucht einen einzigen Takt. Zwei Clips mit unterschiedlichen Raten enthalten unterschiedlich viele Abtastwerte pro Sekunde, und das Aneinanderkleben würde die Rate dehnen oder stauchen, die Sie nicht gewählt haben. Der Zusammenfüger löst das, indem er die höchste Abtastrate unter den Spuren nimmt und den Rest darauf resamplet: Ein 0:30-Clip mit 48000 Hertz neben einem 0:45-Clip mit 44100 Hertz lässt das gesamte Mergen mit 48000 Hertz laufen, und der 44100-Clip wird nach oben resamplet. Der Resampler ist der OfflineAudioContext des Browsers, der beim Ratenwechsel einen Tiefpassfilter anwendet. Dieses Filtern zählt, weil naive Dezimation — bei der Halbierung der Rate jeden zweiten Abtastwert wegwerfen — Aliasing erzeugt und den Höhen einen metallischen Rand aufsetzt. Wenn die Ausgabe MP3 ist, kennt der Encoder nur eine feste Liste von Raten, so dass Hi-Res-Quellen eine saubere Halbierungskette durchlaufen: 96000 wird 48000, 88200 wird 44100, 192000 wird 96000 und dann 48000, und 176400 wird 88200 und dann 44100.

Die Aufteilung der Ausgabe: WAV gegenüber MP3

Beide Ausgaben halten dieselben Abtastwerte in zwei verschiedenen Kostenstrukturen. WAV schreibt 16-Bit-PCM hinter einem 44-Byte-RIFF-Kopf: Bei 44100 Hertz in Stereo sind das 176.400 Byte pro Sekunde, so dass die 1:30-Datei 15.876.044 Byte macht, etwa 15,1 MiB, und die Größe ist exakt — Dauer mal Rate mal zwei Kanäle mal zwei Byte, plus der Kopf. MP3 kodiert mit 128 kbps, was 16.000 Byte pro Sekunde entspricht, so dass dasselbe 1:30 bei 1.440.000 Byte landet, etwa 1,4 MiB. Das Verhältnis ist 11 zu 1, und es bleibt 11 zu 1 für jede Dauer, weil beide Formate linear mit der Dauer wachsen. Der Tausch ist verlustfrei gegen verlustbehaftet: WAV behält jeden Abtastwert, MP3 behält, was das psychoakustische Modell als hörbar einstuft. Eine Mono-Quelle wird auf beide Kanäle dupliziert, statt mit Stille aufgefüllt zu werden, so dass die Panorama-Einstellung neutral bleibt. Wählen Sie WAV für einen Archivmaster oder einen weiteren Bearbeitungsdurchlauf, und MP3 für das Senden, das Einbetten in ein Video oder das Hochladen auf einen Host. Der Dateigrößen-Konverter macht dieselbe Multiplikation pro Sekunde, wann immer Sie die Größe für eine Dauer brauchen, die das Tool nicht anzeigt.

Von der Aufnahme zum Zusammenfügen

Der Merge-Schritt ist die zweite Hälfte eines Aufnahme-Workflows. Der Sprachrekorder nimmt Takes auf demselben Web-Audio-Weg im Browser auf, so dass ein aufgenommener Abschnitt gespeichert, neben bestehende Dateien in den Zusammenfüger gelegt, der Fehlstart weggeschnitten und das Ganze in der finalen Fassung zusammengeführt werden kann, ohne die Seite zu verlassen und ohne einen Zwischenaufstieg zu einem Aufnahmeservice. Das Muster ist das, das Podcast- und Sprechschneidhandwerker von Hand anwenden: getrennt aufnehmen, dann montieren. Das Montieren clientseitig zu machen bedeutet, dass die Rohaufnahmen nie an jemanden übergeben werden müssen, und das zählt, wenn die Aufnahme ein Kundentermin, eine Probe oder etwas ist, das der Inhaber lieber nicht in ein Web-Formular kleben würde.

Wo das Merge-Muster sonst noch auftritt

Zusammenführen ist ein allgemeines Muster: In eine gemeinsame Form dekodieren, neu ordnen, konkatenieren, neu kodieren — und das Dateiformat ist nur die Verpackung an den beiden Enden. Denselben Aufbau durchlaufen auch Dokumente und Bilder im Browser. Der PDF-Zusammenfüger verbindet Seiten mehrerer PDF-Dateien in der gewählten Reihenfolge, der Bild-zu-PDF-Konverter baut einen Stapel Bilder zu einem einzigen Dokument, und der Bild-Zuschnitt-Führer behandelt den benachbarten Vorbereitungsschritt, in dem ein Bild auf den Bereich reduziert wird, der zählt, bevor es verpackt wird. Die geteilte Eigenschaft all dieser Werkzeuge ist, dass die gemeinsame Zwischenform die Arbeit erledigt, während die Formate an den Rändern bleiben, und dass die ganze Pipeline lokal läuft: Audio, Seiten und Pixel verlassen die Maschine nie, was genau die Eigenschaft ist, die ein Merge-Tool haben sollte.

Zugehörige Tools

Häufige Fragen

Kann ich MP3- und WAV-Dateien in eine einzige Ausgabe zusammenführen?

Ja. Der Zusammenfüger dekodiert jede Datei in denselben rohen Strom von Abtastwerten, so dass ein MP3 mit 0:30 und ein WAV mit 0:45 vor dem Aneinanderlegen in derselben Form sind. Die Ausgabe ist eine einzige Datei in einem einzigen Format: 16-bit-Stereo-WAV mit 176.400 Byte pro Sekunde, oder 128-kbps-MP3 mit 16.000 Byte pro Sekunde. Misch-Input ist der Normalfall, kein Sonderfall.

Warum ist die zusammengeführte Datei immer Stereo?

Der Ausgangs-Puffer wird mit zwei Kanälen gebaut, egal was hinein kommt. Eine Mono-Quelle wird auf beide Kanäle dupliziert — Dual-Mono —, statt mit Stille auf einer Seite aufgefüllt zu werden, so dass der Mix in der Mitte sitzt und das Panorama neutral bleibt. Eine Stereo-Quelle behält ihre zwei Kanäle unverändert. Deshalb wiegt eine Mono-Datei gleicher Dauer so viel wie eine Stereo-Datei.

Warum werden meine Clips vor dem Mergen resamplet?

Konkatenation verlangt eine einzige Abtastrate für alle Spuren. Der Zusammenfüger wählt die höchste Rate unter den Spuren und resamplet den Rest darauf mit dem OfflineAudioContext des Browsers, der beim Ratenwechsel einen Tiefpassfilter anwendet. Naive Dezimation ohne diesen Filter würde Aliasing erzeugen. Ein Clip mit 44100 Hertz neben einem mit 48000 Hertz endet also bei 48000 Hertz, und die 44100-Seite wird nach oben statt nach unten resamplet.

Wie groß wird die zusammengeführte Datei?

Linear in der Dauer. WAV mit 44100 Hertz in Stereo sind 176.400 Byte pro Sekunde, so dass die 1:30-Datei 15.876.044 Byte macht, etwa 15,1 MiB. MP3 mit 128 kbps sind 16.000 Byte pro Sekunde, so dass dasselbe 1:30 1.440.000 Byte macht, etwa 1,4 MiB. Die Spaltung bleibt 11 zu 1 für jede Dauer, und genau deshalb ist es bei langen Mergen, wo die Formatwahl richtig ins Gewicht fällt.

Wird mein Audio auf einen Server hochgeladen?

Nein. Die ganze Pipeline läuft im Browser: Das Dekodieren, der Resampler und der Encoder sind Web Audio und Web-APIs auf dem lokalen Gerät. Die Dateien verlassen es nie, und genau das macht das Tool für Kundentermine, Proben und andere Aufnahmen nutzbar, die der Inhaber lieber nirgendwo hinschicken würde.

Verwandte Artikel