Zum Inhalt springen

Verwandel jede Aufnahme in geschriebenen Text

Lade ein MP3, eine Sprachmemo oder ein aufgenommenes Interview hoch und erhalte die Wörter als Text mit Zeitstempeln zurück.

Dieses Tool wird gerade verbessert

Weitere Tools entdecken

Tägliches Limit erreicht

Ziehe deine Datei hierher

Durchsuchen
oder

MP4, MOV, AVI, MKV, WebM, MP3, WAV

0 / 1000

Ziehe deine Untertiteldatei hierher

Durchsuchen

SRT, VTT, ASS, SSA

KI
0 / 1000
Beispiele:

Plattform

Dauer

Zielgruppe & Ton Optional
KI schreibt dein Skript...

Kostenloses Konto erforderlich, um dieses Tool zu nutzen. In Sekunden registrieren!

Videodauer
Minuten erforderlich
Verbrauchte Minuten / Limit
Verbleibende Minuten
Geschätztes Guthaben danach (Min.)
Dieses Video hat etwas Besseres als eine verschwommene Kopie verdient. Es ist eine deutlich bessere Qualität verfügbar – schalte sie nach deinem kostenlosen Download frei.

Quellsprache
Zielsprache

Wähle zwei verschiedene Sprachen aus, um mit dem Dubbing zu beginnen.

Stimme

Die Hörprobe wird in der Zielsprache abgespielt, damit du vorab vergleichen kannst.

Originalstimme im Hintergrund behalten

Leise im Hintergrund hinter der übersetzten Stimme.

Dauer :

Tippe auf die Person, die im Bild bleiben soll

Vorschau

Zielformat

Möchtest du eine kleinere Videodatei?

Eigene Größe (Pixel)

× px

Bildausschnitt

Person, der gefolgt wird

Hintergrund

Weitere Einstellungen

Fester Ausschnitt

Die Kamera bewegt sich innerhalb einer Einstellung nicht

Bild stabilisieren

Mindert Verwackeln — im fertigen Video sichtbar

Schwarze Balken behalten

Standardmäßig werden sie automatisch entfernt

Verzerren zum Füllen

Nichts wird abgeschnitten, das Bild wird gedehnt

Geteilter Bildschirm, wenn zwei Personen sprechen

Jede Person bekommt eine Bildhälfte, oben und unten. Aus: Ein einziger Ausschnitt folgt der sprechenden Person.

Auflösung

Automatisch: die beste Qualität, die dein Tarif ermöglicht

Hintergrund wird hochgeladen…

Transparenter Export (ProRes .mov mit Alpha). Reserviert für den Pass oder einen Pro-Tarif; die Vorschau wird auf einem Schachbrettmuster angezeigt.

Ziehen · Skalieren · Drehen
Platzierung
Text
Logo / Bild
Allgemeine Einstellungen
→
optional

Länge des finalen Schnitts

Wonach du suchst

Optional

Wenn du hier etwas eingibst, hat dies Vorrang vor den allgemeinen Kriterien.

Optional

Hilft bei der Auswahl der Passagen. Deine Kurzbeschreibung hat weiterhin Vorrang.

Ausgabeformat

Geteilter Bildschirm, wenn zwei Personen sprechen

Jede Person bekommt eine Bildhälfte, oben und unten. Aus: Ein einziger Ausschnitt folgt der sprechenden Person.

Untertitel inklusive

Untertitel-Stil

Sprache wird erkannt … die Untertitel-Vorschau ist in wenigen Sekunden bereit.

In diesem Video wurde keine Sprache erkannt: Es gibt keine Untertitel zur Vorschau.

Die Vorschau ist derzeit nicht verfügbar. Du kannst Clips mit aktivierten Untertiteln erstellen; eventuelle Fehler werden gemeldet.

Die Untertitelvorschau ist vorübergehend nicht verfügbar, da das Tageslimit erreicht wurde. Du kannst Clips weiterhin zum üblichen Analysepreis erstellen.

Melde dich bei deinem kostenlosen Konto an, um eine Untertitelvorschau anzusehen.

Schnittstärke

Umgang mit Pausen

Übergang

Außerdem

Auch Füllwörter entfernen

„Äh“, „ähm“ und Fehlstarts

Hintergrundgeräusche entfernen

Rauschen, Klimaanlage, Straßenlärm

Keywords (optional)

Video zum Aktivieren drehen oder spiegeln.

Ausgabeformat wählen

MP4 läuft überall. Passe es an deine Bedürfnisse an.

Erhalte eine E-Mail, sobald es fertig ist.

Dein Video kommt

Es erscheint hier, sobald es bereit ist.

Hashtags in die Zwischenablage kopiert – füge sie in deinen Beitrag ein!

War Klipa nützlich? Gib uns 30 Sekunden deiner Zeit — hinterlasse eine Bewertung auf Trustpilot.

War Klipa nützlich? Gib uns 30 Sekunden deiner Zeit — hinterlasse eine Bewertung auf Trustpilot.


                                        

War Klipa nützlich? Gib uns 30 Sekunden deiner Zeit — hinterlasse eine Bewertung auf Trustpilot.

Vorher Nachher

Format Länge Größe Qualität Gespart Entfernte Zeit Schnitte ✓ Ohne Logo für dieses Video freigeschaltet

Abonnenten haben Vorrang.

Erhalte eine E-Mail, sobald es fertig ist.

Jetzt abbrechen? Die bereits geleistete Arbeit geht verloren und die Datei muss erneut hochgeladen werden.

So wird dein Video heruntergeladen.

Was passt nicht?

Immer noch zu dunkel?

Wir starten erneut mit Ihrem Originalvideo und hellen es stärker auf. Ohne Credits.

Lieber ein schärferes Bild?

Kostenloser Test mit 10 Sekunden deines Videos. Du zahlst nur, wenn dir das Ergebnis gefällt.

War Klipa nützlich? Gib uns 30 Sekunden deiner Zeit — hinterlasse eine Bewertung auf Trustpilot.

Dein Video ohne Logo wird vorbereitet… Der Download startet automatisch.

Untertitel (.srt) separate Datei

Kostenlos Google 1-Klick Keine Kreditkarte
Erst verstehen

Von der Aufnahme zum lesbaren Text, Satz für Satz

Audio zu Text ist der schnellste Weg, die Worte aus einer Aufnahme zu holen. Sie laden eine MP3, ein Sprachmemo, ein Interview, eine Vorlesung oder eine Podcast-Folge hoch und erhalten geschriebenen Text zurück, mit der Uhrzeit jedes Satzes daneben. Kein Mitschreiben während der Wiedergabe, kein Anhalten alle zehn Sekunden, um einen Namen zu verstehen.

Welche Audiodateien Sie verwenden können

Die Seite nimmt MP3-, WAV-, M4A-, AAC-, OGG- und FLAC-Dateien mit jeweils bis zu 2 GB an. M4A ist auf dem Smartphone das wichtigste Format: Auf dem iPhone aufgenommene Sprachmemos sind M4A-Dateien und lassen sich daher direkt verwenden. Auch Videodateien funktionieren (MP4, MOV, AVI, MKV, WebM, 3GP, FLV, WMV), was hilft, wenn die einzige Kopie einer Besprechung eine Bildschirmaufnahme ist. Eine Einschränkung sollten Sie vor dem Start kennen: Audio im Opus-Format, in dem manche Messenger ihre Sprachnachrichten speichern, wird nicht akzeptiert. Wandeln Sie es zuerst in MP3 oder M4A um.

Was Sie zurückbekommen

Die gesprochene Sprache wird automatisch erkannt, Sie müssen also nichts einstellen. Der Text kommt satzweise getrennt heraus, und jeder Satz trägt seine Startzeit, sodass Sie eine Stelle in der Aufnahme erreichen, ohne alles anzuhören. Alles steckt in einer einzigen ZIP-Datei: eine einfache Textdatei zum Lesen, Zitieren oder Einfügen in ein Dokument sowie SRT- und VTT-Dateien, die Untertitelformate, die Videoschnittprogramme und Player verstehen. Wenn mehrere Personen sprechen, können Sie die Sprechererkennung einschalten, und der Text zeigt, wer was sagt. Schwierige Namen vorab einzugeben hilft bei der Erkennung seltener Wörter.

Was diese Seite nicht kann

Sie transkribiert eine fertige Datei, kein Live-Gespräch: Es gibt keinen Mikrofonmodus, der mitschreibt, während jemand spricht. Sie fasst auch nichts zusammen und schreibt nichts um, Sie erhalten also die Worte, die tatsächlich gesagt wurden, und entscheiden selbst, was Sie behalten. Die Genauigkeit hängt zudem von der Aufnahme ab. Eine klare Stimme nahe am Mikrofon liefert den saubersten Text, während Musik, ein hallender Raum oder ein Telefon, das quer über dem Tisch liegt, ihn verschlechtert. Ist Ihre Datei verrauscht, bereinigen Sie zuerst den Ton und transkribieren Sie sie danach.

Kostenlos testen

Das Ausprobieren kostet nichts: Es werden 20 Credits geschenkt, das Ergebnis trägt kein Wasserzeichen, und Sie brauchen keine Bankkarte. Längere Dateien werden mit den Tarifen Pro und Studio verarbeitet.

Beispielergebnis — Audio zu Text: MP3 und Sprachmemos mit KI transkribieren
Das Ergebnis spricht für sich

Das liefert das Tool

So funktioniert's

Wie du Audio in 3 Schritten in Text umwandelst

Schritt 1

Audiodatei hinzufügen

Ziehe eine MP3-, WAV-, M4A-, AAC-, OGG- oder FLAC-Aufnahme mit bis zu 2 GB hinein. Eine Videodatei mit Tonspur funktioniert ebenfalls.

Schritt 2

Transkription starten

Du musst nichts zur Sprache einstellen. Wenn mehrere Personen sprechen, aktiviere die Sprechererkennung und gib ungewöhnliche Namen an, damit sie richtig geschrieben werden.

Schritt 3

Text speichern

Lade eine ZIP-Datei mit dem reinen Text sowie den SRT- und VTT-Versionen herunter. Lies ihn, kopiere ihn in ein Dokument oder nutze die zeitgesteuerten Zeilen als Untertitel.

Warum Klipa

Warum du Klipa für die Audio-zu-Text-Umwandlung nutzen solltest

Vorteil — Audio zu Text: MP3 und Sprachmemos mit KI transkribieren

Die Sprache wird für dich erkannt

Du musst vorab keine Sprache auswählen. Das Tool erkennt automatisch, was gesprochen wird – darunter Deutsch, Englisch, Französisch, Spanisch, Arabisch und Mandarin – und gibt dir sofort Bescheid, falls eine Sprache nicht unterstützt wird. Auch gemischte Aufnahmen lassen sich so unkompliziert handhaben.

Vorteil — Audio zu Text: MP3 und Sprachmemos mit KI transkribieren

Jeder Satz hat seine Zeit

Der Text wird in Sätze unterteilt, jeweils mit der Startzeit in der Aufnahme versehen. Das macht ein zweistündiges Interview durchsuchbar: Du findest die gesuchte Antwort, notierst die Zeit und springst im Original direkt dorthin, ganz ohne langes Vor- und Zurückspulen.

Vorteil — Audio zu Text: MP3 und Sprachmemos mit KI transkribieren

Drei Dateien in einem Download

Eine einzige ZIP-Datei enthält den Klartext zum Lesen und Zitieren sowie SRT- und VTT-Dateien für Untertitel. Du musst dich vor dem Upload nie für ein Format entscheiden, und die Dateien sind sauber, ohne hinzugefügtes Wasserzeichen.

Vorteil — Audio zu Text: MP3 und Sprachmemos mit KI transkribieren

Wer hat was gesagt

Bei einem Meeting, einer Diskussionsrunde oder einem Interview trennt die Sprechererkennung die Stimmen und beschriftet jede einzelne im Text. Du kannst die Anzahl der Teilnehmer angeben oder das Tool zählen lassen, damit selbst ein langes schriftliches Protokoll übersichtlich und leicht zu teilen bleibt.

Echte Fälle

Wann Audio zu Text nützlich ist

Ein Interview für einen Artikel

Ein Journalist oder Student nimmt ein Gespräch auf, lädt die M4A- oder MP3-Datei hoch und erhält den vollständigen Text mit Zeitangaben. Zitate lassen sich so in Sekundenschnelle mit der Aufnahme abgleichen, statt alles noch einmal anzuhören.

Eine Sprachnotiz von deinem Handy

Du sprichst beim Spaziergang eine Idee ein und willst sie direkt als Notiz haben. Die iPhone-Sprachmemo ist eine M4A-Datei, wird also einfach so hochgeladen und kommt als Text zurück, den du in deine Notizen oder eine E-Mail einfügen kannst.

Eine Podcast-Episode als Show-Notizen

Verwandle eine Episode in Text, um selbst eine Zusammenfassung zu schreiben, Zitate herauszuziehen oder eine Seite für Leser zu veröffentlichen. Die Zeitstempel helfen dir, jeden Punkt mit dem Moment im Video zu verknüpfen.

Eine Vorlesung oder ein Online-Kurs

Nimm den Unterricht auf, transkribiere ihn und lerne mit dem Text. Dank der Zeitstempel springst du genau zu der Minute, in der der Lehrer eine knifflige Idee erklärt hat – so geht das Nachbereiten viel schneller als das erneute Anhören.

Ein Meeting mit mehreren Stimmen

Nimm das Gespräch auf, lass die Transkription inklusive Sprechererkennung laufen und teile ein schriftliches Protokoll. Wer nicht dabei sein konnte, liest nach, was beschlossen wurde und wer was gesagt hat.

Weiter mit

Ähnliche Tools

VorbereitenVideo abrufen und das richtige Format erhalten
BearbeitenSchneiden, Ton und Pausen bereinigen
TransformierenVerwandle es in kurze Clips, bereit zur Veröffentlichung
BereichernUntertitel, Übersetzung und Transkription
Häufig gestellte Fragen

Audio in Text: Deine Fragen beantwortet

Gibt es einen kostenlosen Weg, eine Aufnahme in Text umzuwandeln?

Ja, du kannst es kostenlos ausprobieren. Dir werden 20 Credits zum Testen des Tools zur Verfügung gestellt, und die Dateien, die du herunterlädst, haben kein Wasserzeichen. Die kostenlose Nutzung hat ein tägliches Limit. Pro- und Studio-Tarife eignen sich für längere Aufnahmen.

Wie extrahiere ich den Text aus einer MP3-Datei?

Ja. MP3 ist neben WAV, M4A, AAC, OGG und FLAC eines der unterstützten Formate. Lade die Datei hoch, starte die Transkription und lade den Text herunter. Jeder Satz enthält die jeweiligen Zeitstempel, und du erhältst zusätzlich SRT- sowie VTT-Versionen in derselben ZIP-Datei.

Wie transkribiere ich eine Sprachnotiz von meinem iPhone?

Auf dem iPhone aufgenommene Sprachmemos sind M4A-Dateien, die diese Seite unterstützt. Teile das Memo auf deinen Computer oder speichere es in deinen Dateien, lade es hier hoch und starte die Transkription. Die Sprache wird automatisch erkannt und der Text erscheint in wenigen Augenblicken.

Kann ich eine WhatsApp-Sprachnachricht transkribieren?

Nicht immer. Im Opus-Format gespeicherte Audios werden nicht akzeptiert, und manche Messaging-Apps speichern Sprachnachrichten so. Wenn deine Datei in einem anderen unterstützten Format wie M4A oder MP3 vorliegt, klappt es. Konvertiere sie andernfalls zuerst in MP3 und lade sie dann hoch.

Funktioniert das auch in anderen Sprachen als Englisch?

Ja. Die gesprochene Sprache wird automatisch erkannt, und es wird eine Vielzahl abgedeckt, darunter Französisch, Spanisch, Arabisch und Mandarin sowie Englisch. Du musst nichts auswählen. Wenn eine Sprache nicht unterstützt wird, teilt das Tool dir das mit, statt zu raten und dir Text in der falschen Sprache auszugeben.

Kann es Live-Sprache während des Sprechens transkribieren?

Nein. Diese Seite funktioniert mit einer Aufnahme, die du bereits gemacht hast: Du lädst die Datei hoch und erhältst den Text. Es ist kein Diktiergerät und hört nicht über das Mikrofon mit. Um es für ein Gespräch zu nutzen, nimm es zuerst auf und lade die Audiodatei danach hoch.

Wird mir angezeigt, wer spricht?

Ja, als Option. Schalte die Sprechererkennung ein und der Text teilt die Teilnehmer auf und markiert jeden Redebeitrag. Du kannst angeben, wie viele Personen sprechen, oder das Tool entscheiden lassen. Das ist praktisch für Interviews, Meetings und Podcasts mit Gästen.

Ist der Text korrekt oder voller Fehler?

Es funktioniert am besten bei einer klaren Aufnahme, bei der Personen nacheinander nah am Mikrofon sprechen. Akzente und Fachvokabular werden meist gut verstanden, aber ein seltener Name kann falsch geschrieben werden – zähle solche Namen am besten vorher auf. Lärm, Musik oder Abstand mindern die Qualität; entferne Störgeräusche am besten zuerst.

Was bekomme ich, wenn es fertig ist?

Eine ZIP-Datei mit drei Dingen: einer einfachen Textdatei, einer SRT-Datei und einer VTT-Datei. Der Text ist in Sätze unterteilt und jeder hat seine Startzeit. Nutze den Text zum Lesen oder Zitieren und die SRT- oder VTT-Datei, wenn du Untertitel für ein Video brauchst.

Wie lange speichert ihr mein hochgeladenes Audio?

Nicht lange. Dateien werden automatisch gelöscht, und Studio speichert sie bis zu 90 Tage lang. Bis dahin kannst du sie nur selbst öffnen und deine Dateien jederzeit wieder herunterladen, bevor sie verschwinden. Längere Aufnahmen bis zu 2 Std. erfordern Pro oder Studio.

Du bist dran

Verwandle deine Aufnahme in Text

Lade eine Audiodatei hoch und erhalte Text mit Zeitstempeln – bereit zum Lesen, Zitieren oder als Untertitel.

Du hast deine Premium-Testversion diesen Monat aufgebraucht. Upgrade auf Pro, um alle Tools uneingeschränkt zu nutzen.

Keine Kreditkarte erforderlich

Zum Schluss

Was du tun kannst, wenn du den Text hast

Der Text ist erst der Anfang. Wenn die Aufnahme verrauscht ist, nutze Hintergrundgeräusche entfernen vor der Transkription, damit die Wörter zuverlässiger erkannt werden. Wie das Tool mit Video und Audio umgeht, erfährst du auf der Seite zur KI-Transkription. Und wenn du die Wörter auf dem Bildschirm willst, dient die SRT-Datei aus deiner ZIP-Datei als Grundlage für Untertitel in einem Video, das du woanders bearbeitest. Der Text liefert dir zudem Zeitangaben, die du Zeile für Zeile gegen die Aufnahme prüfen kannst.

Alle Tools