Der schnellste zuverlässige Weg, Sätze aus YouTube zu sammeln: Sie übernehmen die vom Ersteller hochgeladenen Untertitel oder transkribieren den Ton mit einem Speech-to-Text-Tool neu, wenn die Untertitel schwach sind. Jeden Satz speichern Sie mit Zeitstempel und Audio und importieren ihn anschließend in Karteikarten für Spaced Repetition. Das geht von Hand mit einer Browser-Erweiterung oder automatisiert per Skript, sobald Sie mehr Material brauchen. In beiden Fällen gilt: Vergleichen Sie den Untertiteltext mit dem gesprochenen Ton, bevor Sie etwas speichern, besonders wenn Sie sich auf berufliche Anforderungen wie die ICAO-Englischprüfung vorbereiten.
Kurz gefasst:
- Vom Ersteller hochgeladene Untertitel sind genauer als automatisch erzeugte und liefern verlässlichere, gleichmäßigere Sätze.
- Die Stapelverarbeitung mit Skripten wie
yt-dlpund Whisper automatisiert das Laden von Untertiteln und die Transkription und spart Zeit, wenn Sie regelmäßig Sätze sammeln.- Sätze, deren Bedeutung durch Ton oder Bild gestützt wird, bleiben besser im Gedächtnis; Ausschnitte von etwa einem Satz Länge verhindern Überlastung.
- Für die Wiederholung braucht eine Karte den vollständigen Satz, das Zielwort, Audio, Übersetzung und Quellenangabe, damit Spaced Repetition wirkt.
- Regelmäßige Tool-Updates und ein kleiner Testdatensatz verhindern, dass die Pipeline bei längerer Nutzung ausfällt.
Inhalt
- Sätze aus YouTube sammeln, ohne Code zu schreiben
- Eine automatisierte Pipeline für die Stapelverarbeitung von Untertiteln
- Welche Sätze es wirklich wert sind, gespeichert zu werden
- Aus gesammelten Sätzen Karten machen, die Sie tatsächlich wiederholen
- Schlechte Untertitel und Asynchronität beheben
- Die Untertitel-Werkzeuge von WordByWord in den Ablauf einbauen
- Sentence Mining in 10 bis 15 Minuten am Tag durchhalten
- Testen Sie WordByWord, um Sätze aus Untertiteln schneller zu sammeln
- Quellen
- FAQ
Sätze aus YouTube sammeln, ohne Code zu schreiben
Die meisten Lernenden brauchen kein Skript. Mit einem Browser und der richtigen Erweiterung haben Sie schon nach einer einzigen Sitzung eine funktionierende Routine für das Sammeln von Sätzen.
- Schalten Sie Untertitel in Ihrer Zielsprache ein oder wechseln Sie zu doppelten Untertiteln, falls das Video sie anbietet, und halten Sie an, sobald ein Satz klar und in sich abgeschlossen ist.
- Kopieren Sie die Zeile samt Zeitstempel mit einer Erweiterung zum Erfassen von Untertiteln oder einem Untertitel-Downloader, statt sie von Hand abzutippen.
- Sichern Sie einen kurzen Audioausschnitt oder einen Screenshot des Bildes, wenn Ihr Tool das kann: Ton und Bildkontext helfen später beim Erinnern.
- Bereinigen Sie den Satz: Füllwörter streichen, alles trennen, was sich über zwei Untertitelzeilen zieht, und eine kurze Erklärung oder Übersetzung ergänzen.
- Versehen Sie die Karte mit Videotitel, Zeitstempel und einer groben Schwierigkeitsangabe, damit Sie sie später wiederfinden oder beim Wiederholen überspringen können.
- Exportieren Sie als CSV, übergeben Sie die Sätze direkt an eine Karteikarten-App mit Importfunktion oder fügen Sie sie von Hand in Ihr Spaced-Repetition-Tool ein.
Ein paar Gewohnheiten sorgen dafür, dass dieser Ablauf Wochen statt Tage durchhält:
- Bevorzugen Sie vom Ersteller hochgeladene Untertitel, wenn das Video beide Varianten bietet: Automatische Untertitel enthalten mehr Transkriptionsfehler.
- Speichern Sie zuerst den Satz in der Zielsprache und ergänzen Sie dann die Erklärung, damit die Karte das Erkennen trainiert, bevor sie sich auf die Übersetzung stützt.
- Halten Sie den Ausschnitt kurz: ein Satz, nicht drei oder vier hintereinander, damit jede Karte eine Bedeutungseinheit abfragt.
- Arbeiten Sie in Stapeln: erst schauen und Kandidatensätze markieren, dann alles in einem Durchgang bereinigen und exportieren, statt ständig zwischen Aufgaben zu wechseln.
Eine Anleitung ohne Code, die genau diesen Ablauf vom Pausieren des Videos bis zum Speichern eines synchronisierten Satzes mit Audio durchgeht, finden Sie im WordByWord-Leitfaden zum Sammeln von Sätzen aus Untertiteln.
Tipp: Nehmen Sie pro Video fünf oder sechs Kandidatensätze statt des ganzen Transkripts. Sie bereinigen und exportieren schneller und arbeiten Ihre Wiederholungsliste tatsächlich ab.
Eine automatisierte Pipeline für die Stapelverarbeitung von Untertiteln
Sobald Sie wöchentlich aus mehreren Kanälen sammeln oder eine Sprache lernen, für die gute Untertitel selten sind, spart eine Skript-Pipeline spürbar Zeit. Die Bausteine sind in Open-Source-Projekten gut erprobt.
- Laden Sie Untertitelspuren mit
yt-dlpoder über die YouTube-API und bevorzugen Sie vom Ersteller hochgeladene Untertitel, wenn beide vorhanden sind: Die automatischen Untertitel von YouTube sind maschinell erzeugt und schwanken in der Genauigkeit. - Fehlen Untertitel oder sind sie offensichtlich falsch, erzeugen Sie mit einem Speech-to-Text-Modell wie Whisper ein neues Transkript mit Zeitstempeln; Projekte wie whisper-jax zeigen, wie zeitlich ausgerichtete Ausgaben üblicherweise eingerichtet werden.
- Wenden Sie vor dem Aufteilen in Sätze eine sprachspezifische Tokenisierung an: Naives Trennen an Satzzeichen scheitert etwa im Japanischen, das Satzgrenzen anders markiert als das Englische.
- Führen Sie einen Bereinigungsdurchgang über den ganzen Stapel aus: Füllwörter entfernen, Zeichensetzung vereinheitlichen, doppelte oder fast gleiche Zeilen löschen, bevor Sie etwas verpacken.
- Exportieren Sie den bereinigten Satz als CSV oder als
.apkg-Datei für den direkten Import in Anki und behalten Sie Zeitstempel und Quellvideo bei jeder Karte.
Das Open-Source-Projekt amfajar/sentence-miner ist ein brauchbarer Ausgangspunkt: Es lädt YouTube-Untertitel, setzt für zuverlässiges Parsen vom Ersteller hochgeladene Untertitel voraus und exportiert das Ergebnis nach Anki. Es macht außerdem zwei praktische Einschränkungen sichtbar, die Sie einplanen sollten: Automatische Untertitel sind für die meisten Pipelines zu ungenau, und das Tool hängt davon ab, dass yt-dlp mit den Änderungen von YouTube Schritt hält. Behandeln Sie beides als Wartungsaufgabe, nicht als einmalige Einrichtung. Wer auf einem solchen Tool aufbaut, prüft Updates vor der Sitzung und nicht erst, wenn sie fehlschlägt.
Tipp: Halten Sie einen kleinen Testdatensatz aus fünf Videos mit bekannt guten Untertiteln bereit. Lassen Sie ihn nach jedem Tool-Update laufen, damit eine defekte Pipeline auffällt, bevor Sie einen Abend daran verlieren.
Welche Sätze es wirklich wert sind, gespeichert zu werden
Nicht jeder unbekannte Satz verdient eine Karte. Die Forschung zu Videos mit Untertiteln weist auf ein engeres, nützlicheres Ziel hin.
- Speichern Sie Sätze, die Sie mit Hilfe von Ton oder Bildkontext verstehen können, nicht solche, die nur mit offenem Wörterbuch Sinn ergeben.
- Bevorzugen Sie Mehrwortausdrücke und natürliche Kollokationen gegenüber einzelnen, isolierten Wörtern: Sie tragen mehr von der tatsächlichen Struktur der Sprache.
- Begrenzen Sie die Sitzung auf wenige Sätze, statt alles Unbekannte zu speichern, was Sie hören.
- Nutzen Sie Untertitel in der Zielsprache, wenn es ums Erkennen der Form geht, und heben Sie zweisprachige Untertitel für die Momente auf, in denen sich die Bedeutung ohne sie wirklich nicht erschließt.
- Vermerken Sie bei jeder Karte, warum Sie sie gespeichert haben: ein Grammatikmuster, eine häufige Wendung, eine ungewöhnliche Wortstellung. So hat die spätere Wiederholung Kontext.
Eye-Tracking-Forschung zum Sehen mit Untertiteln zeigt, dass Untertitel die Synchronität von Text und Ton erhöhen und Lernenden helfen, Gehörtes mit Gelesenem zu verbinden. Zweisprachige oder muttersprachliche Untertitel führen dagegen oft dazu, dass Zuschauer vorauslesen oder den Text in der Zielsprache ganz überspringen. Diesen Kompromiss sollten Sie kennen, bevor Sie bei jedem Video standardmäßig doppelte Untertitel einschalten; ein Leitfaden zu doppelten Untertiteln auf YouTube erklärt, wann welches Format tatsächlich hilft.
Untertitel verbessern die Synchronität von Text und Ton, garantieren aber für sich allein kein Erinnern. Eine Langzeitstudie im Unterricht ergab, dass untertitelter Input das Erkennen der Form fördert, das Erinnern der Bedeutung jedoch weiterhin von gezieltem Abrufen im Anschluss abhängt. Den Satz zu sammeln ist nur der erste Schritt.
Aus gesammelten Sätzen Karten machen, die Sie tatsächlich wiederholen
Ein gesammelter Satz wird erst nützlich, wenn er zu einer Karte mit den richtigen Feldern und einem Wiederholungsplan wird.
- Bauen Sie jede Karte aus dem vollständigen Satz in der Zielsprache, einer Lücke oder einem hervorgehobenen Zielwort, einem kurzen Audioausschnitt, einer einzeiligen Erklärung in Ihrer Muttersprache und dem Quellvideo mit Zeitstempel.
- Nutzen Sie das Abrufen des ganzen Satzes für neue Grammatikmuster, die Sie noch zu erkennen lernen, und wechseln Sie zu Lückentexten, sobald Sie die Satzstruktur kennen und nur noch das Zielwort brauchen.
- Importieren Sie die bereinigten Sätze per CSV in Anki oder legen Sie sie direkt in einem Tool wie den Karteikarten-Sammlungen von WordByWord ab, wo Sie ohne separaten Importschritt sofort wiederholen können.
- Wiederholen Sie in kurzen täglichen Sitzungen und verwenden Sie die Zeit vor allem fürs aktive Abrufen: das fehlende Wort tippen oder die Übersetzung laut sagen, statt die Karte passiv noch einmal zu lesen.
Eine Karte mit ganzem Satz eignet sich gut für ein neues Muster: „Il a fini par accepter“ prüft, ob Sie die idiomatische Struktur als Ganzes erkennen. Eine Lückenkarte funktioniert besser, wenn das Muster vertraut ist: „Il a fini ___ accepter“ fragt nur die Präposition ab. Der Wechsel zwischen beiden Formaten verhindert, dass die Wiederholung eintönig wird.
Tipp: Sagen Sie das fehlende Wort oder die Übersetzung laut, bevor Sie die Karte umdrehen. Dieser eine Schritt macht aus einer Erkennungsübung eine Produktionsübung, und das ist die schwierigere und dauerhaftere Fähigkeit.

Schlechte Untertitel und Asynchronität beheben
Ein paar wiederkehrende Probleme verursachen den größten Teil des Frusts beim Sammeln, und für die meisten gibt es schnelle Lösungen.
- Prüfen Sie in den Untertiteleinstellungen des Videos, ob die Untertitel automatisch erzeugt oder vom Ersteller hochgeladen wurden; Ersteller-Untertitel sind fast immer zuverlässiger und sollten Vorrang haben.
- Verschieben Sie die Untertitel um einen kleinen Zeitversatz, wenn die Zeilen dem Ton dauerhaft hinterherhinken oder vorauslaufen; die meisten Erweiterungen zum Erfassen von Untertiteln haben genau dafür einen manuellen Regler.
- Wechseln Sie zur Neutranskription mit Whisper oder lassen Sie den Clip ganz aus, wenn Sprecher sich überlagern oder Hintergrundgeräusche den Ton schwer verständlich machen.
- Als grobe Richtlinie: Wenn Sie nicht etwa 70 % des Tons sicher verstehen, transkribieren Sie neu oder wählen einen sauberen Clip, statt den Satz zu erzwingen.
- Verwenden Sie gespeicherte Clips nur für Ihr privates Lernen. Die öffentliche Weiterverbreitung urheberrechtlich geschützter Videoinhalte ist eine eigene Frage mit eigenen Regeln.
Die Untertitel-Werkzeuge von WordByWord in den Ablauf einbauen
Die Schritte oben funktionieren mit jedem Browser und jeder Karteikarten-App. WordByWord fasst die meisten davon in einem Durchgang durch ein YouTube-Video zusammen.
- Prüfen Sie das Verständnisniveau des Videos, bevor Sie sich darauf einlassen, damit Sie vor dem Start ungefähr wissen, welchen Anteil des Wortschatzes Sie bereits kennen.
- Schalten Sie einen Modus ein, der unbekannte Wörter direkt in den Untertiteln hervorhebt, von unbekannt bis gemeistert, statt zu raten, bei welchen Zeilen sich das Anhalten lohnt.
- Installieren Sie die Chrome-Erweiterung, um ein Wort oder eine Wendung in einem YouTube-Untertitel mit einem Klick zu übersetzen und den Satz direkt in einer Sammlung zu speichern.
- Importieren Sie vorhandene Kartensätze als CSV oder exportieren Sie Ihre WordByWord-Sammlungen als CSV, PDF oder Anki-Deck, damit Ihre gesammelten Sätze nicht in einem Tool eingeschlossen sind.
- Wiederholen Sie gespeicherte Sätze in Trainingsmodi wie Tippen, Satzbau und Hören, alle nach Spaced Repetition geplant.
| Aufgabe | Wo das in WordByWord passiert |
|---|---|
| Schwierigkeit des Videos vor dem Ansehen einschätzen | Verständnisniveau |
| Unbekannte Wörter in Untertiteln erkennen | Spotlight-Modus |
| Einen Satz übersetzen und speichern | Chrome-Erweiterung, ein Klick |
| Gesammelte Sätze importieren oder exportieren | CSV-Import; Export als CSV, PDF und Anki |
| Mit aktivem Abrufen wiederholen | Modi Tippen, Satzbau und Hören |
Eine Schritt-für-Schritt-Anleitung für genau diesen Ablauf, vom Öffnen eines YouTube-Videos bis zur fertigen Karte, bietet das WordByWord-Tutorial zum Lernen mit YouTube-Untertiteln.
Sentence Mining in 10 bis 15 Minuten am Tag durchhalten
Sentence Mining scheitert, wenn es zur zweiten Arbeit wird. Arbeiten Sie in Stapeln: Wählen Sie abends zwei oder drei Videos aus, markieren Sie beim Ansehen Kandidatensätze und bereinigen Sie sie am nächsten Morgen in einem kurzen Durchgang. Halten Sie Wiederholung und Sammeln getrennt, mit einem festen Fenster von 10 bis 15 Minuten, damit die Gewohnheit auch eine volle Woche überlebt.
Vermerken Sie beim Speichern gleich, warum eine Zeile wichtig war; dann geht die spätere Sichtung schnell, und Sie müssen keinen Kontext nachlesen, den Sie längst vergessen haben. Und lassen Sie manches unvollkommen. Nicht jeder Untertitel muss neu synchronisiert oder transkribiert werden; sparen Sie diesen Aufwand für die wenigen Sätze auf, die Sie wirklich verwenden.
— WordByWord-Team
Testen Sie WordByWord, um Sätze aus Untertiteln schneller zu sammeln
Wenn Sie YouTube-Videos schon jetzt anhalten, um Sätze von Hand zu kopieren, reduziert WordByWord das auf einen Klick: Wort übersetzen, Satz speichern, und er landet in einer Sammlung, bereit zur Wiederholung.
- Installieren Sie die Chrome-Erweiterung und öffnen Sie ein YouTube-Video mit eingeschalteten Untertiteln.
- Speichern Sie einen Satz aus dem Video in einer neuen Sammlung, um den Ablauf einmal von Anfang bis Ende zu sehen.
- Starten Sie mit Free Forever oder wechseln Sie zu Premium, sobald Sie wissen, welche Wiederholungsmodi zu Ihrer Routine passen.
Quellen
- The integration of auditory and textual input in vocabulary learning from subtitled viewing: An eye-tracking study
- Effects of captioning on video comprehension and incidental vocabulary learning
FAQ
Was bedeutet „Sentence Mining“?
Sentence Mining bezeichnet die Praxis, einzelne Sätze aus Inhalten herauszuziehen, die Sie gerade sehen, lesen oder hören, und jeden davon in eine Karteikarte zum Lernen zu verwandeln. Ziel ist, neue Wörter und Grammatik in einem echten Satz zu lernen statt als isolierten Eintrag auf einer Liste.
Welcher YouTube-Kanal ist für englische Grammatik am besten?
Es gibt keinen Kanal, der für alle passt, denn die richtige Wahl hängt von Ihrem Niveau und dem Grammatikthema ab, an dem Sie arbeiten. Ein Kanal mit klaren, vom Ersteller hochgeladenen Untertiteln und einem Verständnisniveau nahe an Ihrem eigenen ist nützlicher als ein beliebter Kanal mit automatischen, uneinheitlichen Untertiteln.
Wann sollte man mit Sentence Mining im Japanischen anfangen?
Die meisten Lernenden beginnen, sobald sie genug Schrift und Grundgrammatik kennen, um eine Untertitelzeile zu lesen, ohne an jedem Zeichen hängen zu bleiben. Davor funktionieren doppelte Untertitel oder langsamere Videos für Anfänger besser als das Sammeln aus muttersprachlichen Inhalten in voller Geschwindigkeit.
Was ist Sentence Mining im Japanischen?
Die Methode ist dieselbe wie in jeder Sprache: einen klaren Satz aus den Untertiteln nehmen, ihn mit dem Ton abgleichen und mit Erklärung und Zeitstempel speichern. Im Japanischen kommt eine Besonderheit hinzu: Satzgrenzen werden nicht wie im Englischen durch Leerzeichen und Punkte markiert, deshalb ist ein sprachspezifischer Tokenizer wichtiger, wenn Sie den Prozess automatisieren.
Sind die automatischen Untertitel von YouTube genau genug für Sentence Mining?
Automatische Untertitel schwanken in der Qualität und enthalten oft Fehler durch Akzente, Hintergrundgeräusche oder schnelles Sprechen; sie sind brauchbar, sollten aber gegengeprüft werden. Vom Ersteller hochgeladene Untertitel sind in der Regel zuverlässiger, und in den Untertiteleinstellungen des Videos sehen Sie, welche Art Sie gerade vor sich haben.




