BATS - Speech2Player âś‚

Im langen Clip die eine Zeile Dialog finden, den passenden Moment heranzoomen, IN und OUT von Hand nachstellen – das kann schnell zu mühsamer Sucharbeit im Player werden. Cut by Text (auch Speech2Player genannt) dreht den Ablauf um: Der BAT Server transkribiert die Audio-Spur des Clips mit der Whisper-KI bis auf Wort-Ebene und öffnet danach einen Transkript-Tab im EDIUS Player. Sie markieren dort einfach mit der Maus den gewünschten Text – der Player öffnet den Clip an der entsprechenden Stelle und setzt automatisch die passenden IN-/OUT-Punkte. Optional wird der Ausschnitt im Player automatisch (im Loop) abgespielt, damit Sie ihn sofort prüfen können.

So funktioniert es

Der Workflow besteht aus drei Schritten:

  1. Transkription im Hintergrund: Der BAT Server extrahiert die Audio-Spur des ausgewählten Clips und lässt die Whisper-Engine jedes Wort mit exakter Zeitposition erkennen. Das Ergebnis ist eine SRT-Datei (eine Zeile pro Wort), die mit dem Suffix _stt-tabui neben der Quelldatei gespeichert wird. Liegt diese Datei bereits vor – z. B. aus einem früheren Lauf –, wird die Transkription übersprungen und das Ergebnis direkt wieder verwendet.
  2. Transkript-Tab im Player: Ist der Job abgeschlossen, öffnet BATS automatisch einen Tab im EDIUS Player und zeigt dort das vollständige Transkript. Jedes Wort ist mit seiner exakten Zeitposition verknüpft. Pausen im Sprechrhythmus werden sichtbar: kurze Pausen (über 0,5 s) als gestrichelter Hinweis im Text, längere Pausen (über 3 s) als Zeilenumbruch – so finden Sie sich im Text sofort zurecht.
  3. Vom Text zur Marke: Sie markieren im Transkript den gewünschten Auszug – ein einzelnes Wort, einen Satz oder einen ganzen Absatz. BATS übersetzt die Auswahl in die zugehörige Zeitspanne, öffnet den Clip im EDIUS Player und setzt IN und OUT automatisch auf das markierte Textsegment. Ist im Tab die Option Loop Play aktiviert, spielt der Player den Ausschnitt direkt automatisch im Loop ab. Anschließend justieren Sie die IN-/OUT-Punkte bei Bedarf noch um ein paar Frames nach – oder ziehen den Clip mit den gesetzten Punkten direkt in die Timeline.

Wenn Sie zwischendurch einen anderen Tab öffnen und später zu dem Transkript-Tab zurückwechseln, öffnet BATS den Clip automatisch wieder im Player an der markierten Stelle.

So nutzen Sie es

Einmalig: Das Preset anlegen

  1. Rechtsklick auf einen Clip im BIN und „Add function…“ wählen – das öffnet das Add-in-Panel des BAT Servers, in dem die vorinstallierten Extensionen auswählbar sind.
  2. Das Cut-by-Text-Preset auswählen – es gibt je eine Variante für die Intel-Engine (berechnet auf Intel NPU, Intel GPU oder CPU) und die Nvidia-Engine (Whisper-Faster auf der Nvidia-GPU).
  3. Im Assistenten festlegen: Sprache (Spracherkennung automatisch oder eine bestimmte Sprache), Hardware für die Berechnung, Modellgröße, wo der Menüeintrag erscheinen soll (BIN oder Timeline) und der Name des Presets (Standard z. B. „Tab English, Model Medium, CPU“).

Pro Clip: transkribieren und markieren

  1. Rechtsklick auf den Clip – im Kontextmenü erscheint das Preset unter dem Unterpunkt Cut by Text. Im Standard-Setup ist das Preset für Audio-Clips im BIN registriert.
  2. Das Preset starten. Der BAT Server führt den Job aus (Fortschritt im BAT-Server-Panel) – bei vorhandenem SRT wird direkt der Tab geöffnet, ohne zu transkribieren.
  3. Im geöffneten Transkript-Tab den gewünschten Text markieren – der Player setzt IN/OUT auf dem Clip entsprechend, und mit aktivierter Loop Play-Option spielt er den Ausschnitt im Loop ab.
  4. Bei Bedarf die IN-/OUT-Punkte feinjustieren und den Clip in die Timeline ziehen.

Optionen

Die Engines

  • Nvidia (Whisper-Faster): Läuft auf der Nvidia-GPU und ist besonders schnell. UnterstĂĽtzt die Modelle Tiny bis Large (V3) sowie das sehr schnelle Turbo-Modell. Zusätzlich kann die Hochpräzisions-Option float16 aktiviert werden – sie ist auf GPUs der RTX-5000-Serie und neuer erforderlich.
  • Intel (OpenVINO Whisper): Wird je nach System auf der Intel NPU, der Intel GPU oder der CPU (auch AMD) ausgefĂĽhrt – also auch ohne dedizierte Nvidia-Karte. UnterstĂĽtzt die Modelle Tiny bis Large (V3).

Modellgrößen: Von Tiny (sehr schnell, grobe Genauigkeit) über Base, Small und Medium bis Large (V2/V3) (höchste Genauigkeit, längere Berechnungszeit) – plus Turbo bei der Nvidia-Engine. Medium ist für die meisten Einsätze die empfohlene Wahl; bei schwierigerem oder leiserem Audio lohnt sich Large.

Sprache: Entweder automatisch erkennen lassen oder eine Sprache festlegen – über 90 Sprachen sind verfügbar (u. a. Deutsch, Englisch, Französisch, Spanisch, Japanisch, Koreanisch …). Da die Sprache pro Preset festgelegt wird, lassen sich einfach mehrere Presets anlegen – eines pro Sprache.

Wichtige Hinweise

  • Die SRT-Datei wird mit dem Suffix _stt-tabui neben der Quelldatei gespeichert und bei jedem erneuten Lauf des Presets wiederverwendet – ein wiederholter Aufruf ist daher sofort erledigt. Hat sich der Audio-Inhalt des Clips geändert, sollten Sie die SRT-Datei löschen, damit eine frische Transkription erfolgt.
  • Pro Datei kann jeweils nur ein Transkript-Tab offen sein: Wird fĂĽr dieselbe Datei ein zweiter Tab gestartet, zeigt BATS eine Hinweissseite („Instance Already Running“) und bringt den vorhandenen Tab nach vorn.
  • Ăśber den Button „Open in Edge Browser“ lässt sich der Tab zusätzlich in einem Edge-Fenster öffnen – praktisch, wenn die eingebettete Ansicht im Player zu klein fĂĽr den Transkript-Text ist.
  • Die Loop Play-Option (Checkbox im Tab) am besten vor der Textauswahl aktivieren – dann spielt der Player die markierte Stelle im Loop ab, andernfalls nur einmal durch.

Preset verwalten

Die angelegten Presets erscheinen im Kontextmenü der Clips unter dem Unterpunkt „Cut by Text“ mit ihrem gewählten Namen. Sie können die Einträge umbenennen, vorübergehend deaktivieren oder löschen und jederzeit weitere Varianten anlegen – zum Beispiel je eine pro Sprache oder Modell. So lassen sich die eigenen Favoriten direkt im Kontextmenü bereithalten.