# -*- coding: utf-8 -*- """Whisper-Rücktranskription: WAS sagt die Stimme WIRKLICH? Liest die generierten Wörter, damit man beim Fine-Tunen SEHEN kann, wo Pocket Zahlen/Wörter vermurkst (statt nur zu hören/raten). Nutzung: python transcribe.py [ordner-mit-wavs] Default-Ordner: C:\\Users\\TobisPC\\Desktop\\lucy_pocket_tune """ import os, sys, glob import soundfile as sf from faster_whisper import WhisperModel DIR = sys.argv[1] if len(sys.argv) > 1 else r"C:\Users\TobisPC\Desktop\lucy_pocket_tune" w = WhisperModel("small", device="cpu", compute_type="int8") for p in sorted(glob.glob(os.path.join(DIR, "*.wav"))): a, sr = sf.read(p) seg, _ = w.transcribe(p, language="de", beam_size=5) txt = " ".join(s.text for s in seg).strip() print(f"[{os.path.basename(p)}] ({len(a)/sr:.1f}s)") print(f" HÖRT WHISPER: {txt}\n")