Files
mission-control-v2/client/lucy-tts/transcribe.py
T
Hitonabi 09a1c98514 Lucy-TTS/F5: Skripte + Batches versionieren, schwere Assets ignoriert
- pocket_server.py (Produktions-TTS mit Stimmen-Waechter), text_norm, Bench-/Diag-Skripte
- lucy-f5: f5_server/f5_test/bench_dml (DirectML-Experiment, Phase C/D offen)
- .gitignore: venvs/Modelle/Audio/Logs der beiden Ordner + box_recon/gemma_swap-Scratch

Co-Authored-By: Claude Fable 5 <noreply@anthropic.com>
2026-07-02 10:29:33 +02:00

20 lines
851 B
Python

# -*- coding: utf-8 -*-
"""Whisper-Rücktranskription: WAS sagt die Stimme WIRKLICH? Liest die generierten Wörter, damit man
beim Fine-Tunen SEHEN kann, wo Pocket Zahlen/Wörter vermurkst (statt nur zu hören/raten).
Nutzung: python transcribe.py [ordner-mit-wavs]
Default-Ordner: C:\\Users\\TobisPC\\Desktop\\lucy_pocket_tune
"""
import os, sys, glob
import soundfile as sf
from faster_whisper import WhisperModel
DIR = sys.argv[1] if len(sys.argv) > 1 else r"C:\Users\TobisPC\Desktop\lucy_pocket_tune"
w = WhisperModel("small", device="cpu", compute_type="int8")
for p in sorted(glob.glob(os.path.join(DIR, "*.wav"))):
a, sr = sf.read(p)
seg, _ = w.transcribe(p, language="de", beam_size=5)
txt = " ".join(s.text for s in seg).strip()
print(f"[{os.path.basename(p)}] ({len(a)/sr:.1f}s)")
print(f" HÖRT WHISPER: {txt}\n")