Lucy-TTS/F5: Skripte + Batches versionieren, schwere Assets ignoriert
- pocket_server.py (Produktions-TTS mit Stimmen-Waechter), text_norm, Bench-/Diag-Skripte - lucy-f5: f5_server/f5_test/bench_dml (DirectML-Experiment, Phase C/D offen) - .gitignore: venvs/Modelle/Audio/Logs der beiden Ordner + box_recon/gemma_swap-Scratch Co-Authored-By: Claude Fable 5 <noreply@anthropic.com>
This commit is contained in:
@@ -0,0 +1,19 @@
|
||||
# -*- coding: utf-8 -*-
|
||||
"""Whisper-Rücktranskription: WAS sagt die Stimme WIRKLICH? Liest die generierten Wörter, damit man
|
||||
beim Fine-Tunen SEHEN kann, wo Pocket Zahlen/Wörter vermurkst (statt nur zu hören/raten).
|
||||
|
||||
Nutzung: python transcribe.py [ordner-mit-wavs]
|
||||
Default-Ordner: C:\\Users\\TobisPC\\Desktop\\lucy_pocket_tune
|
||||
"""
|
||||
import os, sys, glob
|
||||
import soundfile as sf
|
||||
from faster_whisper import WhisperModel
|
||||
|
||||
DIR = sys.argv[1] if len(sys.argv) > 1 else r"C:\Users\TobisPC\Desktop\lucy_pocket_tune"
|
||||
w = WhisperModel("small", device="cpu", compute_type="int8")
|
||||
for p in sorted(glob.glob(os.path.join(DIR, "*.wav"))):
|
||||
a, sr = sf.read(p)
|
||||
seg, _ = w.transcribe(p, language="de", beam_size=5)
|
||||
txt = " ".join(s.text for s in seg).strip()
|
||||
print(f"[{os.path.basename(p)}] ({len(a)/sr:.1f}s)")
|
||||
print(f" HÖRT WHISPER: {txt}\n")
|
||||
Reference in New Issue
Block a user