feat(stimme): Lucys echte Stimme auf der Box - pocket-tts 2.1.0 als lucy-stimme.service
Ampel / ampel (push) Successful in 21s

:8650 lieferte ElevenLabs 'Artoria/Saber' = Hermes' Stimme, nicht Lucys (und
Cloud). Jetzt :8021 mit Kyutai pocket-tts, Modell german_24l, geklont aus
ref.mp3 - samt text_norm, Emotions-Presets und Pegel-Abstimmung. Sprachnachricht
als OGG/Opus via ffmpeg. Recherche: pocket ist weiter die richtige Wahl.

Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
This commit is contained in:
Hitonabi
2026-08-21 17:01:23 +02:00
co-authored by Claude Opus 5
parent fa69edc1aa
commit 25dbfb2b61
2 changed files with 83 additions and 5 deletions
+19 -5
View File
@@ -10,17 +10,23 @@
# $1 Textfassung (mit Emojis, Links, Formatierung — geht nach Telegram)
# $2 Sprechfassung (kurz, ohne Links/Emojis — wird vorgelesen)
#
# Stimme: MC2s voice-service auf :8650 — das ist Lucys ECHTE Stimme (Piper/
# Chatterbox, deutsch). Hermes' eingebautes TTS steht auf `edge` mit
# `en-US-AriaNeural` und waere englisch — deshalb hier bewusst nicht benutzt.
# ‼️ STIMME: :8021, nicht :8650.
# :8021 = lucy-stimme.service — Kyutai pocket-tts 2.1.0, Modell `german_24l`,
# Stimme geklont aus ref.mp3. DAS ist Lucy. Laeuft lokal auf der CPU.
# :8650 = MC2s voice-service. Dort sind nur `elevenlabs` und `edge` geladen —
# beides CLOUD, und die Vorgabe ist die ElevenLabs-Stimme
# "Artoria/Saber", also HERMES' Stimme, nicht Lucys. Am 21.08. genau
# damit reingefallen: klang deutsch und weiblich, war aber die falsche.
# Hermes' eingebautes TTS waere `edge`/`en-US-AriaNeural` — englisch.
set -uo pipefail
TEXTDATEI="${1:-/tmp/news-text.md}"
SPRECHDATEI="${2:-/tmp/news-sprich.txt}"
NOTIFY="${NOTIFY:-$HOME/mission-control-v2/deploy/notify.sh}"
VOICE="${VOICE_URL:-http://127.0.0.1:8650}"
VOICE="${VOICE_URL:-http://127.0.0.1:8021}"
HERMES="${HERMES_BIN:-$HOME/.local/bin/hermes}"
TON="/tmp/news-stimme.wav"
TON_OGG="/tmp/news-stimme.ogg"
if [ ! -s "$TEXTDATEI" ]; then
bash "$NOTIFY" -s "[News]" "Der Nachrichtenbericht ist leer geblieben ($TEXTDATEI). Da lief etwas schief."
@@ -49,7 +55,15 @@ if [ "$CODE" != "200" ] || [ ! -s "$TON" ]; then
exit $TEXT_OK
fi
"$HERMES" send --to telegram "MEDIA:$TON" >/dev/null 2>&1 \
# Telegram zeigt eine ECHTE Sprachnachricht (runde Blase, Wellenform) nur bei
# OGG/Opus. Eine WAV kaeme als Dateianhang an — abspielbar, aber eben kein
# Sprachmemo. Deshalb ffmpeg. Mono/48k ist das Format, das Telegram erwartet.
if ! ffmpeg -y -loglevel error -i "$TON" -c:a libopus -b:a 32k -ar 48000 -ac 1 "$TON_OGG" 2>/dev/null; then
echo "[news-melden] ffmpeg-Wandlung fehlgeschlagen — schicke die WAV als Anhang" >&2
TON_OGG="$TON"
fi
"$HERMES" send --to telegram "MEDIA:$TON_OGG" >/dev/null 2>&1 \
|| echo "[news-melden] Sprachdatei liess sich nicht senden — Text ist raus" >&2
exit $TEXT_OK