Fix: Re-Warm-Waechter + Startup-Warmup folgen dem aktiven Hirn (nicht mehr fix "hermes")

Nach dem Hirn-Wechsel auf fast (Qwen3.6) zeigte der Wächter noch auf "hermes"
(Hermes-4-14B) -> er haette das aus dem Warm-Set entfernte Modell wieder geladen.
warmer._brain_model() liest jetzt Hermes' model.default (Fallback fast); Startup-Warmup
BRAINS default "fast". Passt sich kuenftigen Hirn-Wechseln automatisch an.

Co-Authored-By: Claude Opus 4.8 <noreply@anthropic.com>
This commit is contained in:
Hitonabi
2026-06-27 18:42:26 +02:00
parent 03933ade35
commit 45d635afae
3 changed files with 33 additions and 11 deletions
+5 -5
View File
@@ -1,13 +1,13 @@
#!/usr/bin/env bash
# Lädt die "brains" (hermes/fast/vision) nach einem llama-swap-(Re)Start vor,
# damit die ERSTE Anfrage nicht kalt ist (llama-swap lädt sonst lazy bei Bedarf).
# Lädt das warme "brains"-Set nach einem llama-swap-(Re)Start vor, damit die ERSTE
# Anfrage nicht kalt ist (llama-swap lädt sonst lazy bei Bedarf).
# Eingehängt als ExecStartPost=-/usr/local/bin/llama-swap-warmup.sh in llama-swap.
#
# Selbst-detachend: der ExecStartPost-Aufruf kehrt sofort zurück (blockiert den
# Service-Start NICHT); die eigentliche Aufwärmung läuft entkoppelt im Hintergrund.
# `fast` = das Agent-Hirn (Qwen3.6-35B-A3B); Pingen eines brains-Gruppen-Mitglieds lädt die
# ganze (ko-residente) Gruppe. Selbst-detachend: blockiert den Service-Start nicht.
set -u
URL="${MC_LLAMA_SWAP_URL:-http://127.0.0.1:8080}"
BRAINS="${MC_WARMUP_MODELS:-hermes fast vision}"
BRAINS="${MC_WARMUP_MODELS:-fast}"
if [ "${1:-}" != "--inner" ]; then
setsid "$0" --inner >/dev/null 2>&1 &