Fix: Re-Warm-Waechter + Startup-Warmup folgen dem aktiven Hirn (nicht mehr fix "hermes")
Nach dem Hirn-Wechsel auf fast (Qwen3.6) zeigte der Wächter noch auf "hermes" (Hermes-4-14B) -> er haette das aus dem Warm-Set entfernte Modell wieder geladen. warmer._brain_model() liest jetzt Hermes' model.default (Fallback fast); Startup-Warmup BRAINS default "fast". Passt sich kuenftigen Hirn-Wechseln automatisch an. Co-Authored-By: Claude Opus 4.8 <noreply@anthropic.com>
This commit is contained in:
+5
-5
@@ -1,13 +1,13 @@
|
||||
#!/usr/bin/env bash
|
||||
# Lädt die "brains" (hermes/fast/vision) nach einem llama-swap-(Re)Start vor,
|
||||
# damit die ERSTE Anfrage nicht kalt ist (llama-swap lädt sonst lazy bei Bedarf).
|
||||
# Lädt das warme "brains"-Set nach einem llama-swap-(Re)Start vor, damit die ERSTE
|
||||
# Anfrage nicht kalt ist (llama-swap lädt sonst lazy bei Bedarf).
|
||||
# Eingehängt als ExecStartPost=-/usr/local/bin/llama-swap-warmup.sh in llama-swap.
|
||||
#
|
||||
# Selbst-detachend: der ExecStartPost-Aufruf kehrt sofort zurück (blockiert den
|
||||
# Service-Start NICHT); die eigentliche Aufwärmung läuft entkoppelt im Hintergrund.
|
||||
# `fast` = das Agent-Hirn (Qwen3.6-35B-A3B); Pingen eines brains-Gruppen-Mitglieds lädt die
|
||||
# ganze (ko-residente) Gruppe. Selbst-detachend: blockiert den Service-Start nicht.
|
||||
set -u
|
||||
URL="${MC_LLAMA_SWAP_URL:-http://127.0.0.1:8080}"
|
||||
BRAINS="${MC_WARMUP_MODELS:-hermes fast vision}"
|
||||
BRAINS="${MC_WARMUP_MODELS:-fast}"
|
||||
|
||||
if [ "${1:-}" != "--inner" ]; then
|
||||
setsid "$0" --inner >/dev/null 2>&1 &
|
||||
|
||||
Reference in New Issue
Block a user