Fix: Re-Warm-Waechter + Startup-Warmup folgen dem aktiven Hirn (nicht mehr fix "hermes")

Nach dem Hirn-Wechsel auf fast (Qwen3.6) zeigte der Wächter noch auf "hermes"
(Hermes-4-14B) -> er haette das aus dem Warm-Set entfernte Modell wieder geladen.
warmer._brain_model() liest jetzt Hermes' model.default (Fallback fast); Startup-Warmup
BRAINS default "fast". Passt sich kuenftigen Hirn-Wechseln automatisch an.

Co-Authored-By: Claude Opus 4.8 <noreply@anthropic.com>
This commit is contained in:
Hitonabi
2026-06-27 18:42:26 +02:00
parent 03933ade35
commit 45d635afae
3 changed files with 33 additions and 11 deletions
+27 -5
View File
@@ -23,10 +23,31 @@ log = logging.getLogger(__name__)
ENABLED = os.environ.get("MC_REWARM_ENABLED", "1") != "0"
INTERVAL = int(os.environ.get("MC_REWARM_INTERVAL", "90")) # Sekunden zwischen Checks
MODEL = os.environ.get("MC_REWARM_MODEL", "hermes") # Alias der Rolle
START_DELAY = int(os.environ.get("MC_REWARM_START_DELAY", "25"))
def _brain_model() -> str:
"""Aktives Agent-Hirn = Hermes' model.default (sonst model.model). So wärmt der Wächter
immer das WIRKLICH genutzte Hirn (passt sich Hirn-Wechseln an). Override: MC_REWARM_MODEL."""
forced = os.environ.get("MC_REWARM_MODEL")
if forced:
return forced
try:
from ruamel.yaml import YAML
from config import HERMES_HOME
p = HERMES_HOME / "config.yaml"
if p.exists():
with p.open(encoding="utf-8") as f:
cfg = YAML().load(f) or {}
m = (cfg.get("model") or {}) if isinstance(cfg, dict) else {}
v = m.get("default") or m.get("model")
if v:
return str(v)
except Exception:
log.debug("rewarm: Hirn-Lookup fehlgeschlagen", exc_info=True)
return "fast"
async def _running_empty() -> bool:
async with httpx.AsyncClient(timeout=8.0) as c:
r = await c.get(f"{LLAMA_SWAP_URL}/running")
@@ -34,10 +55,10 @@ async def _running_empty() -> bool:
return not (data.get("running") or [])
async def _warm() -> None:
async def _warm(model: str) -> None:
async with httpx.AsyncClient(timeout=180.0) as c:
await c.post(f"{LLAMA_SWAP_URL}/v1/chat/completions", json={
"model": MODEL, "max_tokens": 1,
"model": model, "max_tokens": 1,
"messages": [{"role": "user", "content": "ping"}],
})
@@ -48,8 +69,9 @@ async def rewarm_loop() -> None:
while True:
try:
if await _running_empty():
log.info("rewarm: Box idle → Hirn '%s' wird vorgewärmt", MODEL)
await _warm()
model = _brain_model()
log.info("rewarm: Box idle → Hirn '%s' wird vorgewärmt", model)
await _warm(model)
except Exception:
log.debug("rewarm: Tick fehlgeschlagen", exc_info=True)
await asyncio.sleep(INTERVAL)