LLM-Landschaft: Vision raus aus dem Warm-Set (on-demand, ttl 900) + Template=Live-Abgleich
User-Entscheid 07.07.: 'Gehirn + Embedding reichen komplett aus' — die Augen (VL-30B, ~19 GB) werden nur gebraucht, wenn Lucy auf dem Desktop an ist oder die IDE-Lane sie ruft. Warm-Set = nur noch Qwen3.6 + embed; damit passt der 60-GB-Chef-Gutachter (gpt-oss) wieder neben das Hirn. - llama-swap.config.yaml: VL-30B aus brains raus, ttl 0 -> 900 (15 min Nachlauf); Kommentare entstaubt. AUSSERDEM Template<->Live-Drift beendet: Template hatte coder-lite wiederbelebt (live seit 05.07. entfernt) und KV q4_k (lief NIE live) — beides auf Live-Wahrheit (q8_0, kein coder-lite) zurueckgesetzt; Qualitaet vor ein paar GB, RAM-Engpass ist mit der Diaet weg. - warmup.sh: Default 'fast vision' -> 'fast' (Root-Kopie unter /usr/local/bin braucht spaeter einmal sudo cp — bis dahin waermt ein llama-swap-Restart vision einmalig, ttl 900 raeumt es wieder ab) - warmer.py: Docstring auf neues Warm-Set angepasst - Lucy-Seite (eigenes Repo): App waermt die Augen beim Start + alle 10 min, solange sie laeuft — Augen-Lebenszyklus == Lucy-Lebenszyklus Co-Authored-By: Claude Fable 5 <noreply@anthropic.com>
This commit is contained in:
@@ -1,20 +1,21 @@
|
||||
"""
|
||||
Hält das ganze WARM-SET (Hirn + Augen/vision + Gedächtnis/embed) dauerhaft warm.
|
||||
Hält das ganze WARM-SET (Hirn + Gedächtnis/embed) dauerhaft warm. Die Augen (vision/VL-30B)
|
||||
sind seit 07.07. ON-DEMAND (ttl 900, User-Entscheid) und gehören NICHT mehr zum Warm-Set.
|
||||
|
||||
Hintergrund: llama-swap ist EIN-Gruppen-resident — lädt ein on-demand-Modell außerhalb
|
||||
der `brains`-Gruppe, wird die ganze Gruppe verdrängt. `persist: true` verhindert nur
|
||||
Idle-Unload, NICHT die Gruppen-Verdrängung; auch ein `-watch-config`-Reload (jede Config-
|
||||
Änderung/Deploy) verwirft das Set, ohne llama-swaps ExecStartPost-Warmup neu auszulösen.
|
||||
Dieser Wächter schließt die Lücke: ist die Box idle (nichts geladen), lädt er das ganze
|
||||
Set über deploy/warmup.sh nach — NICHT nur das Hirn (sonst blieben Augen+embed kalt, live
|
||||
vom Review-Wächter beobachtet). Während aktiver Last (irgendetwas geladen) hält er sich
|
||||
Set über deploy/warmup.sh nach — Hirn UND embed (sonst bliebe embed kalt, live vom
|
||||
Review-Wächter beobachtet). Während aktiver Last (irgendetwas geladen) hält er sich
|
||||
raus, verdrängt also nie ein gerade genutztes Modell.
|
||||
|
||||
warmup.sh deckt korrekt ab: fast+vision über /v1/chat/completions, embed über /v1/embeddings
|
||||
warmup.sh deckt korrekt ab: fast über /v1/chat/completions, embed über /v1/embeddings
|
||||
(anderer Endpunkt!) und das Vorkauen des ~70-KB-Agent-Prompts. Es ist selbst-detachend.
|
||||
|
||||
Abschaltbar/justierbar via Env: MC_REWARM_ENABLED=0, MC_REWARM_INTERVAL. Welche Modelle
|
||||
warmup.sh lädt: MC_WARMUP_MODELS (Default 'fast vision') + MC_WARMUP_EMBED (Default 'embed').
|
||||
warmup.sh lädt: MC_WARMUP_MODELS (Default 'fast') + MC_WARMUP_EMBED (Default 'embed').
|
||||
"""
|
||||
|
||||
import asyncio
|
||||
|
||||
Reference in New Issue
Block a user