LLM-Landschaft: Vision raus aus dem Warm-Set (on-demand, ttl 900) + Template=Live-Abgleich
User-Entscheid 07.07.: 'Gehirn + Embedding reichen komplett aus' — die Augen (VL-30B, ~19 GB) werden nur gebraucht, wenn Lucy auf dem Desktop an ist oder die IDE-Lane sie ruft. Warm-Set = nur noch Qwen3.6 + embed; damit passt der 60-GB-Chef-Gutachter (gpt-oss) wieder neben das Hirn. - llama-swap.config.yaml: VL-30B aus brains raus, ttl 0 -> 900 (15 min Nachlauf); Kommentare entstaubt. AUSSERDEM Template<->Live-Drift beendet: Template hatte coder-lite wiederbelebt (live seit 05.07. entfernt) und KV q4_k (lief NIE live) — beides auf Live-Wahrheit (q8_0, kein coder-lite) zurueckgesetzt; Qualitaet vor ein paar GB, RAM-Engpass ist mit der Diaet weg. - warmup.sh: Default 'fast vision' -> 'fast' (Root-Kopie unter /usr/local/bin braucht spaeter einmal sudo cp — bis dahin waermt ein llama-swap-Restart vision einmalig, ttl 900 raeumt es wieder ab) - warmer.py: Docstring auf neues Warm-Set angepasst - Lucy-Seite (eigenes Repo): App waermt die Augen beim Start + alle 10 min, solange sie laeuft — Augen-Lebenszyklus == Lucy-Lebenszyklus Co-Authored-By: Claude Fable 5 <noreply@anthropic.com>
This commit is contained in:
+6
-5
@@ -3,16 +3,17 @@
|
||||
# Anfrage nicht kalt ist (llama-swap lädt sonst lazy bei Bedarf).
|
||||
# Eingehängt als ExecStartPost=-/usr/local/bin/llama-swap-warmup.sh in llama-swap.
|
||||
#
|
||||
# `fast` = das Agent-Hirn (Qwen3.6-35B-A3B), `vision` = die Augen (Qwen3-VL-8B, ttl 0 seit
|
||||
# 03.07. — gehört zum UI-Versprechen „Immer-bereit-Set"), `embed` = das Embedding-Modell
|
||||
# (Qwen3-Embedding-0.6B, für Mem0/Gedächtnis). Alle in der brains-Gruppe (persistent), werden
|
||||
# aber NICHT automatisch zusammen geladen — jedes Modell einzeln anstoßen, sonst bleibt es kalt.
|
||||
# `fast` = das Agent-Hirn (Qwen3.6-35B-A3B), `embed` = das Embedding-Modell
|
||||
# (Qwen3-Embedding-0.6B, für Mem0/Gedächtnis). Die Augen (vision/VL-30B) sind seit 07.07.
|
||||
# ON-DEMAND (User-Entscheid) und gehören NICHT mehr ins Warm-Set — die Lucy-App wärmt sie
|
||||
# beim Start selbst an. Modelle werden NICHT automatisch zusammen geladen — jedes einzeln
|
||||
# anstoßen, sonst bleibt es kalt.
|
||||
# Embedding läuft im --embedding-Modus → anderer Endpunkt (/v1/embeddings, nicht chat).
|
||||
# Selbst-detachend: blockiert den Service-Start nicht.
|
||||
# NACH ÄNDERUNG: sudo cp deploy/warmup.sh /usr/local/bin/llama-swap-warmup.sh (root-Kopie!)
|
||||
set -u
|
||||
URL="${MC_LLAMA_SWAP_URL:-http://127.0.0.1:8080}"
|
||||
BRAINS="${MC_WARMUP_MODELS:-fast vision}"
|
||||
BRAINS="${MC_WARMUP_MODELS:-fast}"
|
||||
EMBEDS="${MC_WARMUP_EMBED:-embed}"
|
||||
|
||||
if [ "${1:-}" != "--inner" ]; then
|
||||
|
||||
Reference in New Issue
Block a user