diff --git a/deploy/llama-swap.config.yaml b/deploy/llama-swap.config.yaml index 2ce0606..b8c9ccc 100644 --- a/deploy/llama-swap.config.yaml +++ b/deploy/llama-swap.config.yaml @@ -27,7 +27,7 @@ models: # Unser neuer Haupt-Coder mit 262k Kontext, Thinking Mode und extrem sauberer Code-Qualität. cmd: | llama-server -m /srv/models/Qwen3.8-27B-GGUF/Qwen3.8-27B-Q4_K_M.gguf --host 127.0.0.1 --port ${PORT} -c 131072 -ngl 999 -fa on --no-mmap --mmproj /srv/models/Qwen3.8-27B-GGUF/mmproj-BF16.gguf --jinja --parallel 2 -cram 16384 -ctk q8_0 -ctv q8_0 - ttl: 0 + ttl: 5400 aliases: - coder capabilities: @@ -40,7 +40,7 @@ models: # und 1.8B Perception Multimodal Projector. Ideal als Runtime-Debugger & Fehler-Diagnostiker. cmd: | llama-server -m /srv/models/Muse-Glimmer-30B-GGUF/Muse-Glimmer-30B-UD-Q4_K_XL.gguf --host 127.0.0.1 --port ${PORT} -c 65536 -ngl 999 -fa on --no-mmap --mmproj /srv/models/Muse-Glimmer-30B-GGUF/mmproj-kquant.gguf --jinja --spec-type draft-dflash --spec-draft-model /srv/models/Muse-Glimmer-30B-GGUF/dflash-kquant.gguf - ttl: 0 + ttl: 600 aliases: - debugger capabilities: @@ -97,5 +97,3 @@ groups: - Qwen3-Embedding-0.6B - Qwen3-Reranker-0.6B - Qwen3.6-35B-A3B - - Qwen3.8-27B - - Muse-Glimmer-30B diff --git a/deploy/warmup.sh b/deploy/warmup.sh index 85d0bba..85bddf6 100644 --- a/deploy/warmup.sh +++ b/deploy/warmup.sh @@ -13,7 +13,7 @@ # NACH ÄNDERUNG: sudo cp deploy/warmup.sh /usr/local/bin/llama-swap-warmup.sh (root-Kopie!) set -u URL="${MC_LLAMA_SWAP_URL:-http://127.0.0.1:8080}" -BRAINS="${MC_WARMUP_MODELS:-fast coder debugger}" +BRAINS="${MC_WARMUP_MODELS:-fast}" EMBEDS="${MC_WARMUP_EMBED:-embed}" # Reranker laufen im --reranking-Modus und antworten NUR auf /v1/rerank — weder Chat noch # Embeddings wecken sie. Solange das hier fehlte, galt der Reranker dem Waechter dauerhaft