Revert "perf: Warm-Set auf Lucy, Coder, Debugger, Embed und Reranker erweitert"

This reverts commit 5d93822a7e.
This commit is contained in:
Hitonabi
2026-08-20 15:52:44 +02:00
parent 5d93822a7e
commit 1a2051e988
2 changed files with 3 additions and 5 deletions
+2 -4
View File
@@ -27,7 +27,7 @@ models:
# Unser neuer Haupt-Coder mit 262k Kontext, Thinking Mode und extrem sauberer Code-Qualität.
cmd: |
llama-server -m /srv/models/Qwen3.8-27B-GGUF/Qwen3.8-27B-Q4_K_M.gguf --host 127.0.0.1 --port ${PORT} -c 131072 -ngl 999 -fa on --no-mmap --mmproj /srv/models/Qwen3.8-27B-GGUF/mmproj-BF16.gguf --jinja --parallel 2 -cram 16384 -ctk q8_0 -ctv q8_0
ttl: 0
ttl: 5400
aliases:
- coder
capabilities:
@@ -40,7 +40,7 @@ models:
# und 1.8B Perception Multimodal Projector. Ideal als Runtime-Debugger & Fehler-Diagnostiker.
cmd: |
llama-server -m /srv/models/Muse-Glimmer-30B-GGUF/Muse-Glimmer-30B-UD-Q4_K_XL.gguf --host 127.0.0.1 --port ${PORT} -c 65536 -ngl 999 -fa on --no-mmap --mmproj /srv/models/Muse-Glimmer-30B-GGUF/mmproj-kquant.gguf --jinja --spec-type draft-dflash --spec-draft-model /srv/models/Muse-Glimmer-30B-GGUF/dflash-kquant.gguf
ttl: 0
ttl: 600
aliases:
- debugger
capabilities:
@@ -97,5 +97,3 @@ groups:
- Qwen3-Embedding-0.6B
- Qwen3-Reranker-0.6B
- Qwen3.6-35B-A3B
- Qwen3.8-27B
- Muse-Glimmer-30B
+1 -1
View File
@@ -13,7 +13,7 @@
# NACH ÄNDERUNG: sudo cp deploy/warmup.sh /usr/local/bin/llama-swap-warmup.sh (root-Kopie!)
set -u
URL="${MC_LLAMA_SWAP_URL:-http://127.0.0.1:8080}"
BRAINS="${MC_WARMUP_MODELS:-fast coder debugger}"
BRAINS="${MC_WARMUP_MODELS:-fast}"
EMBEDS="${MC_WARMUP_EMBED:-embed}"
# Reranker laufen im --reranking-Modus und antworten NUR auf /v1/rerank — weder Chat noch
# Embeddings wecken sie. Solange das hier fehlte, galt der Reranker dem Waechter dauerhaft