perf: Warm-Set auf Lucy, Coder, Debugger, Embed und Reranker erweitert
This commit is contained in:
@@ -27,7 +27,7 @@ models:
|
||||
# Unser neuer Haupt-Coder mit 262k Kontext, Thinking Mode und extrem sauberer Code-Qualität.
|
||||
cmd: |
|
||||
llama-server -m /srv/models/Qwen3.8-27B-GGUF/Qwen3.8-27B-Q4_K_M.gguf --host 127.0.0.1 --port ${PORT} -c 131072 -ngl 999 -fa on --no-mmap --mmproj /srv/models/Qwen3.8-27B-GGUF/mmproj-BF16.gguf --jinja --parallel 2 -cram 16384 -ctk q8_0 -ctv q8_0
|
||||
ttl: 5400
|
||||
ttl: 0
|
||||
aliases:
|
||||
- coder
|
||||
capabilities:
|
||||
@@ -40,7 +40,7 @@ models:
|
||||
# und 1.8B Perception Multimodal Projector. Ideal als Runtime-Debugger & Fehler-Diagnostiker.
|
||||
cmd: |
|
||||
llama-server -m /srv/models/Muse-Glimmer-30B-GGUF/Muse-Glimmer-30B-UD-Q4_K_XL.gguf --host 127.0.0.1 --port ${PORT} -c 65536 -ngl 999 -fa on --no-mmap --mmproj /srv/models/Muse-Glimmer-30B-GGUF/mmproj-kquant.gguf --jinja --spec-type draft-dflash --spec-draft-model /srv/models/Muse-Glimmer-30B-GGUF/dflash-kquant.gguf
|
||||
ttl: 600
|
||||
ttl: 0
|
||||
aliases:
|
||||
- debugger
|
||||
capabilities:
|
||||
@@ -97,3 +97,5 @@ groups:
|
||||
- Qwen3-Embedding-0.6B
|
||||
- Qwen3-Reranker-0.6B
|
||||
- Qwen3.6-35B-A3B
|
||||
- Qwen3.8-27B
|
||||
- Muse-Glimmer-30B
|
||||
|
||||
+1
-1
@@ -13,7 +13,7 @@
|
||||
# NACH ÄNDERUNG: sudo cp deploy/warmup.sh /usr/local/bin/llama-swap-warmup.sh (root-Kopie!)
|
||||
set -u
|
||||
URL="${MC_LLAMA_SWAP_URL:-http://127.0.0.1:8080}"
|
||||
BRAINS="${MC_WARMUP_MODELS:-fast}"
|
||||
BRAINS="${MC_WARMUP_MODELS:-fast coder debugger}"
|
||||
EMBEDS="${MC_WARMUP_EMBED:-embed}"
|
||||
# Reranker laufen im --reranking-Modus und antworten NUR auf /v1/rerank — weder Chat noch
|
||||
# Embeddings wecken sie. Solange das hier fehlte, galt der Reranker dem Waechter dauerhaft
|
||||
|
||||
Reference in New Issue
Block a user