diff --git a/deploy/llama-swap.config.yaml b/deploy/llama-swap.config.yaml index d9b2422..b730298 100644 --- a/deploy/llama-swap.config.yaml +++ b/deploy/llama-swap.config.yaml @@ -26,7 +26,7 @@ models: # nativem Multimodal-Support (mmproj-BF16) und Tool-Calling via --jinja. # Unser neuer Haupt-Coder mit 262k Kontext, Thinking Mode und extrem sauberer Code-Qualität. cmd: | - llama-server -m /srv/models/Qwen3.8-27B-GGUF/Qwen3.8-27B-Q4_K_M.gguf --host 127.0.0.1 --port ${PORT} -c 131072 -ngl 999 -fa on --no-mmap --mmproj /srv/models/Qwen3.8-27B-GGUF/mmproj-BF16.gguf --jinja --parallel 2 -cram 16384 -ctk q8_0 -ctv q8_0 + llama-server -m /srv/models/Qwen3.8-27B-GGUF/Qwen3.8-27B-Q4_K_M.gguf --host 127.0.0.1 --port ${PORT} -c 131072 -ngl 999 -fa on --no-mmap --mmproj /srv/models/Qwen3.8-27B-GGUF/mmproj-BF16.gguf --jinja --parallel 1 -cram 16384 -ctk q8_0 -ctv q8_0 ttl: 5400 aliases: - coder @@ -34,7 +34,9 @@ models: in: [text, image] out: [text] tools: true - context: 65536 + # --parallel 1 = der Coder bekommt den ganzen Slot (34a9862, am laufenden Prozess + # gegengeprueft). Er hat nur einen Verbraucher; Lucy/explore nutzen hermes, review heavy. + context: 131072 Muse-Glimmer-30B: # Meta Muse Glimmer 30B: Dichtes 30B-Agenten-Modell mit DFlash-Speculative-Drafting # und 1.8B Perception Multimodal Projector. Ideal als Runtime-Debugger & Fehler-Diagnostiker.