diff --git a/backend/models_catalog.json b/backend/models_catalog.json index 368266b..c40a219 100644 --- a/backend/models_catalog.json +++ b/backend/models_catalog.json @@ -3,7 +3,7 @@ "version": "2026-07-03", "models": [ { - "role": "fast", "name": "Muse-Glimmer-30B", "repo": "unsloth/Muse-Glimmer-30B-GGUF", + "role": "debugger", "name": "Muse-Glimmer-30B", "repo": "unsloth/Muse-Glimmer-30B-GGUF", "family": "muse", "generation": 1.0, "total_params_b": 30, "active_params_b": 30, "moe": false, "quant": "Q4_K_XL", "ctx": 65536, "tools": true, "vision": true }, diff --git a/deploy/llama-swap.config.yaml b/deploy/llama-swap.config.yaml index fc4a083..c668bc2 100644 --- a/deploy/llama-swap.config.yaml +++ b/deploy/llama-swap.config.yaml @@ -34,10 +34,13 @@ models: context: 65536 Muse-Glimmer-30B: # Meta Muse Glimmer 30B: Dichtes 30B-Agenten-Modell mit DFlash-Speculative-Drafting - # und 1.8B Perception Multimodal Projector. + # und 1.8B Perception Multimodal Projector. Ideal als Runtime-Debugger & Fehler-Diagnostiker. cmd: | llama-server -m /srv/models/Muse-Glimmer-30B-GGUF/Muse-Glimmer-30B-UD-Q4_K_XL.gguf --host 127.0.0.1 --port ${PORT} -c 65536 -ngl 999 -fa on --no-mmap --mmproj /srv/models/Muse-Glimmer-30B-GGUF/mmproj-kquant.gguf --jinja --spec-type draft-dflash --spec-draft-model /srv/models/Muse-Glimmer-30B-GGUF/dflash-kquant.gguf ttl: 600 + aliases: + - debugger + - doctor capabilities: in: [text, image] out: [text]