diff --git a/backend/models_catalog.json b/backend/models_catalog.json index efb4410..368266b 100644 --- a/backend/models_catalog.json +++ b/backend/models_catalog.json @@ -2,6 +2,11 @@ "_comment": "Kuratierter Modell-Katalog (Cookbook) für Strix Halo / Ryzen AI MAX+ 395 — 128GB unified, bandbreiten-limitiert (256 GB/s). MoE-first. EINE Quelle der Wahrheit für KORREKTE Metadaten (total/active params, moe, generation) → präzise Empfehlungen ohne Namens-Raterei. Inspiriert vom Odysseus-Cookbook (statischer, validierter Katalog statt Live-Scraping). Erweiterbar: neue Modelle hier eintragen. Felder: name (Match-Identifier), repo (HF org/name für Install), family (+Subtyp), generation (numerisch, für Upgrade-Vergleich), total_params_b, active_params_b (=total bei dense), moe, quant, ctx (empfohlen), tools, vision.", "version": "2026-07-03", "models": [ + { + "role": "fast", "name": "Muse-Glimmer-30B", "repo": "unsloth/Muse-Glimmer-30B-GGUF", + "family": "muse", "generation": 1.0, "total_params_b": 30, "active_params_b": 30, + "moe": false, "quant": "Q4_K_XL", "ctx": 65536, "tools": true, "vision": true + }, { "role": "fast", "name": "Qwen3.8-27B", "repo": "unsloth/Qwen3.8-27B-GGUF", "family": "qwen", "generation": 3.8, "total_params_b": 27, "active_params_b": 27, diff --git a/deploy/llama-swap.config.yaml b/deploy/llama-swap.config.yaml index fbb3bfa..fc4a083 100644 --- a/deploy/llama-swap.config.yaml +++ b/deploy/llama-swap.config.yaml @@ -32,6 +32,17 @@ models: out: [text] tools: true context: 65536 + Muse-Glimmer-30B: + # Meta Muse Glimmer 30B: Dichtes 30B-Agenten-Modell mit DFlash-Speculative-Drafting + # und 1.8B Perception Multimodal Projector. + cmd: | + llama-server -m /srv/models/Muse-Glimmer-30B-GGUF/Muse-Glimmer-30B-UD-Q4_K_XL.gguf --host 127.0.0.1 --port ${PORT} -c 65536 -ngl 999 -fa on --no-mmap --mmproj /srv/models/Muse-Glimmer-30B-GGUF/mmproj-kquant.gguf --jinja --spec-type draft-dflash --spec-draft-model /srv/models/Muse-Glimmer-30B-GGUF/dflash-kquant.gguf + ttl: 600 + capabilities: + in: [text, image] + out: [text] + tools: true + context: 65536 Qwen3-Coder-Next: cmd: | llama-server -m /srv/models/Qwen3-Coder-Next-GGUF/Qwen3-Coder-Next-Q4_K_M.gguf --host 127.0.0.1 --port ${PORT} -c 131072 -ngl 999 -fa on --no-mmap --jinja --cache-reuse 256 -cram 16384