Ampel / ampel (push) Failing after 21s
llama.cpp kann Draft-Beschleunigung und Bilder nicht zusammen (HTTP 500 "failed to process speculative batch", b11057 und b11157 geprueft; speculative.n_max=0 je Anfrage hilft nicht). Darum bekommen Hirn und Coder je einen Bild-Zwilling: gleiche Gewichte plus Projektor, ohne Draft (vision, coder-bild), in einer eigenen llama-swap-Gruppe, die den Coder nicht verdraengt. Probe 24.09.: beide 8/8 Bildmerkmale; Hirn-Zwilling 68 t/s, Coder-Zwilling 12,5 t/s. Bild-Weiche v3 im Gateway: Bild im aktuellen Schritt geht an den Zwilling der Rolle, aeltere Bilder werden einmal beschrieben (gemerkt) und als Text mitgeschickt, damit der Rest einer Agenten-Aufgabe wieder beim schnellen Modell laeuft. Qwen3-VL gibt "vision" ab, der Coder verliert den Projektor, der mit Draft nur HTTP 500 lieferte. Radar misst die Bildfaehigkeit des heutigen Modells ueber dessen Zwilling (sonst gewaenne jeder bildfaehige Kandidat mit "versteht Bilder"). Pruefstand: Coder darf vor dem Aendern lesen (Version 3). Modelle-Seite zeigt "Bilder: ja" ueber den Zwilling. Co-Authored-By: Claude Opus 5.5 <noreply@anthropic.com>
158 lines
9.0 KiB
YAML
158 lines
9.0 KiB
YAML
# Auto-generiert von provision.sh - per Mission Control erweiterbar
|
|
healthCheckTimeout: 300
|
|
globalTTL: 0
|
|
|
|
models:
|
|
Qwen3.6-35B-A3B:
|
|
# parallel 2 + c 131072: 2 Slots à 65k (Slot 2 = Nebenlast/Hintergrund-Extraktion, blockiert Voice-Turns
|
|
# nicht mehr); KV Q8_0 macht das speicherneutral zu vorher (65k f16). Bench 2026-07-02:
|
|
# Q8_0 kostet 0 t/s, MTP n-max 3 = +26% vs. ohne Spec. (Q4_K-KV stand mal im Template,
|
|
# lief aber NIE live — bewusst bei Q8_0 geblieben: Qualität vor ein paar GB, seit der
|
|
# Warm-Set-Diät 07.07. ist RAM nicht mehr der Engpass.)
|
|
# 17.09.2026: Uncensored-Variante (HauhauCS Aggressive, Q4_K_M) mit demselben giocom-DFlash-Draft. Prüfstand: 100,8 t/s
|
|
# @13k (Original 92,8), Prefill 13,1 s, Tools 11/12 (1 Denk-Ausreißer), Hermes-Smoke grün. Original bleibt in
|
|
# Qwen3.6-35B-A3B-MTP-GGUF liegen — Rückweg = Pfad zurück.
|
|
# --reasoning-budget 2048 (17.09.2026): Deckel für Denk-Tokens — die abliterierte Variante hatte im Prüfstand 1/12
|
|
# Denk-Ausreißer ohne Antwort; mit Deckel wird daraus eine kürzer bedachte Antwort statt Stille. Normale Denkphasen
|
|
# des Hirns liegen bei ein paar hundert Tokens.
|
|
cmd: |
|
|
llama-server -m /srv/models/Qwen3.6-35B-A3B-Uncensored-GGUF/Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive-Q4_K_M.gguf --host 127.0.0.1 --port ${PORT} -c 131072 -ngl 999 -fa on --load-mode none --jinja --parallel 2 -cram 16384 -ctk q8_0 -ctv q8_0 --spec-type draft-dflash --spec-draft-model /srv/models/Qwen3.6-35B-A3B-DFlash-GGUF/giocom-Qwen3.6-35B-A3B-DFlash-Q8_0.gguf --reasoning-budget 2048
|
|
ttl: 0
|
|
aliases:
|
|
- hermes
|
|
- fast
|
|
# context = nutzbarer Kontext PRO REQUEST (c geteilt durch parallel-Slots).
|
|
capabilities:
|
|
in: [text]
|
|
out: [text]
|
|
tools: true
|
|
context: 65536
|
|
Qwen3.6-35B-A3B-Bild:
|
|
# 24.09.2026: Bild-Zwilling des Hirns — dieselben Gewichte plus Bild-Projektor, aber OHNE Draft. llama.cpp
|
|
# scheitert mit Draft UND Bild an „failed to process speculative batch“ (HTTP 500; b11057 und b11157 geprüft,
|
|
# auch speculative.n_max=0 je Anfrage hilft nicht). Das MC2-Gateway schickt nur Anfragen mit einem Bild im
|
|
# aktuellen Schritt hierher; ältere Bilder ersetzt es durch eine Beschreibung von hier, damit der Rest der
|
|
# Aufgabe beim schnellen Hirn mit Draft bleibt. Probe 24.09.: 8/8 Bildmerkmale, Bildschirm-Aufgabe im
|
|
# Agenten-Ablauf richtig, 67,9 t/s @13k (Hirn mit Draft 105,8). Projektor aus dem Original-Repo
|
|
# (Qwen3.6-35B-A3B-MTP-GGUF) — er passt zur abliterierten Variante. Löst Qwen3-VL als `vision` ab.
|
|
cmd: |
|
|
llama-server -m /srv/models/Qwen3.6-35B-A3B-Uncensored-GGUF/Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive-Q4_K_M.gguf --host 127.0.0.1 --port ${PORT} -c 65536 -ngl 999 -fa on --load-mode none --mmproj /srv/models/Qwen3.6-35B-A3B-MTP-GGUF/mmproj-BF16.gguf --jinja --parallel 1 -cram 8192 -ctk q8_0 -ctv q8_0 --reasoning-budget 2048
|
|
ttl: 900
|
|
aliases:
|
|
- vision
|
|
capabilities:
|
|
in: [text, image]
|
|
out: [text]
|
|
tools: true
|
|
context: 65536
|
|
Qwen3.8-27B:
|
|
# Qwen 3.8 27B: Dichtes 27B-Modell mit hybrider Linear-Attention (48/64 Schichten linear),
|
|
# nativem Multimodal-Support (mmproj-BF16) und Tool-Calling via --jinja.
|
|
# Unser neuer Haupt-Coder mit 262k Kontext, Thinking Mode und extrem sauberer Code-Qualität.
|
|
# DFlash2-Draft (z-lab, Q4_K_M) seit 04.09.2026: gemessen 12,6 -> 31 t/s (Akzeptanz 0,78, n-max 3 default;
|
|
# n-max 5 und f16-KV bringen nichts, Q4-Draft = Q8-Draft). Braucht llama.cpp >= 28.08. (PR 27342 + Vulkan-Fix 27812).
|
|
# 17.09.2026: Uncensored-Variante (JonathanColetti, Heretic-Abliteration: KL 0,12, Refusals 98->12/100, Benchmarks -0,5)
|
|
# mit demselben DFlash2-Draft (Akzeptanz 0,82 @13k). Prüfstand: 30,4 t/s @13k (Original 26,2), Tools 6/6, Coding 3/3,
|
|
# Hermes-Smoke grün. Original bleibt in Qwen3.8-27B-GGUF liegen — Rückweg = beide Pfade zurück.
|
|
# 24.09.2026: ohne --mmproj. Bild UND DFlash2 ergaben immer HTTP 500; Bilder gehen jetzt an den Zwilling
|
|
# Qwen3.8-27B-Bild (Alias coder-bild), der Text bleibt hier mit Draft schnell.
|
|
cmd: |
|
|
llama-server -m /srv/models/Qwen3.8-27B-Uncensored-GGUF/Qwen3.8-27B-Uncensored-Q4_K_M.gguf --host 127.0.0.1 --port ${PORT} -c 131072 -ngl 999 -fa on --load-mode none --jinja --parallel 1 -cram 16384 -ctk q8_0 -ctv q8_0 --spec-type draft-dflash --spec-draft-model /srv/models/Qwen3.8-27B-DFlash2-GGUF/Qwen3.8-27B-DFlash2-Q4_K_M.gguf
|
|
ttl: 5400
|
|
aliases:
|
|
- coder
|
|
- heavy
|
|
capabilities:
|
|
in: [text]
|
|
out: [text]
|
|
tools: true
|
|
# --parallel 1 = der Coder bekommt den ganzen Slot (34a9862, am laufenden Prozess
|
|
# gegengeprueft). Er hat nur einen Verbraucher; Lucy/explore nutzen hermes, review heavy.
|
|
context: 131072
|
|
Qwen3.8-27B-Bild:
|
|
# 24.09.2026: Bild-Zwilling des Coders (dieselben Gewichte plus Projektor, ohne DFlash2 — Grund siehe
|
|
# Qwen3.6-35B-A3B-Bild). Nur für Anfragen mit einem Bild im aktuellen Schritt (Screenshot der App o. Ä.).
|
|
# Probe 24.09.: 8/8 Bildmerkmale, 12,5 t/s @13k (Coder mit Draft 30,4).
|
|
cmd: |
|
|
llama-server -m /srv/models/Qwen3.8-27B-Uncensored-GGUF/Qwen3.8-27B-Uncensored-Q4_K_M.gguf --host 127.0.0.1 --port ${PORT} -c 131072 -ngl 999 -fa on --load-mode none --mmproj /srv/models/Qwen3.8-27B-Uncensored-GGUF/mmproj-Qwen3.8-27B-Uncensored-F16.gguf --jinja --parallel 1 -cram 16384 -ctk q8_0 -ctv q8_0
|
|
ttl: 900
|
|
aliases:
|
|
- coder-bild
|
|
capabilities:
|
|
in: [text, image]
|
|
out: [text]
|
|
tools: true
|
|
context: 131072
|
|
Muse-Glimmer-30B:
|
|
# Meta Muse Glimmer 30B: Dichtes 30B-Agenten-Modell mit DFlash-Speculative-Drafting
|
|
# und 1.8B Perception Multimodal Projector. Ideal als Runtime-Debugger & Fehler-Diagnostiker.
|
|
cmd: |
|
|
llama-server -m /srv/models/Muse-Glimmer-30B-GGUF/Muse-Glimmer-30B-UD-Q4_K_XL.gguf --host 127.0.0.1 --port ${PORT} -c 65536 -ngl 999 -fa on --load-mode none --mmproj /srv/models/Muse-Glimmer-30B-GGUF/mmproj-kquant.gguf --jinja --spec-type draft-dflash --spec-draft-model /srv/models/Muse-Glimmer-30B-GGUF/dflash-kquant.gguf
|
|
ttl: 600
|
|
aliases:
|
|
- debugger
|
|
capabilities:
|
|
in: [text, image]
|
|
out: [text]
|
|
tools: true
|
|
context: 65536
|
|
Qwen3-Embedding-0.6B:
|
|
cmd: |
|
|
llama-server -m /srv/models/Qwen3-Embedding-0.6B-GGUF/Qwen3-Embedding-0.6B-Q8_0.gguf --host 127.0.0.1 --port ${PORT} --embedding --pooling last -ngl 999 -fa on --load-mode none -c 8192
|
|
ttl: 0
|
|
aliases:
|
|
- embed
|
|
gpt-oss-120b:
|
|
# heavy (B5-Entscheid 03.07.) + nächtlicher CHEF-GUTACHTER (04:30-Cron). 60 GB —
|
|
# passt seit der Warm-Set-Diät (07.07., vision on-demand) wieder NEBEN Hirn+embed.
|
|
cmd: |
|
|
llama-server -m /srv/models/gpt-oss-120b-GGUF/gpt-oss-120b-mxfp4-00001-of-00003.gguf --host 127.0.0.1 --port ${PORT} -c 32768 -ngl 999 -fa on --load-mode none --jinja --cache-reuse 256 -cram 16384
|
|
ttl: 600
|
|
# 04.09.2026: Rolle `heavy` an Qwen3.8-27B abgegeben (AA-Index 52 vs 24, 17 statt 60 GB, 31 t/s mit DFlash2).
|
|
# Ohne Alias = Rollback-Reserve, direkt als `gpt-oss-120b` ansprechbar.
|
|
capabilities:
|
|
in: [text]
|
|
out: [text]
|
|
tools: true
|
|
context: 32768
|
|
Qwen3-VL-30B-A3B-Instruct:
|
|
cmd: |
|
|
llama-server -m /srv/models/Qwen3-VL-30B-A3B-Instruct-GGUF/Qwen3-VL-30B-A3B-Instruct-Q4_K_M.gguf --host 127.0.0.1 --port ${PORT} -c 32768 -ngl 999 -fa on --load-mode none --mmproj /srv/models/Qwen3-VL-30B-A3B-Instruct-GGUF/mmproj-F16.gguf --jinja
|
|
ttl: 900
|
|
# 24.09.2026: `vision` an den Hirn-Zwilling abgegeben (Qwen3.6-35B-A3B-Bild); ohne Rolle, wird gelöscht.
|
|
capabilities:
|
|
in: [text, image]
|
|
out: [text]
|
|
context: 32768
|
|
Qwen3-Reranker-0.6B:
|
|
# Gedächtnis-Zweitstufe (07.07., Rollen-Audit): ordnet Gedächtnis-Suchtreffer nach echter
|
|
# Relevanz (/v1/rerank, Mungert-GGUF — Community-Konvertierungen liefern oft Nullscores!).
|
|
# Winzig (~0,7 GB) → in brains (verdrängungssicher); lädt in ~1-2 s, erste Anfrage wärmt.
|
|
cmd: |
|
|
llama-server -m /srv/models/Qwen3-Reranker-0.6B-GGUF/Qwen3-Reranker-0.6B-q8_0.gguf --host 127.0.0.1 --port ${PORT} --reranking --pooling rank --embedding -ngl 999 -fa on --load-mode none -c 8192
|
|
ttl: 0
|
|
aliases:
|
|
- reranker
|
|
groups:
|
|
brains:
|
|
swap: false
|
|
# llama-swap versteht NUR `persistent` (Verdrängungsschutz); `persist` ist der
|
|
# MC2-interne Lese-Key (API/UI) und wird von llama-swap ignoriert. Beide pflegen!
|
|
persist: true
|
|
persistent: true
|
|
members:
|
|
- Qwen3-Embedding-0.6B
|
|
- Qwen3-Reranker-0.6B
|
|
- Qwen3.6-35B-A3B
|
|
bild:
|
|
# 24.09.2026: die Bild-Zwillinge von Hirn und Coder. swap: true = höchstens einer von beiden geladen;
|
|
# exclusive: false = das Laden verdrängt den Coder NICHT (sonst kostete jedes Bild in einer OpenChamber-
|
|
# Sitzung den Coder samt Prompt-Cache). Speicher im schlimmsten Fall: Warm-Set 27 + Coder 29 +
|
|
# Zwilling ~25 GB = ~81 GB. Nachts entlädt das Modell-Radar alles außerhalb des Warm-Sets.
|
|
swap: true
|
|
exclusive: false
|
|
persistent: false
|
|
members:
|
|
- Qwen3.6-35B-A3B-Bild
|
|
- Qwen3.8-27B-Bild
|