From 0944b1d93ed71c6393f32484521cef7a6472efae Mon Sep 17 00:00:00 2001 From: Hitonabi Date: Fri, 4 Sep 2026 13:45:54 +0200 Subject: [PATCH] =?UTF-8?q?feat(llama-swap):=20DFlash2-Draft=20f=C3=BCr=20?= =?UTF-8?q?den=20Coder=20=E2=80=94=20gemessen=2012,6=20=E2=86=92=2031=20t/?= =?UTF-8?q?s?= MIME-Version: 1.0 Content-Type: text/plain; charset=UTF-8 Content-Transfer-Encoding: 8bit Qwen3.8-27B lief seit 19.08. ohne sein Entwurfsmodell, obwohl es auf der Box lag: Mainline-llama.cpp konnte DFlash2 erst seit 27.08. (PR 27342) plus Vulkan-Fix 28.08. (PR 27812); die Engine vom 1.9. (b10733) kann beides. Auf der Box gemessen (Vulkan, 32k, Code-Prompt): ohne Draft 12,6 t/s, mit Q4_K_M-Draft 31 t/s bei Akzeptanz 0,78. n-max 5, f16-KV und der Q8-Draft bringen nichts. Live-Config und Repo-Kopie sind identisch. Co-Authored-By: Claude Fable 5.1 --- deploy/llama-swap.config.yaml | 4 +++- 1 file changed, 3 insertions(+), 1 deletion(-) diff --git a/deploy/llama-swap.config.yaml b/deploy/llama-swap.config.yaml index b730298..e2647be 100644 --- a/deploy/llama-swap.config.yaml +++ b/deploy/llama-swap.config.yaml @@ -25,8 +25,10 @@ models: # Qwen 3.8 27B: Dichtes 27B-Modell mit hybrider Linear-Attention (48/64 Schichten linear), # nativem Multimodal-Support (mmproj-BF16) und Tool-Calling via --jinja. # Unser neuer Haupt-Coder mit 262k Kontext, Thinking Mode und extrem sauberer Code-Qualität. + # DFlash2-Draft (z-lab, Q4_K_M) seit 04.09.2026: gemessen 12,6 -> 31 t/s (Akzeptanz 0,78, n-max 3 default; + # n-max 5 und f16-KV bringen nichts, Q4-Draft = Q8-Draft). Braucht llama.cpp >= 28.08. (PR 27342 + Vulkan-Fix 27812). cmd: | - llama-server -m /srv/models/Qwen3.8-27B-GGUF/Qwen3.8-27B-Q4_K_M.gguf --host 127.0.0.1 --port ${PORT} -c 131072 -ngl 999 -fa on --no-mmap --mmproj /srv/models/Qwen3.8-27B-GGUF/mmproj-BF16.gguf --jinja --parallel 1 -cram 16384 -ctk q8_0 -ctv q8_0 + llama-server -m /srv/models/Qwen3.8-27B-GGUF/Qwen3.8-27B-Q4_K_M.gguf --host 127.0.0.1 --port ${PORT} -c 131072 -ngl 999 -fa on --no-mmap --mmproj /srv/models/Qwen3.8-27B-GGUF/mmproj-BF16.gguf --jinja --parallel 1 -cram 16384 -ctk q8_0 -ctv q8_0 --spec-type draft-dflash --spec-draft-model /srv/models/Qwen3.8-27B-DFlash2-GGUF/Qwen3.8-27B-DFlash2-Q4_K_M.gguf ttl: 5400 aliases: - coder