From 682be9b63b57de4bea6b558319d2af37a4a2abef Mon Sep 17 00:00:00 2001 From: Hitonabi Date: Wed, 22 Jul 2026 18:24:37 +0200 Subject: [PATCH] VERDIKTE: Hirn auf DFlash (live 22.07.), DFlash-je-Rolle-Messung hermes: DFlash schlaegt MTP (86-90 vs 81-83 t/s, live 89-94). coder: DFlash verliert trotz guter Akzeptanz. heavy: wartet auf Engine-Support (Tensor-Mismatch b10087). vision/scout: keine Drafts. Inkl. Eigenbau-Rezept + Quantize-Falle. Co-Authored-By: Claude Opus 4.8 --- docs/wissen/VERDIKTE.md | 12 +++++++++++- 1 file changed, 11 insertions(+), 1 deletion(-) diff --git a/docs/wissen/VERDIKTE.md b/docs/wissen/VERDIKTE.md index 8f3bb8a..9480307 100644 --- a/docs/wissen/VERDIKTE.md +++ b/docs/wissen/VERDIKTE.md @@ -36,9 +36,19 @@ einen User-Entscheid — kein „Best Practice sagt aber…" (siehe ARBEITSWEISE 09.07.: hält weiter, einziger ROCm-Vorteil = Langkontext-Prefill auf gpt-oss). **Wiedervorlage: ROCm-Recheck 20.–25.07.2026** (Box-Reminder gesetzt) — falls dann Bedarf: NUR Hybrid für heavy/coder erwägen, **das Hirn bleibt in jedem Szenario auf Vulkan.** -- **Lucys Hirn: Qwen3.6-35B-A3B mit MTP-Spec-Draft n-max 3** (+26 %; n-max 4 lohnt nicht). +- **Lucys Hirn: Qwen3.6-35B-A3B mit DFlash-Spec-Draft (seit 22.07.)** — löste draft-mtp ab: + A/B/C prod-gleich gemessen 61,7 (ohne) / 81–83 (MTP) / 86–90 t/s (DFlash), live eingependelt + 89–94. Draft: `giocom-…-DFlash-Q8_0.gguf` (Mainline-kompatibel; abhinand-Konvertierung ist es + NICHT — fehlendes `target_layers`-Metadatum). Rollback-Backup `config.yaml.bak-dflash-*`. KV **q8_0** (Entscheid 07.07.: Qualität > ein paar GB; der q4_k-Commit lief nie live). `--parallel 2` = bewusster Trade (Mem0-Lernen blockiert nie den nächsten Voice-Turn). +- **DFlash je Rolle (gemessen 22.07., nicht neu aufrollen):** coder NEIN — 44–50 t/s mit Draft + (Q8 wie BF16) vs. 59–60 ohne, trotz 68–76 % Akzeptanz: 3B-aktiv-Decode ist billiger als das + Draften. heavy WARTET — gpt-oss-120b-Draft konvertiert (liegt in `/srv/models/DFlash-drafts/`), + aber Engine b10087 lädt die Arch nicht („expected 123, got 91“ = Extra-Tensoren unbekannt); + nach Engine-Update erneut probieren. vision/scout: keine Drafts veröffentlicht. + Eigenbau-Rezept: z-lab-safetensors + `convert_hf_to_gguf.py --target-model-dir `; + ⚠️ `llama-quantize` verwirft DFlash-Sondertensoren bei Nicht-Standard-Archs. - **coder-Lane: Qwen3-Coder-Next, FINAL** („bleiben bei dem was wir haben, nachweislich besser"). Qwen3.6-27B dense gebencht + verworfen (tg 12,7 t/s = 4–7× langsamer). - **hipEngine + strix-halo-toolboxes/TheRock: beobachten, nicht adoptieren.** hipEngine