VERDIKTE: Hirn auf DFlash (live 22.07.), DFlash-je-Rolle-Messung

hermes: DFlash schlaegt MTP (86-90 vs 81-83 t/s, live 89-94).
coder: DFlash verliert trotz guter Akzeptanz. heavy: wartet auf
Engine-Support (Tensor-Mismatch b10087). vision/scout: keine Drafts.
Inkl. Eigenbau-Rezept + Quantize-Falle.

Co-Authored-By: Claude Opus 4.8 <noreply@anthropic.com>
This commit is contained in:
Hitonabi
2026-07-22 18:24:37 +02:00
parent 96c4e417ec
commit 682be9b63b
+11 -1
View File
@@ -36,9 +36,19 @@ einen User-Entscheid — kein „Best Practice sagt aber…" (siehe ARBEITSWEISE
09.07.: hält weiter, einziger ROCm-Vorteil = Langkontext-Prefill auf gpt-oss).
**Wiedervorlage: ROCm-Recheck 20.25.07.2026** (Box-Reminder gesetzt) — falls dann Bedarf:
NUR Hybrid für heavy/coder erwägen, **das Hirn bleibt in jedem Szenario auf Vulkan.**
- **Lucys Hirn: Qwen3.6-35B-A3B mit MTP-Spec-Draft n-max 3** (+26 %; n-max 4 lohnt nicht).
- **Lucys Hirn: Qwen3.6-35B-A3B mit DFlash-Spec-Draft (seit 22.07.)** — löste draft-mtp ab:
A/B/C prod-gleich gemessen 61,7 (ohne) / 8183 (MTP) / 8690 t/s (DFlash), live eingependelt
8994. Draft: `giocom-…-DFlash-Q8_0.gguf` (Mainline-kompatibel; abhinand-Konvertierung ist es
NICHT — fehlendes `target_layers`-Metadatum). Rollback-Backup `config.yaml.bak-dflash-*`.
KV **q8_0** (Entscheid 07.07.: Qualität > ein paar GB; der q4_k-Commit lief nie live).
`--parallel 2` = bewusster Trade (Mem0-Lernen blockiert nie den nächsten Voice-Turn).
- **DFlash je Rolle (gemessen 22.07., nicht neu aufrollen):** coder NEIN — 4450 t/s mit Draft
(Q8 wie BF16) vs. 5960 ohne, trotz 6876 % Akzeptanz: 3B-aktiv-Decode ist billiger als das
Draften. heavy WARTET — gpt-oss-120b-Draft konvertiert (liegt in `/srv/models/DFlash-drafts/`),
aber Engine b10087 lädt die Arch nicht („expected 123, got 91“ = Extra-Tensoren unbekannt);
nach Engine-Update erneut probieren. vision/scout: keine Drafts veröffentlicht.
Eigenbau-Rezept: z-lab-safetensors + `convert_hf_to_gguf.py --target-model-dir <Ziel-Tokenizer>`;
⚠️ `llama-quantize` verwirft DFlash-Sondertensoren bei Nicht-Standard-Archs.
- **coder-Lane: Qwen3-Coder-Next, FINAL** („bleiben bei dem was wir haben, nachweislich
besser"). Qwen3.6-27B dense gebencht + verworfen (tg 12,7 t/s = 47× langsamer).
- **hipEngine + strix-halo-toolboxes/TheRock: beobachten, nicht adoptieren.** hipEngine