diff --git a/docs/wissen/VERDIKTE.md b/docs/wissen/VERDIKTE.md index 9480307..36c47fe 100644 --- a/docs/wissen/VERDIKTE.md +++ b/docs/wissen/VERDIKTE.md @@ -99,3 +99,30 @@ einen User-Entscheid — kein „Best Practice sagt aber…" (siehe ARBEITSWEISE (deprecated Python, Server blockiert, Hybrid unsupported). Zweck/Umfang offen. - **Aussortiert (tot):** Kyutai-Streaming-STT (nur EN/FR) · Unmute-Voll-Stack · LXC 105 (alt) · WebUI-Update-Checks · openWakeWord (Wake-Gate ist STT-basiert). + +## Prüfstand 24.07.2026 — Coder-Backend + Modell (ROCm-Recheck erledigt) + +Gemessen mit llama-bench (Vulkan/RADV, Q4_K_M, -fa on) auf der Box (Ryzen AI Max+ 395): + +| Test | Coder-Next 80B-A3B | Devstral Small 2 24B dense | +| -------------- | ------------------ | -------------------------- | +| pp2048 @ 0 | 702 t/s | 468 t/s | +| tg64 @ 0 | 59 t/s | 15 t/s | +| pp2048 @ 8192 | 638 t/s | 315 t/s | +| tg64 @ 8192 | 55 t/s | 14 t/s | +| pp2048 @ 32768 | 488 t/s | 63 t/s (7,7x langsamer) | +| tg64 @ 32768 | 47 t/s | 11 t/s (4,2x langsamer) | + +- **Backend bleibt Vulkan (ROCm-Recheck 24.07. erledigt).** Vulkan-Prefill haelt bei 32K + noch 488 t/s — der einzige ROCm-Vorteil (Langkontext-Prefill) ist auf dieser Box kein + Engpass. Der Autor des fuehrenden ROCm/Strix-Halo-Rezepts ist im Juli 2026 selbst zu + Vulkan zurueckgekehrt (+28% Decode). Kein ROCm-Bau — Produktiv-Risiko fuer null Gewinn. + Wiedervorlage nur bei neuem Engine-Langkontext-Support oder einem reinen HIP-Modell. +- **Coder bleibt Qwen3-Coder-Next — jetzt gemessen bestaetigt.** Devstral Small 2 (einziger + neuer agentisch trainierter Dense-Kandidat) ist 4x langsamer bei Generierung und bricht + beim 32K-Prefill auf 63 t/s ein (~9 min um einen 32K-Kontext zu lesen). Fuer agentisches + Coden auf dieser Box disqualifiziert — Reliabilitaet war nicht einmal noetig als Argument. +- **Der Coder ist nicht langsam (59 t/s).** Das Fassaden-/Halluzinations-Problem ist kein + Speed- und kein Backend-Problem und wird weder durch Modelltausch noch ROCm geloest. Es + ist Reliabilitaet = Modellklasse + Harness. Naechster Hebel: Post-Edit-Verify-Hook, + kleine Etappen/frische Threads, Eskalation der harten 20% an Frontier.