Compare commits
2 Commits
7dd44a3630
...
080eaa5ff5
| Author | SHA1 | Date | |
|---|---|---|---|
| 080eaa5ff5 | |||
| 554db10a6f |
@@ -99,3 +99,30 @@ einen User-Entscheid — kein „Best Practice sagt aber…" (siehe ARBEITSWEISE
|
|||||||
(deprecated Python, Server blockiert, Hybrid unsupported). Zweck/Umfang offen.
|
(deprecated Python, Server blockiert, Hybrid unsupported). Zweck/Umfang offen.
|
||||||
- **Aussortiert (tot):** Kyutai-Streaming-STT (nur EN/FR) · Unmute-Voll-Stack · LXC 105 (alt) ·
|
- **Aussortiert (tot):** Kyutai-Streaming-STT (nur EN/FR) · Unmute-Voll-Stack · LXC 105 (alt) ·
|
||||||
WebUI-Update-Checks · openWakeWord (Wake-Gate ist STT-basiert).
|
WebUI-Update-Checks · openWakeWord (Wake-Gate ist STT-basiert).
|
||||||
|
|
||||||
|
## Prüfstand 24.07.2026 — Coder-Backend + Modell (ROCm-Recheck erledigt)
|
||||||
|
|
||||||
|
Gemessen mit llama-bench (Vulkan/RADV, Q4_K_M, -fa on) auf der Box (Ryzen AI Max+ 395):
|
||||||
|
|
||||||
|
| Test | Coder-Next 80B-A3B | Devstral Small 2 24B dense |
|
||||||
|
| -------------- | ------------------ | -------------------------- |
|
||||||
|
| pp2048 @ 0 | 702 t/s | 468 t/s |
|
||||||
|
| tg64 @ 0 | 59 t/s | 15 t/s |
|
||||||
|
| pp2048 @ 8192 | 638 t/s | 315 t/s |
|
||||||
|
| tg64 @ 8192 | 55 t/s | 14 t/s |
|
||||||
|
| pp2048 @ 32768 | 488 t/s | 63 t/s (7,7x langsamer) |
|
||||||
|
| tg64 @ 32768 | 47 t/s | 11 t/s (4,2x langsamer) |
|
||||||
|
|
||||||
|
- **Backend bleibt Vulkan (ROCm-Recheck 24.07. erledigt).** Vulkan-Prefill haelt bei 32K
|
||||||
|
noch 488 t/s — der einzige ROCm-Vorteil (Langkontext-Prefill) ist auf dieser Box kein
|
||||||
|
Engpass. Der Autor des fuehrenden ROCm/Strix-Halo-Rezepts ist im Juli 2026 selbst zu
|
||||||
|
Vulkan zurueckgekehrt (+28% Decode). Kein ROCm-Bau — Produktiv-Risiko fuer null Gewinn.
|
||||||
|
Wiedervorlage nur bei neuem Engine-Langkontext-Support oder einem reinen HIP-Modell.
|
||||||
|
- **Coder bleibt Qwen3-Coder-Next — jetzt gemessen bestaetigt.** Devstral Small 2 (einziger
|
||||||
|
neuer agentisch trainierter Dense-Kandidat) ist 4x langsamer bei Generierung und bricht
|
||||||
|
beim 32K-Prefill auf 63 t/s ein (~9 min um einen 32K-Kontext zu lesen). Fuer agentisches
|
||||||
|
Coden auf dieser Box disqualifiziert — Reliabilitaet war nicht einmal noetig als Argument.
|
||||||
|
- **Der Coder ist nicht langsam (59 t/s).** Das Fassaden-/Halluzinations-Problem ist kein
|
||||||
|
Speed- und kein Backend-Problem und wird weder durch Modelltausch noch ROCm geloest. Es
|
||||||
|
ist Reliabilitaet = Modellklasse + Harness. Naechster Hebel: Post-Edit-Verify-Hook,
|
||||||
|
kleine Etappen/frische Threads, Eskalation der harten 20% an Frontier.
|
||||||
|
|||||||
Reference in New Issue
Block a user