Files
mission-control-v2/docs/wissen/VERDIKTE.md
T

9.0 KiB
Raw Blame History

Finale Verdikte — nicht neu aufrollen ohne neuen, belegten Anlass

Kuratiert 10.07.2026 aus dem Claude-Projektgedächtnis. Jedes Verdikt trägt sein Warum und (wo sinnvoll) die Wiedervorlage-Bedingung. Wer eines kippen will, braucht eine MESSUNG oder einen User-Entscheid — kein „Best Practice sagt aber…" (siehe ARBEITSWEISE.md).

Richtung & Architektur

  • MC3-Neubau VERWORFEN (03.07.), „MC2 Final" ERSETZT durch „MC2 lebt" (10.07.). Kein Basisstation-Neubau; seit dem Ablösungs-Entscheid wird MC2 über die Queue→Karte→Klick-Pipeline weiterentwickelt statt eingefroren. Siehe ZIELBILD.md.
  • Agent-Runtime: Hermes bleibt. ZeroClaw-PoC gebaut + abgerissen (01.07.) — der echte Latenz-Fix war das Hirn (gemma→Qwen3.6), nicht die Runtime. (ZeroClaw-Messwerte für den Fall „Hermes-Latenz wird wieder Thema": docs/ZEROCLAW_POC_RESULTS.md.)
  • Memory-Layer: Mem0 bleibt. Zep/Letta/Hindsight benchen höher, sind aber schwerer/teils closed; Mem0 = beste Framework-Integration + v3-Algorithmus + läuft deployt.
  • Telegram bleibt DER Mobil-Kanal; WhatsApp VERWORFEN (09.07.). Baileys-Bridge = Meta-ToS- Verstoß mit Bann-Risiko auf der Privatnummer + fragiler Dauerprozess; Alarmkette/Crons sind simple Bot-API-Calls. Neu bewerten nur bei offizieller Personal-Bot-API.
  • Multi-Profil Lucy/Werkstatt auf der Box: NICHT nötig (09.07.). tui_gateway lädt hart den cli-Bucket, Lucy läuft über api_server — die Trennung existiert auf Platform-Ebene. (Das PC-Profil des Hermes Desktop ist ein ANDERER Fall: eigene Maschine.)
  • MoA-Preset NICHT adoptiert. Lädt mehrere Modell-Slots parallel — RAM ist der Engpass. Das sequenzielle Zwei-Kritiker-Gate (Coder-Next + GLM) ist E2E-bewährt und RAM-schonend.
  • worker.sh bleibt; natives delegate_task nur für interaktive Arbeit (10.07.). delegate_task kann KEINE Modellwahl pro Aufruf und läuft top-level IMMER background (stirbt in der -z-Lane mit dem Prozess). delegation.model: coder ist live — Fan-out funktioniert E2E in langlebigen Sessions (Desktop/Telegram/Chat).
  • Kein heavy/gpt-oss im heißen Pfad. heavy läuft mit 32k (< Hermes-Floor 64k) und 60 GB Kaltladen. Als Ein-Schuss-Completion (Chef-Gutachter, Radar-Analyst, Orchestrator-Planung) ok — als delegate_task-Ziel oder Pro-Schritt-Worker nie.

Engine & Modelle (Box, gfx1151)

  • Vulkan/RADV schlägt ROCm (+1222 % tg, Cutover 27.06., mehrfach bestätigt; Recheck-Stand 09.07.: hält weiter, einziger ROCm-Vorteil = Langkontext-Prefill auf gpt-oss). Wiedervorlage: ROCm-Recheck 20.25.07.2026 (Box-Reminder gesetzt) — falls dann Bedarf: NUR Hybrid für heavy/coder erwägen, das Hirn bleibt in jedem Szenario auf Vulkan.
  • Lucys Hirn: Qwen3.6-35B-A3B mit DFlash-Spec-Draft (seit 22.07.) — löste draft-mtp ab: A/B/C prod-gleich gemessen 61,7 (ohne) / 8183 (MTP) / 8690 t/s (DFlash), live eingependelt 8994. Draft: giocom-…-DFlash-Q8_0.gguf (Mainline-kompatibel; abhinand-Konvertierung ist es NICHT — fehlendes target_layers-Metadatum). Rollback-Backup config.yaml.bak-dflash-*. KV q8_0 (Entscheid 07.07.: Qualität > ein paar GB; der q4_k-Commit lief nie live). --parallel 2 = bewusster Trade (Mem0-Lernen blockiert nie den nächsten Voice-Turn).
  • DFlash je Rolle (gemessen 22.07., nicht neu aufrollen): coder NEIN — 4450 t/s mit Draft (Q8 wie BF16) vs. 5960 ohne, trotz 6876 % Akzeptanz: 3B-aktiv-Decode ist billiger als das Draften. heavy WARTET — gpt-oss-120b-Draft konvertiert (liegt in /srv/models/DFlash-drafts/), aber Engine b10087 lädt die Arch nicht („expected 123, got 91“ = Extra-Tensoren unbekannt); nach Engine-Update erneut probieren. vision/scout: keine Drafts veröffentlicht. Eigenbau-Rezept: z-lab-safetensors + convert_hf_to_gguf.py --target-model-dir <Ziel-Tokenizer>; ⚠️ llama-quantize verwirft DFlash-Sondertensoren bei Nicht-Standard-Archs.
  • coder-Lane: Qwen3-Coder-Next, FINAL („bleiben bei dem was wir haben, nachweislich besser"). Qwen3.6-27B dense gebencht + verworfen (tg 12,7 t/s = 47× langsamer).
  • hipEngine + strix-halo-toolboxes/TheRock: beobachten, nicht adoptieren. hipEngine (natives HIP, nur Qwen3.6, >2× Prefill) ist jung; kyuz0-Toolboxes lösen ein Problem, das die Box nicht hat. Radar/Reminder wachen; Adoption nur nach eigenem brain-bench.
  • dist/ im Git ist ABSICHT. Box hat kein Node; Deploy = git reset --hard + committetes frontend/dist. NICHT gitignoren.

Lucy (Voice-App)

  • Shell: Electron, nicht Tauri. Alle harten Features (Klick-Durchlass-Overlay, Capture, Loopback, Tray, TTS-Spawn) existieren in Electron; Tauri fehlt Region-Klick-Durchlass.
  • Stimme: pocket-tts bleibt Default, bis die Mini-Lucy (Kokoro-Finetune) den Live-Test gewinnt. Qwen3-TTS-1.7B (RTF ~14), Chatterbox („zu delayed"), F5 (nicht streamfähig) — alle verworfen. Mini-Lucy v1 gewann alles Messbare (TTFB 0,45 s vs 1,72 s), scheiterte aber am Live-K.o. „nicht multilingual" → v2-Training läuft (Stand 10.07.). Umschalter in der App.
  • STT läuft auf der BOX (Parakeet-TDT v3, 0,30,8 s, praktisch fehlerfreies Deutsch), lokaler Whisper nur als Lazy-Fallback. Gemini hatte das 07.07. still auf PC-CPU umgebaut — zurückgedreht, Messung gewann.
  • Kein Multi-Agent in der Voice-Lane (3× Latenz-Falle). Multi-Agent JA für Radar (Fan-out) und Werkstatt (Worker/Reviewer).

Hermes-Betrieb

  • Hermes-Quellcode NIE forken/patchen; interne Prompts bleiben ENGLISCH. Deutsch kommt aus SOUL.md (verifiziert); alles User-Sichtbare (Meldungen, Skills, Summaries) = deutsch.
  • Tool Search NICHT auf on (steht auf auto, schläft de facto). Es optimiert Cloud-Token-Kosten; wir optimieren lokale Latenz mit Prompt-Caching — on war gemessen LANGSAMER (15,1 s statt 57 s).
  • Zed ACP / Hermes-im-Editor: NICHT machen. Editor-Agent + Box-coder-Modell + AGENTS.md ist der Sweet Spot; Hermes dazwischen = 70-KB-Prompt-Overhead. (Zed selbst ist inzwischen vom PC entfernt — Hermes Desktop übernahm.)
  • approvals.cron_mode: deny bleibt (Autonomie-Härtung 1c, User wählte Option A): Gefahr-Befehle + execute_code sind im Cron-/Autonom-Kontext geblockt, interaktiv smart.
  • Fremd-Kritik via fremdblick.sh (Ein-Schuss an leichtes Fremdmodell), NIE via delegate_task→heavy (64k-Floor + Lade-Tod). Raster: prose=GLM-4.7-Flash (kritiker), code=Coder-Next. Harte Regel: REPRODUZIERT-ODER-ABGELEHNT — Freispruch nur mit belegtem Vorher/Nachher.
  • Erinnerungen/Wecker laufen deterministisch in UNSERER Schicht (services/reminders.py), bewusst ohne Hermes-cron.

Sonstiges

  • LobeChat/WebUI-Ersatz verworfen (Multi-User-Fehlpassung — Lehre: Scope challengen).
  • Smart Turn v3: Audio LINKS padden; Output ist empirisch P(unfertig) — Doku behauptet das Gegenteil. Läuft im Voice-Sidecar (/turn, ~110 ms).
  • Lokaler GPU-Klon (9070 XT): Stack = llama.cpp-Vulkan + llama-swap, NICHT Lemonade (deprecated Python, Server blockiert, Hybrid unsupported). Zweck/Umfang offen.
  • Aussortiert (tot): Kyutai-Streaming-STT (nur EN/FR) · Unmute-Voll-Stack · LXC 105 (alt) · WebUI-Update-Checks · openWakeWord (Wake-Gate ist STT-basiert).

Prüfstand 24.07.2026 — Coder-Backend + Modell (ROCm-Recheck erledigt)

Gemessen mit llama-bench (Vulkan/RADV, Q4_K_M, -fa on) auf der Box (Ryzen AI Max+ 395):

Test Coder-Next 80B-A3B Devstral Small 2 24B dense
pp2048 @ 0 702 t/s 468 t/s
tg64 @ 0 59 t/s 15 t/s
pp2048 @ 8192 638 t/s 315 t/s
tg64 @ 8192 55 t/s 14 t/s
pp2048 @ 32768 488 t/s 63 t/s (7,7x langsamer)
tg64 @ 32768 47 t/s 11 t/s (4,2x langsamer)
  • Backend bleibt Vulkan (ROCm-Recheck 24.07. erledigt). Vulkan-Prefill haelt bei 32K noch 488 t/s — der einzige ROCm-Vorteil (Langkontext-Prefill) ist auf dieser Box kein Engpass. Der Autor des fuehrenden ROCm/Strix-Halo-Rezepts ist im Juli 2026 selbst zu Vulkan zurueckgekehrt (+28% Decode). Kein ROCm-Bau — Produktiv-Risiko fuer null Gewinn. Wiedervorlage nur bei neuem Engine-Langkontext-Support oder einem reinen HIP-Modell.
  • Coder bleibt Qwen3-Coder-Next — jetzt gemessen bestaetigt. Devstral Small 2 (einziger neuer agentisch trainierter Dense-Kandidat) ist 4x langsamer bei Generierung und bricht beim 32K-Prefill auf 63 t/s ein (~9 min um einen 32K-Kontext zu lesen). Fuer agentisches Coden auf dieser Box disqualifiziert — Reliabilitaet war nicht einmal noetig als Argument.
  • Der Coder ist nicht langsam (59 t/s). Das Fassaden-/Halluzinations-Problem ist kein Speed- und kein Backend-Problem und wird weder durch Modelltausch noch ROCm geloest. Es ist Reliabilitaet = Modellklasse + Harness. Naechster Hebel: Post-Edit-Verify-Hook, kleine Etappen/frische Threads, Eskalation der harten 20% an Frontier.