# Finale Verdikte — nicht neu aufrollen ohne neuen, belegten Anlass _Kuratiert 10.07.2026 aus dem Claude-Projektgedächtnis. Jedes Verdikt trägt sein Warum und (wo sinnvoll) die Wiedervorlage-Bedingung. Wer eines kippen will, braucht eine MESSUNG oder einen User-Entscheid — kein „Best Practice sagt aber…" (siehe ARBEITSWEISE.md)._ ## Richtung & Architektur - **MC3-Neubau VERWORFEN (03.07.), „MC2 Final" ERSETZT durch „MC2 lebt" (10.07.).** Kein Basisstation-Neubau; seit dem Ablösungs-Entscheid wird MC2 über die Queue→Karte→Klick-Pipeline weiterentwickelt statt eingefroren. Siehe [ZIELBILD.md](ZIELBILD.md). - **Agent-Runtime: Hermes bleibt.** ZeroClaw-PoC gebaut + abgerissen (01.07.) — der echte Latenz-Fix war das Hirn (gemma→Qwen3.6), nicht die Runtime. (ZeroClaw-Messwerte für den Fall „Hermes-Latenz wird wieder Thema": `docs/ZEROCLAW_POC_RESULTS.md`.) - **Memory-Layer: Mem0 bleibt.** Zep/Letta/Hindsight benchen höher, sind aber schwerer/teils closed; Mem0 = beste Framework-Integration + v3-Algorithmus + läuft deployt. - **Telegram bleibt DER Mobil-Kanal; WhatsApp VERWORFEN (09.07.).** Baileys-Bridge = Meta-ToS- Verstoß mit Bann-Risiko auf der Privatnummer + fragiler Dauerprozess; Alarmkette/Crons sind simple Bot-API-Calls. Neu bewerten nur bei offizieller Personal-Bot-API. - **Multi-Profil Lucy/Werkstatt auf der Box: NICHT nötig (09.07.).** `tui_gateway` lädt hart den `cli`-Bucket, Lucy läuft über `api_server` — die Trennung existiert auf Platform-Ebene. (Das PC-Profil des Hermes Desktop ist ein ANDERER Fall: eigene Maschine.) - **MoA-Preset NICHT adoptiert.** Lädt mehrere Modell-Slots parallel — RAM ist der Engpass. Das sequenzielle Zwei-Kritiker-Gate (Coder-Next + GLM) ist E2E-bewährt und RAM-schonend. - **worker.sh bleibt; natives `delegate_task` nur für interaktive Arbeit (10.07.).** delegate_task kann KEINE Modellwahl pro Aufruf und läuft top-level IMMER background (stirbt in der `-z`-Lane mit dem Prozess). `delegation.model: coder` ist live — Fan-out funktioniert E2E in langlebigen Sessions (Desktop/Telegram/Chat). - **Kein heavy/gpt-oss im heißen Pfad.** heavy läuft mit 32k (< Hermes-Floor 64k) und 60 GB Kaltladen. Als Ein-Schuss-Completion (Chef-Gutachter, Radar-Analyst, Orchestrator-Planung) ok — als delegate_task-Ziel oder Pro-Schritt-Worker nie. ## Engine & Modelle (Box, gfx1151) - **Vulkan/RADV schlägt ROCm** (+12–22 % tg, Cutover 27.06., mehrfach bestätigt; Recheck-Stand 09.07.: hält weiter, einziger ROCm-Vorteil = Langkontext-Prefill auf gpt-oss). **Wiedervorlage: ROCm-Recheck 20.–25.07.2026** (Box-Reminder gesetzt) — falls dann Bedarf: NUR Hybrid für heavy/coder erwägen, **das Hirn bleibt in jedem Szenario auf Vulkan.** - **Lucys Hirn: Qwen3.6-35B-A3B mit MTP-Spec-Draft n-max 3** (+26 %; n-max 4 lohnt nicht). KV **q8_0** (Entscheid 07.07.: Qualität > ein paar GB; der q4_k-Commit lief nie live). `--parallel 2` = bewusster Trade (Mem0-Lernen blockiert nie den nächsten Voice-Turn). - **coder-Lane: Qwen3-Coder-Next, FINAL** („bleiben bei dem was wir haben, nachweislich besser"). Qwen3.6-27B dense gebencht + verworfen (tg 12,7 t/s = 4–7× langsamer). |- **hipEngine + strix-halo-toolboxes/TheRock: beobachten, nicht adoptieren.** hipEngine (natives HIP, nur Qwen3.6, >2× Prefill) ist jung; kyuz0-Toolboxes lösen ein Problem, das die Box nicht hat. Radar/Reminder wachen; Adoption nur nach eigenem brain-bench. |- **Vision-Rolle: GLM-4.6V-Flash bleibt Amtsinhaber.** Qwen-AgentWorld-35B geprüft (Prüfstand t_9daf088f, Speed: tg 26,8 t/s / pp 339,1, Vision: 0/1 korrekt). Qualität deutlich unter GLM-4.6V-Flash, kein Aufsteiger — **abgelehnt**. Wiedervorlage nur bei neuer Version mit nachweislich > 50 % Vision-Rate. |- **dist/ im Git ist ABSICHT.** Box hat kein Node; Deploy = `git reset --hard` + committetes `frontend/dist`. NICHT gitignoren. ## Lucy (Voice-App) - **Shell: Electron, nicht Tauri.** Alle harten Features (Klick-Durchlass-Overlay, Capture, Loopback, Tray, TTS-Spawn) existieren in Electron; Tauri fehlt Region-Klick-Durchlass. - **Stimme: pocket-tts bleibt Default, bis die Mini-Lucy (Kokoro-Finetune) den Live-Test gewinnt.** Qwen3-TTS-1.7B (RTF ~14), Chatterbox („zu delayed"), F5 (nicht streamfähig) — alle verworfen. Mini-Lucy v1 gewann alles Messbare (TTFB 0,45 s vs 1,72 s), scheiterte aber am Live-K.o. „nicht multilingual" → v2-Training läuft (Stand 10.07.). Umschalter in der App. - **STT läuft auf der BOX** (Parakeet-TDT v3, 0,3–0,8 s, praktisch fehlerfreies Deutsch), lokaler Whisper nur als Lazy-Fallback. Gemini hatte das 07.07. still auf PC-CPU umgebaut — zurückgedreht, Messung gewann. - **Kein Multi-Agent in der Voice-Lane** (3× Latenz-Falle). Multi-Agent JA für Radar (Fan-out) und Werkstatt (Worker/Reviewer). ## Hermes-Betrieb - **Hermes-Quellcode NIE forken/patchen; interne Prompts bleiben ENGLISCH.** Deutsch kommt aus SOUL.md (verifiziert); alles User-Sichtbare (Meldungen, Skills, Summaries) = deutsch. - **Tool Search NICHT auf `on`** (steht auf `auto`, schläft de facto). Es optimiert Cloud-Token-Kosten; wir optimieren lokale Latenz mit Prompt-Caching — `on` war gemessen LANGSAMER (15,1 s statt 5–7 s). - **Zed ACP / Hermes-im-Editor: NICHT machen.** Editor-Agent + Box-coder-Modell + AGENTS.md ist der Sweet Spot; Hermes dazwischen = 70-KB-Prompt-Overhead. (Zed selbst ist inzwischen vom PC entfernt — Hermes Desktop übernahm.) - **`approvals.cron_mode: deny` bleibt** (Autonomie-Härtung 1c, User wählte Option A): Gefahr-Befehle + execute_code sind im Cron-/Autonom-Kontext geblockt, interaktiv `smart`. - **Fremd-Kritik via `fremdblick.sh`** (Ein-Schuss an leichtes Fremdmodell), NIE via delegate_task→heavy (64k-Floor + Lade-Tod). Raster: prose=GLM-4.7-Flash (kritiker), code=Coder-Next. Harte Regel: **REPRODUZIERT-ODER-ABGELEHNT** — Freispruch nur mit belegtem Vorher/Nachher. - **Erinnerungen/Wecker laufen deterministisch in UNSERER Schicht** (services/reminders.py), bewusst ohne Hermes-cron. ## Sonstiges - **LobeChat/WebUI-Ersatz verworfen** (Multi-User-Fehlpassung — Lehre: Scope challengen). - **Smart Turn v3:** Audio LINKS padden; Output ist empirisch **P(unfertig)** — Doku behauptet das Gegenteil. Läuft im Voice-Sidecar (/turn, ~110 ms). - **Lokaler GPU-Klon (9070 XT):** Stack = llama.cpp-Vulkan + llama-swap, NICHT Lemonade (deprecated Python, Server blockiert, Hybrid unsupported). Zweck/Umfang offen. - **Aussortiert (tot):** Kyutai-Streaming-STT (nur EN/FR) · Unmute-Voll-Stack · LXC 105 (alt) · WebUI-Update-Checks · openWakeWord (Wake-Gate ist STT-basiert).