diff --git a/docs/REVIEW_2026-07-02.md b/docs/REVIEW_2026-07-02.md index c253e86..ef9e626 100644 --- a/docs/REVIEW_2026-07-02.md +++ b/docs/REVIEW_2026-07-02.md @@ -251,6 +251,8 @@ Quelle: `/api/voice/metrics` (live) + eigener TTFT-Test gegen llama-swap. ## 7. Nachtrag 2: P2/P3-Vollausbau (02.07., zweite Session-Hälfte) +**Brain-Config LIVE DEPLOYT + verifiziert (02.07., User-Freigabe):** hermes läuft mit `-c 131072 --parallel 2 -ctk/-ctv q8_0` + MTP. Gemessen: **2 gleichzeitige Requests laufen echt parallel** (~1,9 s/2,0 s statt seriell — Mem0-Extraktion blockiert Voice-Turns nicht mehr), tg 66 t/s (leichter parallel-2-Abschlag vs. 78 solo, bewusster Trade), RAM 40/122 GB. **Voice-E2E: neue Session 0,85 s total, first_content 803 ms** (Morgen-Baseline: 5,6–12 s bei neuen Sessions). capabilities werden via /v1/models ausgeliefert. + | Punkt | Ergebnis | |---|---| | **P2-11 Turn-Detection** | ✅ Smart Turn v3.2 (8 MB ONNX) im Voice-Sidecar (`/turn`, ~110 ms warm) + Semantik-Hold im Client (bei „unfertig" bis 1,8 s auf Fortsetzung warten). **Zwei Upstream-Fallen live diagnostiziert:** Audio muss LINKS gepadded werden (sonst konstant „complete"), und der Output ist P(unfertig) — entgegen der Doku. Verifiziert: fertig=0,74→true, mitten im Wort=0,04→false |