diff --git a/docs/AUTONOMIE_PLAN.md b/docs/AUTONOMIE_PLAN.md index 88f62a5..8e4eb96 100644 --- a/docs/AUTONOMIE_PLAN.md +++ b/docs/AUTONOMIE_PLAN.md @@ -23,6 +23,30 @@ kleine Wartung autonom, große nur vorbereitet+freigegeben. --- +## Multi-Agent-Verdikt (recherchiert + entschieden 03.07.2026) + +**JA — chirurgisch an 2 Stellen; NEIN bei allem Echtzeit-nahen.** Hermes-Delegation ist reif: +`delegate_task` (goal/context/toolsets, tasks-Array = parallel, role leaf|orchestrator), +Config `delegation:` (max_concurrent_children, max_spawn_depth, eigenes delegation.model/provider). + +- **E4 Radar = Fan-out-Muster:** Manager delegiert pro Komponente/Kategorie einen isolierten + Leaf-Subagent (eigener 65k-Kontext) → recherchiert, **filtert Marketing-Müll**, liefert nur + Substanz-Summary → Manager konsolidiert. Müll erreicht den Haupt-Kontext nie. +- **E6 Werkstatt = Worker/Reviewer-Muster:** Worker patcht im Worktree, SEPARATER Reviewer- + Subagent (frischer Kontext) prüft Diff gegen Auftrag, dann erst Gate+Telegram. (Verdent-Muster, + lokal nachgebaut.) +- **NICHT bei Lucy-Voice** (Konsens 2026: Agent-Ketten ≈ 3× Latenz bei Echtzeit — unsere 2 s sind + heilig). Lucy bekommt stattdessen Delegation als FEATURE: „recherchier ich im Hintergrund" + → Background-Subagent → Ergebnis via Telegram. **NICHT bei der IDE-Lane** (eigene Agent-Loops). +- **Kein Hirn-Tausch:** Parent bleibt Qwen3.6; `delegation.model/provider` → MC2-Gateway. + Manager-/Reviewer-Kandidat = **gpt-oss-120b** (Faden B5 entscheidet heavy-Lane UND Manager-Rolle + in einem). `max_concurrent_children: 2` — passt exakt auf die 2 Hirn-Slots (keine Swap-Thrashes); + `max_spawn_depth: 1` zum Start (flat), Orchestrator erst bei Bedarf. +- **Ehrliche Physik:** eine GPU ⇒ Parallelität bringt KEIN Tempo (geteilte Bandbreite), sondern + Kontext-Isolation + Qualität. Für nächtliche cron-Jobs genau richtig; deshalb Voice-Ausschluss. + +--- + ## Was schon existiert (nutzen, nicht neu bauen!) | Baustein | Wo |