docs(stack): Rollen-Tabellen auf den gemessenen Stand - Kritiker war Fiktion
Ampel / ampel (push) Successful in 21s
Ampel / ampel (push) Successful in 21s
Recherche zur offenen Frage "fehlt der kritiker?": Er fehlt nicht, er wurde abgeschafft. Die Modell-Konsolidierung (9a35be9, 19.08.) warf Devstral aus llama-swap, und fremdblick.sh - der EINZIGE Aufrufer der Rolle - fiel mit dem MC2-Kahlschlag (1e68f62). Live gegengeprueft: kein Skill, keine Hermes-Config und kein Profil nennt 'kritiker'. Gewollt so: ein Coder, ein Agent-Hirn. Beim Abgleich zeigte sich, dass die Tabellen weit mehr erfanden als den Kritiker. Gegen /etc/llama-swap/config.yaml geprueft sind es SIEBEN Rollen: hermes/fast, coder, debugger, vision, heavy, reranker, embed. Korrigiert: - `coder` stand als Qwen3-Coder-Next (80B MoE, 51,5 t/s) drin - real ist es Qwen3.8-27B mit 131k ctx und ~12,7 t/s. Der Eintrag `dense-planer` war dasselbe Modell ein zweites Mal: es ist kein Planer NEBEN dem Coder, es IST der Coder. - `kritiker`, `scout` und `doctor` existieren nicht mehr - Zeilen raus, mit Notiz warum, damit niemand wieder danach sucht. - Hermes v0.20.4 -> v0.20.6; die Behauptung eines Bot-Rosters ("Coder mit Qwen3-Coder-Next, Debugger mit Muse-Glimmer") ist frei erfunden: die bots-Sektion in ~/.hermes/config.yaml ist LEER, die Profile fahren hermes, fast und vision. - README verlangte fuer die Gruppe `brains` ausdruecklich `persistent: false` - live steht `true`. Auf die gemessene Regel korrigiert: entscheidend ist nicht der Schalter, sondern dass alles gleichzeitig Warme in DIESELBE Gruppe gehoert (zwei Gruppen verdraengen sich, persistent schuetzt nicht davor). Weiter geprueft und richtiggestellt: - config.py behauptete, die Hermes-UI binde NUR auf Loopback. Tut sie nicht: ein systemd-Drop-in setzt --host 0.0.0.0 und dafuer ein Session-Token. Dass sie nicht im LAN haengt, liegt allein an ufw - von einem zweiten Rechner aus gegengeprueft (9119/8642/9010/7682 dicht, 9001/8080 offen wie gewollt). Der Kommentar sagt das jetzt, damit sich niemand auf die Loopback-Annahme verlaesst. - AGENTS.md: die feingranularen sudoers.d-Regeln schraenken nichts ein, weil /etc/sudoers pauschal NOPASSWD: ALL gewaehrt. Steht jetzt dort, statt Sicherheit vorzutaeuschen. (Die doppelte Zeile wurde auf der Box entfernt, visudo -c ok, Sicherung /root/sudoers.bak-20260827-170315.) Auf der Box ausserdem: Qwen3-Coder-Next-GGUF geloescht (46 GB frei, 240G -> 194G). Der Ordner war in der Live-Config mit 0 Treffern nicht mehr eingebunden; die drei verbliebenen Code-Referenzen sind ein Katalog-Eintrag zum Wiederinstallieren und zwei Kommentare zur Groessen-Heuristik. Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
This commit is contained in:
co-authored by
Claude Opus 5
parent
2935752613
commit
3d1881f4bc
+19
-12
@@ -43,28 +43,35 @@ diese Datei. Wer sie ändert: erst messen, dann schreiben._
|
||||
|
||||
## Modell-Stack (llama-swap, live 19.08.2026)
|
||||
|
||||
**Warm-Set (Gruppe `brains`, swap:false, persistent:false, alle ttl 0):**
|
||||
**Warm-Set (Gruppe `brains`, swap:false, persistent:true, alle ttl 0):**
|
||||
Qwen3.6-35B-A3B + Qwen3-Embedding-0.6B + Qwen3-Reranker-0.6B. Sonst NICHTS dauerhaft warm.
|
||||
|
||||
| Alias/Rolle | Modell | ttl | Notizen |
|
||||
|---|---|---|---|
|
||||
| `hermes` + `fast` | Qwen3.6-35B-A3B (UD-Q4_K_M, DFlash) | 0 | Agent-Hirn. `-c 131072 --parallel 2` → **65536/Slot**, KV **q8_0**, ~70–90 t/s |
|
||||
| `coder` | Qwen3-Coder-Next (Q4_K_M) | 5400 | 131k ctx; Autonomer Coder & Builder (80B MoE, 51,5 t/s) |
|
||||
| `debugger` / `doctor` | Muse-Glimmer-30B (Q4_K_XL, DFlash) | 600 | 65k ctx; Runtime-Diagnostik & Fehler-Debugger (Multimodal) |
|
||||
| `kritiker` | Devstral-Small-2-24B (Q4_K_M) | 1800 | 16k ctx Deckel; Fremdblick-Code-Reviewer gegen Halluzinationen |
|
||||
| `vision` | Qwen3-VL-30B-A3B (Q4_K_M) | 900 | Multimodal-Augen (On-Demand) |
|
||||
| `scout` | GLM-4.6V-Flash (Q4_K_M) | 300 | Schneller Tool- und Vision-Allrounder |
|
||||
| `heavy` | gpt-oss-120b (mxfp4) | 600 | 32k ctx; Chef-Gutachter (nur nachts / gezielter On-Demand Call) |
|
||||
| `dense-planer` | Qwen3.8-27B (Q4_K_M, BF16 mmproj) | 300 | 65k ctx; Dichtes 27B-Modell für tiefes Planen & Multimodalität |
|
||||
| `reranker` | Qwen3-Reranker-0.6B (q8_0, Mungert) | 0 | Gedächtnis-Sortierer (`/v1/rerank`) |
|
||||
| `embed` | Qwen3-Embedding-0.6B (f16) | 0 | Vektorisierung für Chroma / Mem0 |
|
||||
| `coder` | Qwen3.8-27B (Q4_K_M, mmproj BF16) | 5400 | **131072 ctx** — `--parallel 1`, der Coder bekommt den ganzen Slot (34a9862). Multimodal, ~12,7 t/s (dicht = bandbreitengebunden) |
|
||||
| `debugger` | Muse-Glimmer-30B (Q4_K_XL, DFlash) | 600 | 65536 ctx; Runtime-Diagnostik & Fehler-Debugger (multimodal) |
|
||||
| `vision` | Qwen3-VL-30B-A3B-Instruct (Q4_K_M) | 900 | 32768 ctx; Multimodal-Augen (On-Demand) |
|
||||
| `heavy` | gpt-oss-120b (mxfp4) | 600 | 32768 ctx; Chef-Gutachter (nur nachts / gezielter On-Demand-Call) |
|
||||
| `reranker` | Qwen3-Reranker-0.6B (q8_0, Mungert) | 0 | Sortiert Suchtreffer nach echter Relevanz (`/v1/rerank`) |
|
||||
| `embed` | Qwen3-Embedding-0.6B (f16) | 0 | Vektorisierung für Suche/Sortierung |
|
||||
|
||||
> **Diese sieben sind ALLES** — abgeglichen mit `/etc/llama-swap/config.yaml` am 27.08.2026.
|
||||
> Frühere Tabellen führten zusätzlich `kritiker` (Devstral-Small-2-24B), `scout` (GLM-4.6V-Flash),
|
||||
> `dense-planer` und `doctor`. Die gibt es nicht mehr: die Modell-Konsolidierung (`9a35be9`, 19.08.)
|
||||
> warf sie aus llama-swap, und `fremdblick.sh` — der einzige Aufrufer des Kritikers — fiel mit dem
|
||||
> MC2-Kahlschlag (`1e68f62`). Gewollt so: **ein Coder, ein Agent-Hirn.** `kritiker` und `scout` stehen
|
||||
> weiterhin in `ROLE_IDS` (backend/services/llamaswap.py) — das ist die Liste besetzbarer Rollen,
|
||||
> keine Zusage, dass sie besetzt sind.
|
||||
|
||||
Config: `/etc/llama-swap/config.yaml` (sudo zum Schreiben).
|
||||
|
||||
## Hermes (Agent)
|
||||
|
||||
- **v0.20.4** (git-Install `~/.hermes/hermes-agent`), Config `~/.hermes/config.yaml`, Persona `~/.hermes/SOUL.md` = **Lucy**.
|
||||
- **Bot Mode:** Unterstützt Multi-Bot-Roster (`Lucy` als Haupt-Agentin, `Coder` mit `Qwen3-Coder-Next`, `Debugger` mit `Muse-Glimmer-30B`).
|
||||
- **v0.20.6** (2026.8.27, git-Install `~/.hermes/hermes-agent`), Config `~/.hermes/config.yaml`, Persona `~/.hermes/SOUL.md` = **Lucy**.
|
||||
- **Bot-Roster: leer** (live geprüft 27.08.2026). Hermes *kann* mehrere Bots, genutzt wird es nicht —
|
||||
die Profile fahren `hermes`, `fast` und `vision`. Frühere Fassungen behaupteten hier einen Roster
|
||||
mit `Coder`/`Qwen3-Coder-Next` und `Debugger`; beides trifft nicht zu.
|
||||
- `approvals.mode: smart`, `approvals.cron_mode: deny`.
|
||||
- MCP-Server (aus `~/mission-control-v2/mcp/`): mission-control-stack, hermes-pc-control, hermes-web-fetch, mcp_voice.
|
||||
(`mission-control-memory` ist am 27.08.2026 entfallen — Hermes führt sein Gedächtnis selbst.)
|
||||
|
||||
Reference in New Issue
Block a user