docs(stack): Rollen-Tabellen auf den gemessenen Stand - Kritiker war Fiktion
Ampel / ampel (push) Successful in 21s
Ampel / ampel (push) Successful in 21s
Recherche zur offenen Frage "fehlt der kritiker?": Er fehlt nicht, er wurde abgeschafft. Die Modell-Konsolidierung (9a35be9, 19.08.) warf Devstral aus llama-swap, und fremdblick.sh - der EINZIGE Aufrufer der Rolle - fiel mit dem MC2-Kahlschlag (1e68f62). Live gegengeprueft: kein Skill, keine Hermes-Config und kein Profil nennt 'kritiker'. Gewollt so: ein Coder, ein Agent-Hirn. Beim Abgleich zeigte sich, dass die Tabellen weit mehr erfanden als den Kritiker. Gegen /etc/llama-swap/config.yaml geprueft sind es SIEBEN Rollen: hermes/fast, coder, debugger, vision, heavy, reranker, embed. Korrigiert: - `coder` stand als Qwen3-Coder-Next (80B MoE, 51,5 t/s) drin - real ist es Qwen3.8-27B mit 131k ctx und ~12,7 t/s. Der Eintrag `dense-planer` war dasselbe Modell ein zweites Mal: es ist kein Planer NEBEN dem Coder, es IST der Coder. - `kritiker`, `scout` und `doctor` existieren nicht mehr - Zeilen raus, mit Notiz warum, damit niemand wieder danach sucht. - Hermes v0.20.4 -> v0.20.6; die Behauptung eines Bot-Rosters ("Coder mit Qwen3-Coder-Next, Debugger mit Muse-Glimmer") ist frei erfunden: die bots-Sektion in ~/.hermes/config.yaml ist LEER, die Profile fahren hermes, fast und vision. - README verlangte fuer die Gruppe `brains` ausdruecklich `persistent: false` - live steht `true`. Auf die gemessene Regel korrigiert: entscheidend ist nicht der Schalter, sondern dass alles gleichzeitig Warme in DIESELBE Gruppe gehoert (zwei Gruppen verdraengen sich, persistent schuetzt nicht davor). Weiter geprueft und richtiggestellt: - config.py behauptete, die Hermes-UI binde NUR auf Loopback. Tut sie nicht: ein systemd-Drop-in setzt --host 0.0.0.0 und dafuer ein Session-Token. Dass sie nicht im LAN haengt, liegt allein an ufw - von einem zweiten Rechner aus gegengeprueft (9119/8642/9010/7682 dicht, 9001/8080 offen wie gewollt). Der Kommentar sagt das jetzt, damit sich niemand auf die Loopback-Annahme verlaesst. - AGENTS.md: die feingranularen sudoers.d-Regeln schraenken nichts ein, weil /etc/sudoers pauschal NOPASSWD: ALL gewaehrt. Steht jetzt dort, statt Sicherheit vorzutaeuschen. (Die doppelte Zeile wurde auf der Box entfernt, visudo -c ok, Sicherung /root/sudoers.bak-20260827-170315.) Auf der Box ausserdem: Qwen3-Coder-Next-GGUF geloescht (46 GB frei, 240G -> 194G). Der Ordner war in der Live-Config mit 0 Treffern nicht mehr eingebunden; die drei verbliebenen Code-Referenzen sind ein Katalog-Eintrag zum Wiederinstallieren und zwei Kommentare zur Groessen-Heuristik. Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
This commit is contained in:
co-authored by
Claude Opus 5
parent
2935752613
commit
3d1881f4bc
@@ -49,29 +49,33 @@ Wächtern geboren**:
|
||||
|
||||
## Modelle & Rollen
|
||||
|
||||
Gemessen auf der Box (Stand: August 2026, Vulkan b10502):
|
||||
Gemessen auf der Box (Stand: 27.08.2026, Vulkan b10653):
|
||||
|
||||
| Rolle | Modell | Tempo | Aufgabe |
|
||||
|---|---|---|---|
|
||||
| `coder` | Qwen3-Coder-Next (80B-A3B) | **51,5 t/s** · Prefill **754 t/s** | Plant und baut — Kopf der Coding-Mannschaft (131k Kontext) |
|
||||
| `hermes` / `fast` | Qwen3.6-35B-A3B | **69,6–90 t/s** | Lucys Hirn **und** Sucher-Subagent. Immer warm |
|
||||
| `debugger` / `doctor` | Muse-Glimmer-30B | **40–50 t/s** (DFlash) | Runtime-Debugger & Fehler-Diagnostiker (Multimodal) |
|
||||
| `kritiker` | Devstral-Small-2-24B | **15,0 t/s** · Prefill **265–318 t/s** | Liest gegen — bewusst **fremde Modellfamilie** (Mistral statt Qwen, 16k Deckel) |
|
||||
| `coder` | Qwen3.8-27B (dicht, 27B) | **12,7 t/s** | Plant und baut — der Haupt-Coder. **131k Kontext** (ganzer Slot), multimodal |
|
||||
| `hermes` / `fast` | Qwen3.6-35B-A3B | **69,6–90 t/s** | Lucys Hirn **und** Sucher-Subagent. Immer warm, 65k/Slot |
|
||||
| `debugger` | Muse-Glimmer-30B | **40–50 t/s** (DFlash) | Runtime-Debugger & Fehler-Diagnostiker (multimodal) |
|
||||
| `vision` | Qwen3-VL-30B-A3B | auf Abruf | Lucys Augen (On-Demand) |
|
||||
| `scout` | GLM-4.6V-Flash | auf Abruf | Schneller Vision- und Tool-Allrounder |
|
||||
| `heavy` | gpt-oss-120b | nur nachts | Chef-Gutachter (4:30 Uhr). **Nie tagsüber** — verdrängt das warme Set |
|
||||
| `dense-planer` | Qwen3.8-27B | **12,7 t/s** (On-Demand) | Dichtes 27B-Modell für tiefes Reasoning & 262k Kontext |
|
||||
| `embed` · `reranker` | Qwen3 0.6B | immer warm | Gedächtnis + Feinsortierung |
|
||||
| `embed` · `reranker` | Qwen3 0.6B | immer warm | Vektorsuche + Feinsortierung |
|
||||
|
||||
‼️ **Der Kritiker ist bewusst auf 16k Kontext gedeckelt.** Devstral ist ein *dichtes* Modell —
|
||||
auf dieser bandbreitenbegrenzten Box bricht sein Prefill mit wachsendem Kontext ein (bei 32k
|
||||
gemessene 63 t/s ≈ **9 Minuten nur zum Lesen**). Mit dem 16k-Deckel bleibt der schlimmste Fall
|
||||
je Review unter einer Minute. Deshalb ist er der **Gegenleser für Etappen**, nicht der Coder —
|
||||
als Coder ist er auf dieser Box disqualifiziert (siehe VERDIKTE).
|
||||
> Sieben Rollen, mehr nicht. Frühere Fassungen listeten hier auch `kritiker`, `scout` und
|
||||
> `dense-planer` — die Modell-Konsolidierung vom 19.08. hat sie entfernt (ein Coder, ein
|
||||
> Agent-Hirn). Der dichte 27B ist seither nicht mehr „Planer" neben dem Coder, sondern **ist**
|
||||
> der Coder. Details: `docs/wissen/STACK.md`.
|
||||
|
||||
‼️ **Dichte Modelle sind auf dieser Box bandbreitengebunden.** Der Prefill bricht mit wachsendem
|
||||
Kontext ein — beim früheren Kritiker (Devstral, dicht) waren bei 32k gemessene 63 t/s ≈ **9 Minuten
|
||||
nur zum Lesen**, weshalb er hart auf 16k gedeckelt war. Das gilt weiter für jedes dichte Modell:
|
||||
`coder` (Qwen3.8-27B) liefert ~12,7 t/s gegen ~90 t/s des MoE-Hirns — **kein Konfigfehler, sondern
|
||||
das 215-GB/s-Limit der Plattform.** Der Kritiker selbst ist seit dem 19.08. nicht mehr im Stack.
|
||||
|
||||
‼️ **Speicher-Regel:** `Warm-Set + größtes On-Demand-Modell ≤ ~115 GB`. Die ko-residente Gruppe
|
||||
(`groups.brains` in der llama-swap-Config) muss **`persistent: false`** sein — sonst räumt
|
||||
llama-swap vor einem großen Modell nicht ab und der Kernel schießt Prozesse ab. Details und
|
||||
(`groups.brains`) steht auf **`persistent: true`** (Verdrängungsschutz; live gegengeprüft
|
||||
27.08.2026). Wichtig ist nicht der Schalter, sondern: **alles, was gleichzeitig warm sein muss,
|
||||
gehört in DIESELBE Gruppe** — zwei Gruppen verdrängen sich gegenseitig, und `persistent` schützt
|
||||
nicht davor (gemessen 25.07.). Details und
|
||||
Messwerte: [`docs/wissen/VERDIKTE.md`](docs/wissen/VERDIKTE.md).
|
||||
|
||||
## Qualitäts-Tore
|
||||
|
||||
Reference in New Issue
Block a user