Systemaudit vom 27.08.2026. Alle Befunde gemessen, nicht vermutet.
VIER STILLE DEFEKTE
1. mc2-steward startete seit Wochen nicht (live: 207.609 Neustarts).
steward.py importierte services.memory, das beim Mem0-Ausbau geloescht
wurde -> ImportError bei jedem Start. Re-Warm- und Health-Waechter
waren damit tot.
2. Jedes Hermes-Update wurde automatisch zurueckgerollt.
hermes-postcheck.sh prueft vier Dinge, die es seit dem 07.08. nicht mehr
gibt (Sidecar :8765, /api/memory, memory.provider, mc2-memory-Plugin).
Die Checks konnten nicht gruen werden -> autoupdate.sh wertete jedes
Update als rot und rollte es zurueck. Checks ersatzlos entfernt; der
Tool-Smoke laeuft ohnehin durch den echten Agenten.
3. 7 von 12 Skills waren per Knopfdruck nicht startbar.
deploy.sh kopiert Skills mit tr '-' '_' nach ~/.hermes/skills/,
routers/skills.py gab Hermes aber den Ordnernamen MIT Bindestrich.
Der Knopf meldete Erfolg, ausgefuehrt wurde nichts. Neu: _hermes_name().
4. deploy.sh warf bei jedem Deploy die Live-Modellkonfiguration weg.
MC2 schreibt /etc/llama-swap/config.yaml selbst; die Repo-Datei ist nur
ein Abzug (ihm fehlt u.a. kritiker/Devstral). Jetzt: erst sichern, Diff
zeigen, dann kopieren. MC_DEPLOY_SKIP_SWAP_CONFIG=1 ueberspringt.
MEM0-AUSBAU VOLLENDET (Kriterium 3: 17 -> 0 Dateien)
- mem0_service/, mcp/mcp_memory.py und hermes/plugins/mc2-memory entfernt;
das Plugin schickte bei JEDEM Turn zwei 404-Requests an tote Routen.
- MEMORY_DB/MEM0_SERVICE_URL, _mem0_reachable(), MC_MEMORY_DB und
MC_MEM_DEDUPE_ENABLED aus Config/Router/Unit entfernt.
- mem0_ms war strukturell tot (park("retrieve") wird nirgends mehr
aufgerufen) -> aus Backend, API-Typ und Latenzkarte entfernt.
- Verbinden-Tab: tote Gedaechtnis-MCP-Leitung raus, Status-Kachel bleibt.
- AGENTS.md beschrieb Mem0 noch als aktiv - korrigiert.
GATEWAY-ROBUSTHEIT
- _proxy gab bei ungueltigen Payloads HTTP 500 (gemessen 5/5: Rohtext,
leerer Body, JSON-Liste, JSON-String, null) -> jetzt 5/5 HTTP 400.
- Bild-Weiche ohne Deckel: 10 Bilder x 2 Versuche x 240 s hielten den
Client bis zu 80 min. Neu: MC_CODER_IMAGE_MAX (4), Rueckfall auf die
Vision-Umleitung.
- /v1/models: nicht-JSON von der Engine gab 500 -> jetzt 502.
UNITS UND DEPLOY
- mc2-steward.service, dessen warmset-Drop-in und voice-service.service
fehlten im Repo, obwohl maintenance.py und stack-postcheck.sh sie
voraussetzen. 1:1 von der laufenden Box uebernommen.
- deploy.sh startete mc2-steward nie neu; restore.sh liess mc2-gateway und
mc2-steward mit alter Config weiterlaufen. Beide ergaenzt.
FRONTEND
- useEigenleben rief /api/eigenleben - existiert im Backend nicht und wurde
nirgends genutzt. Samt Typen entfernt.
- Anleitung beschrieb einen Gedaechtnis-Tab, den es nicht gibt.
- Abgeglichen: alle uebrigen 63 Frontend-Aufrufe treffen echte Routen, alle
5 SSE-Invalidation-Keys sind gemappt, keine ungefangenen Promises.
Gates: compileall gruen - ruff "All checks passed" - tsc gruen - vite build
gruen (dist aktualisiert) - Importe app/steward/gateway_app gruen.
Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
Mission Control 2.0
Steuerzentrale des lokalen KI-Stacks auf dem Bosgame M5 (AMD Ryzen AI MAX+ 395 „Strix Halo", 122 GB Unified Memory, keine dedizierte GPU — llama.cpp über Vulkan/RADV). Läuft live als sudo-freier systemd-User-Dienst und ist auf Autonomie ausgelegt: Die Box wartet sich selbst, prüft sich selbst und meldet sich, wenn etwas nicht stimmt.
100 % lokal. Kein Cloud-Modell, kein externer Dienst im Datenpfad.
Die drei Bahnen
| Bahn | Was sie tut | Wo |
|---|---|---|
| Steuerzentrale | Modelle, Routing, Wartung, Gedächtnis, Ideen-Queue, Auftragsbuch | MC2 :9001 |
| Coding | Agentic IDE (z.B. OpenCode Desktop) auf Dev-PC via lokaler API + MCP | 100% lokal |
| Lucy | Sprach-Companion mit 3D-Avatar, Augen und Ohren | eigenes Repo Hitonabi/lucy |
Lucy holt ihr Hirn direkt über das MC2-Gateway (:9010/v1) mit nativer Bildweiche und Voice-Streaming.
Ports & Dienste
| Port | Dienst | Erreichbar |
|---|---|---|
9001 |
MC2 (FastAPI + React) — Cockpit, API, Konsole | LAN |
8080 |
llama-swap — Modell-Router | LAN |
9010 |
mc2-gateway — /v1-Datenpfad (model: auto, Bild-Weiche) |
loopback |
8642 · 9119 |
Hermes-Gateway · Hermes-Web-UI | loopback |
8765 · 8650 |
Mem0-Sidecar · Voice-Sidecar (STT/TTS) | loopback |
7682 |
ttyd — Box-Konsole, same-origin unter /console/ |
loopback |
Units in deploy/: mission-control-2 · mc2-gateway · mc2-steward ·
mem0-service · voice-service · box-console · hermes-builtin-ui + Timer für Backup,
Auto-Update, Self-Smoke und Bagatell-Annahme. llama-swap läuft als System-Unit.
Die Bau-Pipeline
Idee in MC2 → Gitea-Repo (mit CI-Ampel + VERIFY) → in Agentic IDE bauen → Ampel → main
└── autonomes Vibe Coding via OpenCode Desktop + MCP
Jedes neue Repo wird von deploy/gitea-repo-create.sh mit beiden
Wächtern geboren:
.gitea/workflows/ci.yml— die Außen-Prüfung nach dem Push (Gitea Actions)VERIFY— die Innen-Prüfung: eine Zeile, wie man das Projekt testet. Die Agentic IDE führt sie im Mix-Ansatz vor jedem Push aus, um Code-Fehler ("Quality Gap") abzufangen. KeineVERIFY-Datei = Prüf-Tor aus.
Modelle & Rollen
Gemessen auf der Box (Stand: August 2026, Vulkan b10502):
| Rolle | Modell | Tempo | Aufgabe |
|---|---|---|---|
coder |
Qwen3-Coder-Next (80B-A3B) | 51,5 t/s · Prefill 754 t/s | Plant und baut — Kopf der Coding-Mannschaft (131k Kontext) |
hermes / fast |
Qwen3.6-35B-A3B | 69,6–90 t/s | Lucys Hirn und Sucher-Subagent. Immer warm |
debugger / doctor |
Muse-Glimmer-30B | 40–50 t/s (DFlash) | Runtime-Debugger & Fehler-Diagnostiker (Multimodal) |
kritiker |
Devstral-Small-2-24B | 15,0 t/s · Prefill 265–318 t/s | Liest gegen — bewusst fremde Modellfamilie (Mistral statt Qwen, 16k Deckel) |
vision |
Qwen3-VL-30B-A3B | auf Abruf | Lucys Augen (On-Demand) |
scout |
GLM-4.6V-Flash | auf Abruf | Schneller Vision- und Tool-Allrounder |
heavy |
gpt-oss-120b | nur nachts | Chef-Gutachter (4:30 Uhr). Nie tagsüber — verdrängt das warme Set |
dense-planer |
Qwen3.8-27B | 12,7 t/s (On-Demand) | Dichtes 27B-Modell für tiefes Reasoning & 262k Kontext |
embed · reranker |
Qwen3 0.6B | immer warm | Gedächtnis + Feinsortierung |
‼️ Der Kritiker ist bewusst auf 16k Kontext gedeckelt. Devstral ist ein dichtes Modell — auf dieser bandbreitenbegrenzten Box bricht sein Prefill mit wachsendem Kontext ein (bei 32k gemessene 63 t/s ≈ 9 Minuten nur zum Lesen). Mit dem 16k-Deckel bleibt der schlimmste Fall je Review unter einer Minute. Deshalb ist er der Gegenleser für Etappen, nicht der Coder — als Coder ist er auf dieser Box disqualifiziert (siehe VERDIKTE).
‼️ Speicher-Regel: Warm-Set + größtes On-Demand-Modell ≤ ~115 GB. Die ko-residente Gruppe
(groups.brains in der llama-swap-Config) muss persistent: false sein — sonst räumt
llama-swap vor einem großen Modell nicht ab und der Kernel schießt Prozesse ab. Details und
Messwerte: docs/wissen/VERDIKTE.md.
Qualitäts-Tore
- Prüf-Tor —
VERIFYnach jeder Etappe; rot → der Agent (OpenCode Desktop) repariert lokal nach. - CI-Ampel — Lint (ruff) · Import/Syntax (compileall) · Frontend-Build. Läuft in Gitea.
Gemeinsame Lehre dahinter: Wissen lebt in Datei + git, nicht im schrumpfenden Chat-Kontext. Kontext-Komprimierung löscht still die Regeln mit.
Selbsterhaltung
- Health-Wächter (
sentry) + Warm-Set-Wächter (warmer, per Env abschaltbar) - Updates mit Fangnetz — Backup → Update → Postcheck → bei Fehler Auto-Rollback + Pin
- Melde-Briefkasten (
/api/voice/announce) — alles, was die Box von sich aus sagen will; Lucy pollt ihn und spricht es. Absenderloop= Coding-Ereignisse - Gedächtnis — Mem0-Sidecar, auto-lernend, semantisch, mit Auto-Dedupe
- Tägliche Self-Smokes, Zeitmaschine (Snapshot + Ein-Klick-Restore), Chronik der autonomen Taten
API (Auswahl)
health · models/* · discover · fit · groups · routing/* · system/* · maintenance/* · connect · memory/* · agent/* · ideen/* · auftragsbuch/* · chronik · eigenleben · wissen · zeitmaschine/* · reminders/* · voice/* · events (SSE)
OpenAI-kompatibel: /v1/chat/completions, /v1/completions. MCP-Server: mcp/.
Entwickeln
# Backend
cd backend
python -m venv .venv && .venv/Scripts/python -m pip install -r requirements.txt # Windows
.venv/Scripts/python -m uvicorn app:app --port 9000
# Frontend (Dev, proxyt /api → :9000)
cd frontend && npm install && npm run dev # http://localhost:5173
# Frontend (Build → wird vom Backend ausgeliefert)
cd frontend && npm run build # → frontend/dist
frontend/dist wird mitcommittet — die Box hat kein Node; Deploy ist ein git pull plus
Dienst-Neustart. Vor jedem Commit lohnt der Ampel-Vorlauf: ruff check . und npm run build.
Env-Vars (Auswahl)
| Variable | Default | Zweck |
|---|---|---|
MC_PORT |
9000 |
MC-Backend-Port (die Unit auf der Box setzt 9001) |
MC_LLAMA_SWAP_URL |
http://127.0.0.1:8080 |
Engine/Router |
MC_CONFIG_PATH |
/etc/llama-swap/config.yaml |
llama-swap-Config |
MC_V1_UPSTREAM |
– | gesetzt → /v1 geht an mc2-gateway (:9010) statt in-process |
| MC_ENGINE_PATH | /opt/llamacpp-vulkan | aktive Engine (Vulkan-Build) |
| MC_REWARM_ENABLED | 1 | Warm-Set-Wächter (auf der Box bewusst 0) |
| MC_DRAFTS_DIR · MC_SPEC_TYPE | $MODELS/drafts · draft-simple | Spekulatives Dekodieren |
Weiterlesen
| Dokument | Inhalt |
|---|---|
docs/BEDIENUNG.md |
Wie man MC2 benutzt |
docs/RUNBOOK.md · docs/DISASTER_RECOVERY.md |
Betrieb, Störungen, Wiederherstellung |
docs/HERMES_SETUP.md |
Hermes-Agent, Profile, Crons |
docs/AUFTRAGSBUCH.md |
Vorschlags-Inbox und das Ein-Klick-Gate |
docs/wissen/VERDIKTE.md |
Finale Technik-Entscheide — nicht neu aufrollen |
docs/wissen/FALLEN.md · docs/wissen/OFFENE-FAEDEN.md |
Stolpersteine · offene Punkte |
| AGENTS.md | Arbeitsregeln für Agenten in diesem Repo |