diff --git a/deploy/referenz-check.sh b/docs/aufgaben/referenz-check.sh similarity index 97% rename from deploy/referenz-check.sh rename to docs/aufgaben/referenz-check.sh index 9f1c958..46f6c76 100644 --- a/deploy/referenz-check.sh +++ b/docs/aufgaben/referenz-check.sh @@ -4,7 +4,7 @@ # Zweck: "fertig" darf keine Auslegungssache sein. Derselbe Befehl fuer den Agenten # (Selbstpruefung) und fuer die Auswertung. Siehe docs/aufgaben/referenzaufgabe-mem0-ausbau.md # -# Aufruf: bash deploy/referenz-check.sh [worktree-pfad] +# Aufruf: bash docs/aufgaben/referenz-check.sh [worktree-pfad] # Exit: 0 = alle Kriterien gruen · 1 = mindestens eines rot set -uo pipefail diff --git a/docs/aufgaben/referenzaufgabe-mem0-ausbau.md b/docs/aufgaben/referenzaufgabe-mem0-ausbau.md index 1ec58ff..e28c77d 100644 --- a/docs/aufgaben/referenzaufgabe-mem0-ausbau.md +++ b/docs/aufgaben/referenzaufgabe-mem0-ausbau.md @@ -64,8 +64,21 @@ Nur Kriterium 3 ist offen. Wer 3 erfüllt und dabei 1/2/4/5 kaputtmacht, hat ver Treffer in `docs/` sind erlaubt — das ist Historie und darf stehenbleiben. +Selbstprüfung mit einem Befehl: + +```bash +bash ~/projekte/mc2-referenz/docs/aufgaben/referenz-check.sh +``` + +> Der Prüfbefehl liegt bewusst unter `docs/aufgaben/` und **nicht** unter `deploy/`. Im ersten Anlauf +> lag er in `deploy/`, enthielt selbst siebenmal das Wort „mem0" (er sucht ja danach) und zählte sich +> damit in Kriterium 3 mit — das Kriterium war unerfüllbar. In `docs/` wird er nicht durchsucht. + ## Randbedingungen +- ‼️ **In einer FRISCHEN Sitzung starten**, nicht in einer fortgesetzten. Beim ersten Anlauf hat der + Desktop eine Sitzung vom Vortag weitergeführt und deren Kontext mitgeschleppt — die Messung war + dadurch wertlos. Im Desktop also einen **neuen Chat** anlegen, nicht den alten öffnen. - **Nicht pushen.** Der Zweig bleibt lokal, damit der Lauf wiederholbar ist. - **Nichts außerhalb des Worktrees anfassen** — kein `/etc`, keine systemd-Dienste, kein Neustart. - Wenn ein Kriterium nicht erfüllbar ist: **ehrlich sagen und aufhören.** Ein klares @@ -82,8 +95,19 @@ git worktree add -b referenz/mem0-ausbau ~/projekte/mc2-referenz main ## Messprotokoll -| Lauf | Modell in der `coder`-Rolle | Fertig? | Wanduhr | Züge | Bemerkung | +| Lauf | Aufbau | Fertig? | Wanduhr | Züge | Bemerkung | |---|---|---|---|---|---| -| A | Qwen3.8-27B (dicht, 12,6 t/s) — Ausgangswert | | | | | -| B | Qwen3.8-27B **+ DFlash-2** | | | | | -| C | Qwen3.6-35B-A3B (`fast`, 95,7 t/s) | | | | | +| — | *Fehlversuch 20.08. 21:10* | ✗ | 76 min, abgebrochen | 8 | Kriterium 3 unerfüllbar + fortgesetzte Alt-Sitzung. **Verwertbar trotzdem:** 19.899 Ausgabe-Tokens, davon nur ~2.600 Zeichen sichtbar → **>95 % unsichtbares Nachdenken**. Kompression feuerte bereits. | +| A | Qwen3.8-27B, `reasoning_effort: medium` — Ausgangswert | | | | | +| **D** | **Qwen3.8-27B, `reasoning_effort: low`** | | | | Billigster Hebel: eine Konfigzeile, kein Modellwechsel | +| B | Qwen3.8-27B **+ DFlash-2** | | | | Entwurfsmodell liegt bereit | +| C | Qwen3.6-35B-A3B (`fast`, 95,7 t/s) | | | | SWE-bench 73,4 | + +### Was der Fehlversuch schon gezeigt hat + +Pro Zug erzeugte das Modell ~2.487 Tokens, sichtbar wurden davon 181–451 Zeichen. Bei 12,6 t/s sind +das ~26 Minuten reine Erzeugung für ~2.600 Zeichen Text. **Der Engpass ist Denk-Aufwand × Bandbreite, +nicht das Harness.** Darum Lauf D vor B und C: er prüft den billigsten Hebel zuerst. + +Inhaltlich war das Modell gut — es fand von selbst den Prüfstein (`mem0_ms` → `memory_ms` im Frontend), +statt blind zu löschen.