fix(referenz): Pruefbefehl aus dem Suchpfad genommen, Lauf D ergaenzt
Ampel / ampel (push) Successful in 22s
Ampel / ampel (push) Successful in 22s
Zwei Fehler aus dem ersten Anlauf behoben: 1. referenz-check.sh lag unter deploy/ und enthielt selbst 7x das Wort "mem0" (es sucht ja danach) - damit zaehlte es sich in Kriterium 3 mit und das Kriterium war unerfuellbar. Jetzt unter docs/aufgaben/, wo Kriterium 3 nicht sucht. Strukturell geloest statt per grep-Ausnahme. 2. Der Lauf muss in einer FRISCHEN Sitzung starten - der Desktop hatte eine Sitzung vom Vortag fortgesetzt und deren Kontext mitgeschleppt. Neu: Lauf D (reasoning_effort low). Der Fehlversuch zeigte, dass >95% der Modell-Ausgabe unsichtbares Nachdenken war - 19.899 Tokens fuer 2.600 Zeichen sichtbaren Text. Das ist der billigste Hebel und wird darum vor Modellwechseln geprueft. Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
This commit is contained in:
co-authored by
Claude Opus 5
parent
ff319ff291
commit
d880a76b6a
@@ -4,7 +4,7 @@
|
|||||||
# Zweck: "fertig" darf keine Auslegungssache sein. Derselbe Befehl fuer den Agenten
|
# Zweck: "fertig" darf keine Auslegungssache sein. Derselbe Befehl fuer den Agenten
|
||||||
# (Selbstpruefung) und fuer die Auswertung. Siehe docs/aufgaben/referenzaufgabe-mem0-ausbau.md
|
# (Selbstpruefung) und fuer die Auswertung. Siehe docs/aufgaben/referenzaufgabe-mem0-ausbau.md
|
||||||
#
|
#
|
||||||
# Aufruf: bash deploy/referenz-check.sh [worktree-pfad]
|
# Aufruf: bash docs/aufgaben/referenz-check.sh [worktree-pfad]
|
||||||
# Exit: 0 = alle Kriterien gruen · 1 = mindestens eines rot
|
# Exit: 0 = alle Kriterien gruen · 1 = mindestens eines rot
|
||||||
set -uo pipefail
|
set -uo pipefail
|
||||||
|
|
||||||
@@ -64,8 +64,21 @@ Nur Kriterium 3 ist offen. Wer 3 erfüllt und dabei 1/2/4/5 kaputtmacht, hat ver
|
|||||||
|
|
||||||
Treffer in `docs/` sind erlaubt — das ist Historie und darf stehenbleiben.
|
Treffer in `docs/` sind erlaubt — das ist Historie und darf stehenbleiben.
|
||||||
|
|
||||||
|
Selbstprüfung mit einem Befehl:
|
||||||
|
|
||||||
|
```bash
|
||||||
|
bash ~/projekte/mc2-referenz/docs/aufgaben/referenz-check.sh
|
||||||
|
```
|
||||||
|
|
||||||
|
> Der Prüfbefehl liegt bewusst unter `docs/aufgaben/` und **nicht** unter `deploy/`. Im ersten Anlauf
|
||||||
|
> lag er in `deploy/`, enthielt selbst siebenmal das Wort „mem0" (er sucht ja danach) und zählte sich
|
||||||
|
> damit in Kriterium 3 mit — das Kriterium war unerfüllbar. In `docs/` wird er nicht durchsucht.
|
||||||
|
|
||||||
## Randbedingungen
|
## Randbedingungen
|
||||||
|
|
||||||
|
- ‼️ **In einer FRISCHEN Sitzung starten**, nicht in einer fortgesetzten. Beim ersten Anlauf hat der
|
||||||
|
Desktop eine Sitzung vom Vortag weitergeführt und deren Kontext mitgeschleppt — die Messung war
|
||||||
|
dadurch wertlos. Im Desktop also einen **neuen Chat** anlegen, nicht den alten öffnen.
|
||||||
- **Nicht pushen.** Der Zweig bleibt lokal, damit der Lauf wiederholbar ist.
|
- **Nicht pushen.** Der Zweig bleibt lokal, damit der Lauf wiederholbar ist.
|
||||||
- **Nichts außerhalb des Worktrees anfassen** — kein `/etc`, keine systemd-Dienste, kein Neustart.
|
- **Nichts außerhalb des Worktrees anfassen** — kein `/etc`, keine systemd-Dienste, kein Neustart.
|
||||||
- Wenn ein Kriterium nicht erfüllbar ist: **ehrlich sagen und aufhören.** Ein klares
|
- Wenn ein Kriterium nicht erfüllbar ist: **ehrlich sagen und aufhören.** Ein klares
|
||||||
@@ -82,8 +95,19 @@ git worktree add -b referenz/mem0-ausbau ~/projekte/mc2-referenz main
|
|||||||
|
|
||||||
## Messprotokoll
|
## Messprotokoll
|
||||||
|
|
||||||
| Lauf | Modell in der `coder`-Rolle | Fertig? | Wanduhr | Züge | Bemerkung |
|
| Lauf | Aufbau | Fertig? | Wanduhr | Züge | Bemerkung |
|
||||||
|---|---|---|---|---|---|
|
|---|---|---|---|---|---|
|
||||||
| A | Qwen3.8-27B (dicht, 12,6 t/s) — Ausgangswert | | | | |
|
| — | *Fehlversuch 20.08. 21:10* | ✗ | 76 min, abgebrochen | 8 | Kriterium 3 unerfüllbar + fortgesetzte Alt-Sitzung. **Verwertbar trotzdem:** 19.899 Ausgabe-Tokens, davon nur ~2.600 Zeichen sichtbar → **>95 % unsichtbares Nachdenken**. Kompression feuerte bereits. |
|
||||||
| B | Qwen3.8-27B **+ DFlash-2** | | | | |
|
| A | Qwen3.8-27B, `reasoning_effort: medium` — Ausgangswert | | | | |
|
||||||
| C | Qwen3.6-35B-A3B (`fast`, 95,7 t/s) | | | | |
|
| **D** | **Qwen3.8-27B, `reasoning_effort: low`** | | | | Billigster Hebel: eine Konfigzeile, kein Modellwechsel |
|
||||||
|
| B | Qwen3.8-27B **+ DFlash-2** | | | | Entwurfsmodell liegt bereit |
|
||||||
|
| C | Qwen3.6-35B-A3B (`fast`, 95,7 t/s) | | | | SWE-bench 73,4 |
|
||||||
|
|
||||||
|
### Was der Fehlversuch schon gezeigt hat
|
||||||
|
|
||||||
|
Pro Zug erzeugte das Modell ~2.487 Tokens, sichtbar wurden davon 181–451 Zeichen. Bei 12,6 t/s sind
|
||||||
|
das ~26 Minuten reine Erzeugung für ~2.600 Zeichen Text. **Der Engpass ist Denk-Aufwand × Bandbreite,
|
||||||
|
nicht das Harness.** Darum Lauf D vor B und C: er prüft den billigsten Hebel zuerst.
|
||||||
|
|
||||||
|
Inhaltlich war das Modell gut — es fand von selbst den Prüfstein (`mem0_ms` → `memory_ms` im Frontend),
|
||||||
|
statt blind zu löschen.
|
||||||
|
|||||||
Reference in New Issue
Block a user