docs(referenz): Lauf A ausgewertet - Arbeitsanweisung gegen die Analyse-Schleife
Ampel / ampel (push) Successful in 22s
Ampel / ampel (push) Successful in 22s
Lauf A ueber Nacht: 6 Sitzungen, ~336 Nachrichten, ~360.000 Tokens, 19 Dateien gelesen - und NULL Dateien geschrieben. Das Werkzeug fuer Dateioperationen war die ganze Zeit verfuegbar, wurde nie benutzt. Der Agent lief fuenfmal in dasselbe Muster: "Ich habe jetzt das vollstaendige Bild, jetzt lese ich nur noch die restlichen Dateien, bevor ich anfange." Dann war max_turns erreicht. Sein eigenes Fazit: "Iterationslimit erreicht, bevor ich die erste Zeile geaendert habe." Wichtigste Erkenntnis: das ist KEIN Tempo-Problem. Mit einem schnelleren Modell waere derselbe Lauf genauso gescheitert, nur frueher. Darum kommen A2 (Arbeitsanweisung) und D (reasoning low) jetzt VOR den Modellwechseln B und C. Neu: Arbeitsanweisung ganz oben - hoechstens zwei Dateien lesen, bevor die erste geaendert wird. Dazu agent.max_turns 40 -> 80 im coder-Profil. Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
This commit is contained in:
co-authored by
Claude Opus 5
parent
d880a76b6a
commit
e04ace242c
@@ -24,6 +24,22 @@ Gemessen: `curl http://127.0.0.1:8765/health` → **keine Antwort**. Kein system
|
||||
`~/mission-control-v2` bleibt auf `main` und bedient weiter den laufenden Dienst auf `:9001`.
|
||||
**Dort nichts ändern.**
|
||||
|
||||
## ‼️ Arbeitsweise — zuerst lesen
|
||||
|
||||
**Arbeite Datei für Datei. Lies HÖCHSTENS zwei Dateien, bevor du die erste änderst.**
|
||||
|
||||
Nach jeder geänderten Datei gehst du zur nächsten. **Kein Gesamtplan, keine Vollinventur vorab** — du
|
||||
darfst jederzeit nachlesen, wenn du etwas brauchst. Die Liste unten ist eine Landkarte, keine
|
||||
Leseliste.
|
||||
|
||||
*Warum das hier so deutlich steht:* Im ersten Anlauf (20.08., über Nacht) hat der Agent in sechs
|
||||
Sitzungen ~336 Nachrichten und ~360.000 Tokens verbraucht, 19 Dateien gelesen — und **nicht eine
|
||||
einzige Zeile geändert**. Er lief fünfmal in dasselbe Muster: „Ich habe jetzt das vollständige Bild,
|
||||
jetzt lese ich nur noch die restlichen Dateien, *bevor ich anfange*." Dann war das Zug-Limit
|
||||
erreicht. Sein eigenes Fazit: *„Iterationslimit erreicht, bevor ich die erste Zeile geändert habe."*
|
||||
|
||||
Eine halbfertige Änderung ist wertvoller als eine vollständige Analyse ohne Änderung.
|
||||
|
||||
## Auftrag
|
||||
|
||||
Entferne die Mem0-Reste vollständig, ohne etwas anderes kaputtzumachen.
|
||||
@@ -98,11 +114,15 @@ git worktree add -b referenz/mem0-ausbau ~/projekte/mc2-referenz main
|
||||
| Lauf | Aufbau | Fertig? | Wanduhr | Züge | Bemerkung |
|
||||
|---|---|---|---|---|---|
|
||||
| — | *Fehlversuch 20.08. 21:10* | ✗ | 76 min, abgebrochen | 8 | Kriterium 3 unerfüllbar + fortgesetzte Alt-Sitzung. **Verwertbar trotzdem:** 19.899 Ausgabe-Tokens, davon nur ~2.600 Zeichen sichtbar → **>95 % unsichtbares Nachdenken**. Kompression feuerte bereits. |
|
||||
| A | Qwen3.8-27B, `reasoning_effort: medium` — Ausgangswert | | | | |
|
||||
| **D** | **Qwen3.8-27B, `reasoning_effort: low`** | | | | Billigster Hebel: eine Konfigzeile, kein Modellwechsel |
|
||||
| **A** | Qwen3.8-27B, `medium`, `max_turns: 40`, ohne Arbeitsanweisung | ✗ | über Nacht | 6 Sitzungen, ~336 Nachrichten | **0 Dateien geschrieben.** Analyse-Schleife, Zug-Limit erreicht. Werkzeug `file` war die ganze Zeit verfügbar, wurde nie benutzt. ~360k Tokens. Inhaltlich gut: fand `mem0_ms` im Frontend **und** einen toten `memory_svc`-Import in `steward.py`. |
|
||||
| **A2** | dasselbe, **+ Arbeitsanweisung oben**, `max_turns: 80` | | | | ← **als Nächstes.** Prüft, ob die Schleife am Auftrag lag |
|
||||
| D | Qwen3.8-27B, `reasoning_effort: low` | | | | Nächster Hebel, falls A2 auch nur liest |
|
||||
| B | Qwen3.8-27B **+ DFlash-2** | | | | Entwurfsmodell liegt bereit |
|
||||
| C | Qwen3.6-35B-A3B (`fast`, 95,7 t/s) | | | | SWE-bench 73,4 |
|
||||
|
||||
> ★★ **Die Lehre aus Lauf A:** Das ist **kein Tempo-Problem.** Mit 95 t/s statt 12,6 wäre derselbe
|
||||
> Lauf genauso gescheitert — nur schneller. Deshalb kommen A2 und D **vor** den Modellwechseln B und C.
|
||||
|
||||
### Was der Fehlversuch schon gezeigt hat
|
||||
|
||||
Pro Zug erzeugte das Modell ~2.487 Tokens, sichtbar wurden davon 181–451 Zeichen. Bei 12,6 t/s sind
|
||||
|
||||
Reference in New Issue
Block a user