a23f4c0652
Gemessen 03.07.: erster User-Call nach Modell-Reload 37 s (Prefill des ~70-KB-Hermes-Prompts, 50 KB davon Tool-Schemas), mit warmem Prompt-Cache ~6 s. warmup.sh schickt nach dem Modell-Laden einen Wegwerf-Turn an den api_server (:8642, wartet auf /health) — der -cram-Cache ist damit gefuellt, bevor der User zum ersten Mal fragt. Strukturelle Prompt-Diaet = Faden 7. Co-Authored-By: Claude Fable 5 <noreply@anthropic.com>