Feat: fit-aware Brain-Update (Speicher-Budget) + brains-Kontext gesenkt (Always-On-Footprint)

- Brain-Kontexte gesenkt (live config): hermes 128K->64K, fast/vision 128K->32K
  -> Always-Warm-Footprint 74GB->51GB, ~23GB frei; heavy/coder passen wieder daneben.
- /api/agent/brain liefert jetzt `budget`: projiziert den Always-On-Footprint mit dem
  empfohlenen Brain gegen das GTT-Budget (aus amdgpu.gttsize) und prueft, ob das groesste
  on-demand-Modell daneben passt (fit.estimate_memory_gb).
- Cockpit Agent-Hirn-Karte: Budget-Zeile (gruen/rot) + Warnung im Update-Confirm, wenn ein
  zu grosses Always-On-Brain das groesste on-demand-Modell verdraengen wuerde. Button wird rot.

Co-Authored-By: Claude Opus 4.8 <noreply@anthropic.com>
This commit is contained in:
Hitonabi
2026-06-27 02:56:32 +02:00
parent 510de69250
commit 5b699aaa79
6 changed files with 141 additions and 56 deletions
+9
View File
@@ -315,8 +315,17 @@ export interface HermesBrainCandidate {
fit: Fit
}
export interface HermesBrainBudget {
gtt_gb: number
warm_projected_gb: number // Always-On-Footprint mit dem empfohlenen Brain
free_after_gb: number
largest_ondemand_gb: number // größtes on-demand-Modell (z.B. heavy)
fits: boolean // passt das größte on-demand daneben?
}
export interface HermesBrainResp {
current: HermesBrainModel | null
recommended: HermesBrainCandidate | null
update_available: boolean
budget?: HermesBrainBudget | null
}