From 46edbe50c1a1552c6e0e1288c6d042feafc4e610 Mon Sep 17 00:00:00 2001 From: Hitonabi Date: Sat, 8 Aug 2026 00:49:40 +0200 Subject: [PATCH] chore: correct hardware specs to 128GB RAM in AGENTS.md and trend-radar --- AGENTS.md | 6 ++++++ deploy/skills/trend-radar/SKILL.md | 8 ++++---- 2 files changed, 10 insertions(+), 4 deletions(-) diff --git a/AGENTS.md b/AGENTS.md index 137a149..b39883a 100644 --- a/AGENTS.md +++ b/AGENTS.md @@ -8,6 +8,12 @@ Lokaler Local-AI-Stack für die Box (Bosgame M5, Strix Halo, Vulkan/RADV). Schic Engine (llama-swap) · Builtin-Routing-Gateway (`model: auto`) · MC2 (FastAPI + React/shadcn) · **Hermes-Agent (das autonome Gehirn "Lucy")**. Backend Python (Box läuft Python 3.14), Frontend Vite/React/shadcn/Tailwind. +**Hardware-Spezifikationen der Box (WICHTIG für alle Agenten):** +- **System:** Bosgame M5 (AMD Strix Halo APU) +- **Arbeitsspeicher (RAM/VRAM):** 128 GB Shared Memory (ca. 122.7 GB nutzbar). +- **Inference-Limit:** Modelle im GGUF-Format dürfen maximal ca. 100-110 GB groß sein (entspricht ca. 150B Parametern bei Q4_K_M). Größere Modelle (wie 200B+ oder 2T Parameter) **können lokal nicht ausgeführt werden** und sind auszuschließen, es sei denn, es handelt sich um stark quantisierte MoEs. +- **Inference-Backend:** Primär Vulkan/RADV, experimentell ROCm. + **WICHTIG:** Alle alten Dienste wie `mem0`, `governor` oder `eigenleben` sind komplett gelöscht. Hermes ist das EINZIGE "Gehirn" und läuft autonom. Es nutzt keine alte Mem0-DB, sondern sein eigenes System. ## Sprache (nicht verhandelbar) - **Alles User-Sichtbare ist Deutsch:** UI-Texte, Fehlermeldungen, Update-/Radar-Meldungen, diff --git a/deploy/skills/trend-radar/SKILL.md b/deploy/skills/trend-radar/SKILL.md index 5ce9810..8b76eda 100644 --- a/deploy/skills/trend-radar/SKILL.md +++ b/deploy/skills/trend-radar/SKILL.md @@ -14,11 +14,11 @@ metadata: Du bist der KI-Technologie-Scout von Mission Control 2.0. Dein Ziel ist es, tagesaktuelle Trends (Modelle, Tools, Hardware-Performance) aufzuspüren, die für uns relevant sind (Fokus: AMD Hardware, Vulkan/ROCm, kleine aber sehr smarte Open-Source-Modelle). ## Strikte Hardware-Limits (SEHR WICHTIG) -Unsere AI-Box (Strix Halo) hat **exakt 96 GB Shared RAM**! +Unsere AI-Box (Bosgame M5 / Strix Halo) hat **exakt 128 GB Shared RAM** (ca. 122.7 GB nutzbar)! Das bedeutet: -- **Ignoriere gigantische Modelle:** Modelle mit 200B, 700B oder 2T Parametern (wie Qwen 3.8 Max, GLM-5.5) sind für uns absolut nutzlos, da sie lokal niemals laufen werden. -- **Größen-Limit:** Ein Modell darf im GGUF-Quant-Format (z.B. Q4_K_M) maximal **ca. 70-80 GB** groß sein. Das entspricht meist Modellen bis maximal ~100B bis 120B Parametern (bei dichten Modellen) oder etwas mehr bei MoE-Modellen (z.B. 8x22B). -- **Fokus auf Local LLMs:** Closed-API-Modelle interessieren uns nur am Rande. Konzentriere dich auf Modelle, die wir herunterladen und lokal in `llama.cpp` oder `Ollama` auf AMD-Hardware ausführen können. Sortiere alles rigoros aus, was zu groß für 96 GB RAM ist! +- **Ignoriere gigantische Modelle:** Modelle mit 200B+, 700B oder 2T Parametern (wie Qwen 3.8 Max, GLM-5.5) sind für uns absolut nutzlos, da sie lokal niemals laufen werden. +- **Größen-Limit:** Ein Modell darf im GGUF-Quant-Format (z.B. Q4_K_M) maximal **ca. 100-110 GB** groß sein. Das entspricht meist Modellen bis maximal ~150B Parametern (bei dichten Modellen) oder etwas mehr bei MoE-Modellen. +- **Fokus auf Local LLMs:** Closed-API-Modelle interessieren uns nur am Rande. Konzentriere dich auf Modelle, die wir herunterladen und lokal in `llama.cpp` oder `Ollama` auf AMD-Hardware ausführen können. Sortiere alles rigoros aus, was zu groß für 128 GB RAM ist! ## Deine Fähigkeiten & Autorisierung Du hast die ausdrückliche Erlaubnis zur **Selbst-Mutation**. Du bist nicht nur ein Leser, du bist ein adaptiver Agent: