This commit is contained in:
@@ -0,0 +1,21 @@
|
||||
---
|
||||
name: pruefstand
|
||||
description: "Holt Prüfstand-Tickets aus dem Kanban-Board, testet neue LLM-Modelle auf Kompatibilität und Systemressourcen und meldet die Ergebnisse via Telegram."
|
||||
version: 1.0.0
|
||||
author: MC2
|
||||
platforms: [linux]
|
||||
metadata:
|
||||
hermes:
|
||||
tags: [pruefstand, evaluation, models, mc2]
|
||||
---
|
||||
|
||||
# Prüfstand (Model Evaluation)
|
||||
|
||||
Der Prüfstand-Skill dient dazu, neue LLMs oder Tooling-Upgrades (oft aus dem Trend-Radar stammend) autonom auf der Box zu evaluieren, bevor sie ins Live-System übernommen werden.
|
||||
|
||||
## Ablauf
|
||||
1. **Ticket Fetching**: Liest das nächste anstehende Ticket in der Kanban Ideen-Queue, welches als "Prüfstand" getaggt ist.
|
||||
2. **Download & Setup**: Lädt das beschriebene Modell (z.B. via `huggingface-cli` oder llama.cpp) in ein isoliertes Test-Verzeichnis.
|
||||
3. **Smoke-Tests**: Führt vordefinierte Benchmarks oder Prompts gegen das Modell aus und überwacht den RAM/VRAM-Bedarf.
|
||||
4. **Bewertung**: Wenn das Modell die Kriterien erfüllt (schnell genug, kein OOM), wird es als "Bestanden" markiert und ein Integrations-Vorschlag erstellt.
|
||||
5. **Report**: Der Commander erhält einen Telegram-Bericht mit den Metriken und der Entscheidung.
|
||||
Reference in New Issue
Block a user