22 lines
1.1 KiB
Markdown
22 lines
1.1 KiB
Markdown
---
|
|
name: pruefstand
|
|
description: "Holt Prüfstand-Tickets aus dem Kanban-Board, testet neue LLM-Modelle auf Kompatibilität und Systemressourcen und meldet die Ergebnisse via Telegram."
|
|
version: 1.0.0
|
|
author: MC2
|
|
platforms: [linux]
|
|
metadata:
|
|
hermes:
|
|
tags: [pruefstand, evaluation, models, mc2]
|
|
---
|
|
|
|
# Prüfstand (Model Evaluation)
|
|
|
|
Der Prüfstand-Skill dient dazu, neue LLMs oder Tooling-Upgrades (oft aus dem Trend-Radar stammend) autonom auf der Box zu evaluieren, bevor sie ins Live-System übernommen werden.
|
|
|
|
## Ablauf
|
|
1. **Ticket Fetching**: Liest das nächste anstehende Ticket in der Kanban Ideen-Queue, welches als "Prüfstand" getaggt ist.
|
|
2. **Download & Setup**: Lädt das beschriebene Modell (z.B. via `huggingface-cli` oder llama.cpp) in ein isoliertes Test-Verzeichnis.
|
|
3. **Smoke-Tests**: Führt vordefinierte Benchmarks oder Prompts gegen das Modell aus und überwacht den RAM/VRAM-Bedarf.
|
|
4. **Bewertung**: Wenn das Modell die Kriterien erfüllt (schnell genug, kein OOM), wird es als "Bestanden" markiert und ein Integrations-Vorschlag erstellt.
|
|
5. **Report**: Der Commander erhält einen Telegram-Bericht mit den Metriken und der Entscheidung.
|