854393ce5f
Das in Haertung 1b eingefuehrte Fremd-Modell-Review delegierte per delegation.model an heavy (gpt-oss) — das aber als Kritiker DOPPELT disqualifiziert ist: Hermes' MINIMUM_CONTEXT_LENGTH=64000 screent den 32k-heavy als delegate_task-Ziel raus, UND heavy (60 GB) stirbt beim Laden neben dem VL-30B-Warmset (Health-Check-Timeout). Die Fremd-Pruefung konnte damit im Werkstatt-Alltag STILL ausfallen (Durchwink-Gefahr, genau das, was 1b verhindern sollte). - deploy/skills/wartung/SKILL.md Schritt 4: statt delegate_task nun `FREMDBLICK_MODE=code fremdblick.sh` (Qwen3-Coder-Next, 128k, anderes Modell als der Qwen3.6-Worker, laedt klein). REPRODUZIERT-ODER-ABGELEHNT bleibt (im Raster verankert), 3-Wege-Urteil ABGELEHNT/FREIGABE-MIT-VORBEHALT/FREIGABE, Fallback bei Ausfall = UNGEPRUEFT. - deploy/fremdblick.sh: FREMDBLICK_MODE=code (Code-Review-Raster + Coder-Next) neben dem Default prose-Raster (Dreaming, unveraendert). E2E gegen die Box verifiziert: kaputter Patch (falsche Bedingung) -> ABGELEHNT mit konkreter Reproduktion; sauberer Fix (Leerlisten-Guard) -> FREIGABE. Kritiker diskriminiert. Co-Authored-By: Claude Opus 4.8 <noreply@anthropic.com>
65 lines
4.8 KiB
Bash
65 lines
4.8 KiB
Bash
#!/usr/bin/env bash
|
|
# Fremdblick — Ein-Schuss-Zweitmeinung von einem ANDEREN Modell (Default: GLM-4.6V-Flash, andere
|
|
# Modell-FAMILIE/Vendor als das Qwen-Worker-Hirn → echte „andere Brille"). Eine EINZELNE
|
|
# Completion — kein agentischer Subagent — umgeht Hermes' 64K-Delegations-Floor
|
|
# (MINIMUM_CONTEXT_LENGTH) UND das 60-GB-Ladeproblem von gpt-oss (das mit dem Warm-Set kollidiert
|
|
# und „exited prematurely" wirft). GLM lädt klein neben dem Warm-Set und antwortet zuverlässig.
|
|
#
|
|
# Nutzung: echo "<Beobachtungen/Behauptungen je mit Beleg>" | fremdblick.sh
|
|
# printf '%s' "$text" | FREMDBLICK_MODEL=Qwen3-Coder-Next FREMDBLICK_SYS="$raster" fremdblick.sh
|
|
#
|
|
# Env-Overrides:
|
|
# FREMDBLICK_MODE 'prose' (Default, Dreaming-Prosa-Raster) oder 'code' (Werkstatt-Code-Review).
|
|
# 'code' setzt Raster + Default-Modell (Qwen3-Coder-Next) + größeres Budget.
|
|
# FREMDBLICK_MODEL Modell-ID (echte llama-swap-ID, kein Alias). Übersteuert den Mode-Default.
|
|
# FREMDBLICK_SYS eigenes System-Raster (übersteuert das Mode-Raster).
|
|
# FREMDBLICK_MAXTOK max_tokens (übersteuert den Mode-Default).
|
|
set -uo pipefail
|
|
|
|
# Achtung: llama-swap listet unter /v1/models die ECHTEN Modell-IDs, nicht die Gateway-Aliase
|
|
# (kein "heavy"/"scout" hier).
|
|
ENDPOINT="${FREMDBLICK_ENDPOINT:-http://127.0.0.1:8080/v1/chat/completions}"
|
|
MODE="${FREMDBLICK_MODE:-prose}"
|
|
SUBJECT="$(cat)"
|
|
|
|
if [ -z "${SUBJECT// /}" ]; then
|
|
echo "=== FREMDBLICK: nichts zu prüfen (leere Eingabe) ==="
|
|
exit 0
|
|
fi
|
|
|
|
# Prosa-Raster (Dreaming): urteilt über Beobachtungen/Behauptungen. Default-Kritiker = GLM (Fremd-Vendor).
|
|
PROSE_SYS='Du bist ein KRITISCHER Zweitgutachter und ausdrücklich ein ANDERES Modell als der Autor. Prüfe jede vorgelegte Beobachtung/Behauptung streng: Trägt der genannte Beleg (Zahl / Session / Log-Zeile) die Behauptung wirklich, oder ist es ein Einzelfall bzw. ein Bauchgefühl mit Zahlen-Deko? Verwechselt der Autor Korrelation mit Ursache? Fehlt entscheidender Kontext? Falls ein Skill-Kandidat dabei ist: ist er wirklich WIEDERVERWENDBAR oder Einmal-Kram? Antworte kompakt auf Deutsch: pro Punkt ein Urteil TRAEGT / TRAEGT-NICHT / UNSICHER mit genau einem Satz Begruendung. Sei knapp und unbestechlich; nicke nichts aus Hoeflichkeit durch. Erfinde keine neuen Belege.'
|
|
# Code-Raster (Werkstatt): reproduziert den Fehlerfall aus der Bug-Beschreibung, statt dem Autor zu glauben.
|
|
CODE_SYS='Du bist ein kritischer Code-Reviewer und ein ANDERES Modell als der Autor. Vertraue seiner Begruendung NICHT. Dir liegen ein Wartungs-AUFTRAG (Bug-Beschreibung) und ein git-Diff vor. Trenne klar: (A) KERNFRAGE: Behebt der Diff den im Auftrag KONKRET beschriebenen Fehlerfall? Leite die Eingabe SELBST aus der Bug-Beschreibung ab und belege einen Uebergang: Eingabe X -> VOR Patch: Y (Bug sichtbar) -> NACH Patch: Z. (B) RANDFAELLE: nenne offene Risiken/Randfaelle als Hinweis. URTEIL-Regel: ABGELEHNT NUR, wenn (A) nicht belegt behoben ist (Kern-Bug bleibt, ODER der Patch trifft die Auftrags-Absicht nicht, ODER er bricht den Normalfall). Ist der Kern-Fall belegt behoben und es bleiben nur Randfaelle: FREIGABE-MIT-VORBEHALT (Randfaelle auflisten). Ist alles sauber: FREIGABE. Ein blosses sieht-plausibel-aus OHNE reproduzierten Kern-Uebergang = ABGELEHNT. Beginne die Antwort mit der Zeile "URTEIL: <ABGELEHNT|FREIGABE-MIT-VORBEHALT|FREIGABE>". Antworte knapp auf Deutsch.'
|
|
|
|
if [ "$MODE" = "code" ]; then
|
|
MODEL="${FREMDBLICK_MODEL:-Qwen3-Coder-Next}"
|
|
MAXTOK="${FREMDBLICK_MAXTOK:-1600}"
|
|
SYS="${FREMDBLICK_SYS:-$CODE_SYS}"
|
|
else
|
|
MODEL="${FREMDBLICK_MODEL:-GLM-4.6V-Flash}"
|
|
MAXTOK="${FREMDBLICK_MAXTOK:-2200}"
|
|
SYS="${FREMDBLICK_SYS:-$PROSE_SYS}"
|
|
fi
|
|
|
|
# max_tokens großzügig: Reasoning-Modelle (GLM) verbrauchen Tokens im reasoning_content, bevor sie
|
|
# die eigentliche Antwort in content schreiben — zu knapp = leeres content (finish=length).
|
|
RESP="$(jq -n --arg m "$MODEL" --arg s "$SYS" --arg u "$SUBJECT" --argjson t "$MAXTOK" \
|
|
'{model:$m, temperature:0.2, max_tokens:$t, messages:[{role:"system",content:$s},{role:"user",content:$u}]}' \
|
|
| curl -s --max-time 240 "$ENDPOINT" -H 'Content-Type: application/json' -d @- 2>/dev/null)"
|
|
|
|
OUT="$(printf '%s' "$RESP" | jq -r '.choices[0].message.content // empty' 2>/dev/null)"
|
|
FIN="$(printf '%s' "$RESP" | jq -r '.choices[0].finish_reason // empty' 2>/dev/null)"
|
|
|
|
if [ -n "$OUT" ]; then
|
|
echo "=== FREMDBLICK (Zweitmeinung von Modell: $MODEL) ==="
|
|
echo "$OUT"
|
|
elif [ "$FIN" = "length" ]; then
|
|
echo "=== FREMDBLICK ABGESCHNITTEN ==="
|
|
echo "(Das Kritiker-Modell hat sein Token-Budget im Nachdenken verbraucht, bevor ein Urteil kam."
|
|
echo " Kürze deine Vorlage auf die Kern-Behauptungen und versuche es erneut; sonst UNGEPRUEFT.)"
|
|
else
|
|
echo "=== FREMDBLICK FEHLGESCHLAGEN ==="
|
|
echo "(Kein Urteil erhalten — Endpoint/Modell nicht erreichbar. Behandle die Funde als UNGEPRUEFT.)"
|
|
fi
|