From 7e857a546b0eb2a7f9836ef6f9273f4171e75253 Mon Sep 17 00:00:00 2001 From: Hitonabi Date: Wed, 1 Jul 2026 21:53:54 +0200 Subject: [PATCH] Voice: Thinking fuer Lucys Sprach-Pfad aus (enable_thinking:false) Qwen3.6 ist ein Thinking-Modell; ohne Abschaltung 11k Reasoning-Token vor jeder kurzen Antwort (~30s TTFB). voice.py umging die Gateway-Lane -> gleiches chat_template_kwargs-Muster nachgezogen, env MC_VOICE_NO_THINK. Gemessen ~30s -> ~3s. Co-Authored-By: Claude Opus 4.8 --- backend/routers/voice.py | 4 ++++ 1 file changed, 4 insertions(+) diff --git a/backend/routers/voice.py b/backend/routers/voice.py index 72a7ceb..50c7e2c 100644 --- a/backend/routers/voice.py +++ b/backend/routers/voice.py @@ -208,6 +208,10 @@ async def voice_chat(body: ChatIn) -> StreamingResponse: user_text = f"[Bildschirm-Sicht — das ist gerade auf dem/den Schirm(en) zu sehen:\n{safe_desc}\n]\n\n{body.text}" messages.append({"role": "user", "content": user_text}) payload = {"model": body.model or HERMES_API_MODEL, "messages": messages, "stream": True} + # Lucy-Hirn ist Thinking-Modell -> fuer die gesprochene Assistentin Thinking AUS (sonst 11k + # Reasoning-Token vor der kurzen Antwort, gemessen ~30s TTFB). Muster wie gateway_proxy/mem0. + if os.environ.get("MC_VOICE_NO_THINK", "1") not in ("0", "false", "False"): + payload["chat_template_kwargs"] = {"enable_thinking": False} headers = { "Authorization": f"Bearer {HERMES_API_KEY}", "X-Hermes-Session-Id": body.session_id,