Voice: Thinking fuer Lucys Sprach-Pfad aus (enable_thinking:false)
Qwen3.6 ist ein Thinking-Modell; ohne Abschaltung 11k Reasoning-Token vor jeder kurzen Antwort (~30s TTFB). voice.py umging die Gateway-Lane -> gleiches chat_template_kwargs-Muster nachgezogen, env MC_VOICE_NO_THINK. Gemessen ~30s -> ~3s. Co-Authored-By: Claude Opus 4.8 <noreply@anthropic.com>
This commit is contained in:
@@ -208,6 +208,10 @@ async def voice_chat(body: ChatIn) -> StreamingResponse:
|
|||||||
user_text = f"[Bildschirm-Sicht — das ist gerade auf dem/den Schirm(en) zu sehen:\n{safe_desc}\n]\n\n{body.text}"
|
user_text = f"[Bildschirm-Sicht — das ist gerade auf dem/den Schirm(en) zu sehen:\n{safe_desc}\n]\n\n{body.text}"
|
||||||
messages.append({"role": "user", "content": user_text})
|
messages.append({"role": "user", "content": user_text})
|
||||||
payload = {"model": body.model or HERMES_API_MODEL, "messages": messages, "stream": True}
|
payload = {"model": body.model or HERMES_API_MODEL, "messages": messages, "stream": True}
|
||||||
|
# Lucy-Hirn ist Thinking-Modell -> fuer die gesprochene Assistentin Thinking AUS (sonst 11k
|
||||||
|
# Reasoning-Token vor der kurzen Antwort, gemessen ~30s TTFB). Muster wie gateway_proxy/mem0.
|
||||||
|
if os.environ.get("MC_VOICE_NO_THINK", "1") not in ("0", "false", "False"):
|
||||||
|
payload["chat_template_kwargs"] = {"enable_thinking": False}
|
||||||
headers = {
|
headers = {
|
||||||
"Authorization": f"Bearer {HERMES_API_KEY}",
|
"Authorization": f"Bearer {HERMES_API_KEY}",
|
||||||
"X-Hermes-Session-Id": body.session_id,
|
"X-Hermes-Session-Id": body.session_id,
|
||||||
|
|||||||
Reference in New Issue
Block a user