Implement prompt caching, speculative decoding config, parallel slots, and dynamic pricing metrics

This commit is contained in:
Hitonabi
2026-06-26 14:00:32 +02:00
parent 2c60caf790
commit 35dcc69ba5
12 changed files with 216 additions and 35 deletions
+2 -2
View File
@@ -52,7 +52,7 @@ async def _proxy(path: str, request: Request):
prompt = usage.get("prompt_tokens", 0)
completion = usage.get("completion_tokens", 0)
if prompt or completion:
increment_tokens(prompt, completion)
increment_tokens(prompt, completion, model=alias)
except Exception:
pass
except Exception:
@@ -69,7 +69,7 @@ async def _proxy(path: str, request: Request):
prompt = usage.get("prompt_tokens", 0)
completion = usage.get("completion_tokens", 0)
if prompt or completion:
increment_tokens(prompt, completion)
increment_tokens(prompt, completion, model=alias)
except Exception:
pass
return JSONResponse(resp_json, status_code=r.status_code, headers=routed)