chore(ct116): capture production state (LiteLLM 1.99.1, nginx /ui //docs, router decommission, trove agent)
This commit is contained in:
+11
-11
@@ -49,7 +49,7 @@
|
||||
|
||||
|
||||
|
||||
qwen3.6-35B qwen3.6-27B gemma-4-12b
|
||||
qwen3.6-35B qwen3.6-27B gpu-vision
|
||||
MoE/Strix Dense/RTX3090 VLM/RTX 5070
|
||||
:8080 (llama) :8080 (llama) :8080 (llama)
|
||||
:8090 (side) :8090 (side) :8090 (sidecar)
|
||||
@@ -84,7 +84,7 @@
|
||||
|-----|------|-----------|---------|------|---------|
|
||||
| qwen3.6-35B-A3B (MoE) | 192.168.68.15 | :8080 | :8090 | Strix Halo | 262K |
|
||||
| qwen3.6-27B-code (Dense) | 192.168.68.8 | :8080 | :8090 | RTX 3090 | 262K |
|
||||
| gemma-4-12b (VLM) | 192.168.68.110 | :8080 | :8090 | RTX 5070 | 262K |
|
||||
| gpu-vision (VLM) | 192.168.68.110 | :8080 | :8090 | RTX 5070 | 262K |
|
||||
|
||||
### 1.3 Existing LiteLLM POC on CT 116
|
||||
|
||||
@@ -249,9 +249,9 @@ model_list:
|
||||
api_base: http://router:9000/v1
|
||||
api_key: os.environ/ROUTER_API_KEY
|
||||
|
||||
- model_name: gemma-4-12b
|
||||
- model_name: gpu-vision
|
||||
litellm_params:
|
||||
model: openai/gemma-4-12b
|
||||
model: openai/gpu-vision
|
||||
api_base: http://router:9000/v1
|
||||
api_key: os.environ/ROUTER_API_KEY
|
||||
|
||||
@@ -298,9 +298,9 @@ router_settings:
|
||||
# Fallback chains: LiteLLM retries down the chain when router returns saturated
|
||||
# This gives accurate per-model metrics because router no longer silently reroutes
|
||||
fallbacks:
|
||||
- qwen3.6-35B-A3B: ["qwen3.6-27B-code", "gemma-4-12b"]
|
||||
- qwen3.6-27B-code: ["qwen3.6-35B-A3B", "gemma-4-12b"]
|
||||
- gemma-4-12b: ["qwen3.6-27B-code", "qwen3.6-35B-A3B"]
|
||||
- qwen3.6-35B-A3B: ["qwen3.6-27B-code", "gpu-vision"]
|
||||
- qwen3.6-27B-code: ["qwen3.6-35B-A3B", "gpu-vision"]
|
||||
- gpu-vision: ["qwen3.6-27B-code", "qwen3.6-35B-A3B"]
|
||||
|
||||
# Cost tracking: map model names to per-token pricing for spend tracking
|
||||
litellm_settings:
|
||||
@@ -311,7 +311,7 @@ litellm_settings:
|
||||
qwen3.6-27B-code:
|
||||
input_cost_per_token: 0.0
|
||||
output_cost_per_token: 0.0
|
||||
gemma-4-12b:
|
||||
gpu-vision:
|
||||
input_cost_per_token: 0.0
|
||||
output_cost_per_token: 0.0
|
||||
# For internal cost allocation, set symbolic rates:
|
||||
@@ -705,9 +705,9 @@ if req != "auto":
|
||||
router_settings:
|
||||
allowed_fails: 100
|
||||
fallbacks:
|
||||
- qwen3.6-35B-A3B: ["qwen3.6-27B-code", "gemma-4-12b"]
|
||||
- qwen3.6-27B-code: ["qwen3.6-35B-A3B", "gemma-4-12b"]
|
||||
- gemma-4-12b: ["qwen3.6-27B-code", "qwen3.6-35B-A3B"]
|
||||
- qwen3.6-35B-A3B: ["qwen3.6-27B-code", "gpu-vision"]
|
||||
- qwen3.6-27B-code: ["qwen3.6-35B-A3B", "gpu-vision"]
|
||||
- gpu-vision: ["qwen3.6-27B-code", "qwen3.6-35B-A3B"]
|
||||
```
|
||||
|
||||
### Result
|
||||
|
||||
Reference in New Issue
Block a user