feat(gpu-fleet): roster-driven GPU config + Ornith-1.0-35B

This commit is contained in:
Abiba
2026-06-28 16:24:54 +00:00
parent 8e0f6e407b
commit e9aa220ee8
3 changed files with 140 additions and 15 deletions
+10 -15
View File
@@ -37,7 +37,7 @@ litellm_settings:
qwen3.6-27B-code:
input_cost_per_token: 0.0
output_cost_per_token: 0.0
qwen3.6-35B-A3B:
ornith-1.0-35b:
input_cost_per_token: 0.0
output_cost_per_token: 0.0
syslog-auto:
@@ -50,40 +50,35 @@ litellm_settings:
model_list:
- litellm_params:
api_base: http://router:9000/v1
api_key: os.environ/ROUTER_API_KEY
api_key: sk-9e65b69a67-e54af421c1b09fb8bd4f75dacb38cb64
model: openai/syslog-auto
rpm: 600
model_name: syslog-auto
- litellm_params:
api_base: http://router:9000/v1
api_key: os.environ/ROUTER_API_KEY
model: openai/qwen3.6-35B-A3B
model_name: qwen3.6-35B-A3B
- litellm_params:
api_base: http://router:9000/v1
api_key: os.environ/ROUTER_API_KEY
api_key: sk-9e65b69a67-e54af421c1b09fb8bd4f75dacb38cb64
model: openai/qwen3.6-27B-code
model_name: qwen3.6-27B-code
- litellm_params:
api_base: http://router:9000/v1
api_key: os.environ/ROUTER_API_KEY
api_key: sk-9e65b69a67-e54af421c1b09fb8bd4f75dacb38cb64
model: openai/gemma-4-12b
model_name: gemma-4-12b
- litellm_params:
api_base: http://router:9000/v1
api_key: sk-9e65b69a67-e54af421c1b09fb8bd4f75dacb38cb64
model: openai/ornith-1.0-35b
model_name: ornith-1.0-35b
router_settings:
allowed_fails: 100
enable_loadbalancing_on_proxy: false
fallbacks:
- syslog-auto:
- qwen3.6-35B-A3B
- qwen3.6-27B-code
- gemma-4-12b
- qwen3.6-35B-A3B:
- qwen3.6-27B-code
- gemma-4-12b
- qwen3.6-27B-code:
- qwen3.6-35B-A3B
- gemma-4-12b
- gemma-4-12b:
- qwen3.6-27B-code
- qwen3.6-35B-A3B
routing_strategy: usage-based-routing