light-heart-labs--ods
46 行
1.8 KiB
YAML
46 行
1.8 KiB
YAML
# ODS - external Lemonade SDK runtime overlay
|
|
#
|
|
# Use when Lemonade is already installed and running on the host. This overlay
|
|
# keeps ODS's managed llama-server disabled and routes ODS services
|
|
# through LiteLLM, which calls the existing Lemonade service.
|
|
#
|
|
# This file is intentionally not standalone. It is selected by
|
|
# scripts/resolve-compose-stack.sh together with:
|
|
#
|
|
# docker-compose.base.yml
|
|
# docker-compose.cloud.yml
|
|
# extensions/services/litellm/compose.yaml
|
|
# docker-compose.lemonade-external.yml
|
|
#
|
|
# Validate the resolved stack with:
|
|
#
|
|
# LEMONADE_EXTERNAL=true ODS_MODE=lemonade \
|
|
# ./scripts/resolve-compose-stack.sh --ods-mode lemonade --gpu-backend amd --tier SH_LARGE
|
|
|
|
services:
|
|
litellm:
|
|
extra_hosts:
|
|
- "host.docker.internal:host-gateway"
|
|
|
|
open-webui:
|
|
environment:
|
|
OPENAI_API_BASE_URL: "http://litellm:4000/v1"
|
|
OPENAI_API_KEY: "${LITELLM_KEY}"
|
|
|
|
dashboard-api:
|
|
environment:
|
|
- GPU_BACKEND=${GPU_BACKEND:-amd}
|
|
- LLM_BACKEND=lemonade
|
|
- LLM_API_BASE_PATH=${LEMONADE_API_BASE_PATH:-/api/v1}
|
|
- OLLAMA_URL=${LEMONADE_CONTAINER_BASE_URL:-http://host.docker.internal:13305}
|
|
- LLM_URL=${LLM_API_URL:-http://litellm:4000}
|
|
- ODS_TALK_HERMES_TIMEOUT=${ODS_TALK_HERMES_TIMEOUT:-900}
|
|
- ODS_TALK_VISION_URL=${ODS_TALK_VISION_URL:-http://host.docker.internal:${AMD_INFERENCE_PORT:-13305}${LEMONADE_API_BASE_PATH:-/api/v1}}
|
|
- AMD_INFERENCE_RUNTIME=${AMD_INFERENCE_RUNTIME:-lemonade}
|
|
- AMD_INFERENCE_BACKEND=${AMD_INFERENCE_BACKEND:-auto}
|
|
- AMD_INFERENCE_LOCATION=${AMD_INFERENCE_LOCATION:-host}
|
|
- AMD_INFERENCE_PORT=${AMD_INFERENCE_PORT:-13305}
|
|
- AMD_INFERENCE_SUPPORTED_BACKENDS=${AMD_INFERENCE_SUPPORTED_BACKENDS:-auto}
|
|
- AMD_INFERENCE_RUNTIME_MODE=${AMD_INFERENCE_RUNTIME_MODE:-external-lemonade}
|
|
- AMD_INFERENCE_MANAGED=${AMD_INFERENCE_MANAGED:-false}
|