# ODS - external Lemonade SDK runtime overlay # # Use when Lemonade is already installed and running on the host. This overlay # keeps ODS's managed llama-server disabled and routes ODS services # through LiteLLM, which calls the existing Lemonade service. # # This file is intentionally not standalone. It is selected by # scripts/resolve-compose-stack.sh together with: # # docker-compose.base.yml # docker-compose.cloud.yml # extensions/services/litellm/compose.yaml # docker-compose.lemonade-external.yml # # Validate the resolved stack with: # # LEMONADE_EXTERNAL=true ODS_MODE=lemonade \ # ./scripts/resolve-compose-stack.sh --ods-mode lemonade --gpu-backend amd --tier SH_LARGE services: litellm: extra_hosts: - "host.docker.internal:host-gateway" open-webui: environment: OPENAI_API_BASE_URL: "http://litellm:4000/v1" OPENAI_API_KEY: "${LITELLM_KEY}" dashboard-api: environment: - GPU_BACKEND=${GPU_BACKEND:-amd} - LLM_BACKEND=lemonade - LLM_API_BASE_PATH=${LEMONADE_API_BASE_PATH:-/api/v1} - OLLAMA_URL=${LEMONADE_CONTAINER_BASE_URL:-http://host.docker.internal:13305} - LLM_URL=${LLM_API_URL:-http://litellm:4000} - ODS_TALK_HERMES_TIMEOUT=${ODS_TALK_HERMES_TIMEOUT:-900} - ODS_TALK_VISION_URL=${ODS_TALK_VISION_URL:-http://host.docker.internal:${AMD_INFERENCE_PORT:-13305}${LEMONADE_API_BASE_PATH:-/api/v1}} - AMD_INFERENCE_RUNTIME=${AMD_INFERENCE_RUNTIME:-lemonade} - AMD_INFERENCE_BACKEND=${AMD_INFERENCE_BACKEND:-auto} - AMD_INFERENCE_LOCATION=${AMD_INFERENCE_LOCATION:-host} - AMD_INFERENCE_PORT=${AMD_INFERENCE_PORT:-13305} - AMD_INFERENCE_SUPPORTED_BACKENDS=${AMD_INFERENCE_SUPPORTED_BACKENDS:-auto} - AMD_INFERENCE_RUNTIME_MODE=${AMD_INFERENCE_RUNTIME_MODE:-external-lemonade} - AMD_INFERENCE_MANAGED=${AMD_INFERENCE_MANAGED:-false}