提供一份使用本地ollama或vllm的配置给大家

Author: 15608447849Created Aug 13, 2025Updated Jan 9, 2026

因为vllm或ollama都是兼容openai api的, 所以可以当成openai的模型接口 , 参考自 litellm 库 兼容openai api , 已测试运行成功

vllm

application.yml文件

llm: default: base_url: 'http://your-vllm-server:8000' vLLM服务地址 apikey: 'vllm-api-key' vLLM通常不需要API密钥,可以留空或设置任意值 interface_url: '/v1/chat/completions' OpenAI兼容的接口路径 model: 'your-model-name' 你在vLLM中部署的模型名称 max_tokens: 4096 根据模型调整最大token数 settings: '{ "vllm-model": { "model": "your-model-name", "max_tokens": 4096, "temperature": 0.7, "base_url": "http://your-vllm-server:8000", "apikey": "vllm-api-key", "interface_url": "/v1/chat/completions", "max_input_tokens": 32000 } }' 参考官方deepseek的配置修改所有的model_name为 vllm-model

.env_template文件

OPENAI_API_KEY=vllm-api-key OPENAI_BASE_URL=http://117.50.183.102:8888/v1

DEFAULT_MODEL=your-model-name ( 与vLLM服务中的served-model-name对应 ) QUERY_DECOMPOSE_MODEL=your-model-name QUERY_DECOMPOSE_THINK_MODEL=your-model-name SEARCH_REASONING_MODEL=your-model-name SEARCH_ANSWER_MODEL=your-model-name REPORT_MODEL=your-model-name CODE_INTEPRETER_MODEL=your-model-name


ollama

application.yml文件

llm: default: base_url: 'http://192.168.200.63:11434' apikey: 'ollama-api-key' interface_url: '/v1/chat/completions' model: 'qwen3:8b' max_tokens: 8192

-- 添加额外参数确保兼容性
extParams:
  stream: false
  format: "json"

settings: '{ "qwen3-8b": { "model": "qwen3:8b", "max_tokens": 4096, "temperature": 0.7, "top_p": 0.8, "base_url": "http://192.168.200.63:11434", "apikey": "ollama-api-key", "interface_url": "/v1/chat/completions", "max_input_tokens": 8192 } }' 后面的 model_name: qwen3-8b 参考你自己通过ollama下载的模型名

.env_template文件

OPENAI_API_KEY=ollama-api-key OPENAI_BASE_URL=http://192.168.200.63:11434/v1

使用 ollama前缀的话 litellm 库对于 Ollama 模型 会默认 尝试连接 localhost:11434 QUERY_DECOMPOSE_MODEL=openai/qwen3:8b QUERY_DECOMPOSE_THINK_MODEL=openai/qwen3:8b QUERY_DECOMPOSE_MAX_SIZE=5 SEARCH_REASONING_MODEL=openai/qwen3:8b SEARCH_ANSWER_MODEL=openai/qwen3:8b SEARCH_ANSWER_LENGTH=10000 REPORT_MODEL=openai/qwen3:8b CODE_INTEPRETER_MODEL=openai/qwen3:8b

Source: jd-opensource/joyagent-jdgenie