feat: 升级 Ollama 本地模型 qwen2.5:1.5b → qwen3:1.7b
- config.py / .env.example / docker-compose.yml:默认模型改为 qwen3:1.7b(备选 qwen3:4b),compose 同步拉取 - 经 runtime_settings 注入 summarize/query/classify 三用途,改默认值即全局生效 - README / CLAUDE.md / 前端 Settings.vue 占位符同步更新
This commit is contained in:
+2
-2
@@ -25,8 +25,8 @@ REDIS_PORT=6379
|
||||
|
||||
# --- Ollama 本地模型(文档三级总结)---
|
||||
OLLAMA_PORT=11434
|
||||
OLLAMA_MODEL=qwen2.5:1.5b
|
||||
# 备选模型: qwen2.5:3b(更好的总结质量,需更多内存)
|
||||
OLLAMA_MODEL=qwen3:1.7b
|
||||
# 备选模型: qwen3:4b(更好的总结质量,需更多内存)
|
||||
# EMBEDDING_PROVIDER=local 时使用的 Ollama 嵌入模型
|
||||
OLLAMA_EMBEDDING_MODEL=bge-m3
|
||||
|
||||
|
||||
@@ -12,7 +12,7 @@ QMDSearch 是面向 AI Agent 的分层信息检索服务,支持多层级知识
|
||||
- **缓存**: Redis (Docker)
|
||||
- **关系数据库**: PostgreSQL (Docker, 可选)
|
||||
- **嵌入模型**: OpenAI / 本地模型 (通过配置切换)
|
||||
- **本地推理模型**: Ollama (Docker) — 用于文档三级总结,默认 qwen2.5:1.5b
|
||||
- **本地推理模型**: Ollama (Docker) — 用于文档三级总结,默认 qwen3:1.7b
|
||||
- **部署**: Docker Compose on NAS
|
||||
|
||||
## 项目结构
|
||||
@@ -168,8 +168,8 @@ QMDSearch/
|
||||
|
||||
### 本地模型 (Ollama)
|
||||
|
||||
- 服务: Ollama 容器,默认模型 `qwen2.5:1.5b`(约 1GB,适合 NAS 低资源环境)
|
||||
- 备选模型: `qwen2.5:3b`(更好的总结质量,约 2GB)
|
||||
- 服务: Ollama 容器,默认模型 `qwen3:1.7b`(约 1.3GB,适合 NAS 低资源环境)
|
||||
- 备选模型: `qwen3:4b`(更好的总结质量,约 2.5GB)
|
||||
- 模型通过环境变量 `OLLAMA_MODEL` 配置
|
||||
- 首次启动时自动拉取模型,需 NAS 可访问外网
|
||||
|
||||
|
||||
@@ -22,7 +22,7 @@
|
||||
| 向量数据库 | Qdrant(Docker) |
|
||||
| 缓存 | Redis(Docker) |
|
||||
| 嵌入模型 | OpenAI / Ollama 本地模型(可切换) |
|
||||
| 本地推理 | Ollama + qwen2.5:1.5b(文档总结) |
|
||||
| 本地推理 | Ollama + qwen3:1.7b(文档总结) |
|
||||
| OCR | rapidocr-onnxruntime + pypdfium2(扫描件 PDF) |
|
||||
| 部署 | Docker Compose on NAS |
|
||||
|
||||
@@ -123,7 +123,7 @@ docker compose up -d
|
||||
### 4. 拉取 Ollama 模型(首次启动后)
|
||||
|
||||
```bash
|
||||
docker exec qmdsearch-ollama ollama pull qwen2.5:1.5b
|
||||
docker exec qmdsearch-ollama ollama pull qwen3:1.7b
|
||||
```
|
||||
|
||||
### 5. 验证服务
|
||||
@@ -232,7 +232,7 @@ curl -X POST http://localhost:8000/api/v1/documents/upload \
|
||||
| `EMBEDDING_PROVIDER` | 嵌入模型提供商(openai / local) | `openai` |
|
||||
| `OPENAI_API_KEY` | OpenAI API Key | - |
|
||||
| `EMBEDDING_MODEL` | 嵌入模型名称 | `text-embedding-3-small` |
|
||||
| `OLLAMA_MODEL` | Ollama 本地模型 | `qwen2.5:1.5b` |
|
||||
| `OLLAMA_MODEL` | Ollama 本地模型 | `qwen3:1.7b` |
|
||||
| `RETRIEVAL_TOP_K` | 检索召回数 | `20` |
|
||||
| `RETRIEVAL_FINAL_K` | 最终返回数 | `5` |
|
||||
| `INGEST_MAX_CONCURRENCY` | 入库并发上限 | `2` |
|
||||
|
||||
+1
-1
@@ -18,7 +18,7 @@ class Settings(BaseSettings):
|
||||
|
||||
# Ollama 本地模型(用于文档三级总结)
|
||||
ollama_base_url: str = "http://localhost:11434"
|
||||
ollama_model: str = "qwen2.5:1.5b" # 备选: qwen2.5:3b
|
||||
ollama_model: str = "qwen3:1.7b" # 备选: qwen3:4b(更好的总结质量,需更多内存)
|
||||
ollama_embedding_model: str = "bge-m3" # embedding_provider=local 时使用的嵌入模型
|
||||
|
||||
# 重排模型(cross-encoder,经 Ollama /api/rerank,对 chunk 候选做最终精排)
|
||||
|
||||
+2
-2
@@ -96,7 +96,7 @@ services:
|
||||
- OLLAMA_MAX_LOADED_MODELS=3
|
||||
- OLLAMA_NUM_THREADS=16
|
||||
- OLLAMA_KV_CACHE_TYPE=q8_0
|
||||
# 首次启动自动拉取所需模型(qwen2.5:1.5b 总结 + bge-m3 嵌入 + qwen3-reranker 重排),
|
||||
# 首次启动自动拉取所需模型(qwen3:1.7b 总结 + bge-m3 嵌入 + qwen3-reranker 重排),
|
||||
# 下载完成后转交常驻 ollama serve。已存在时仅做健康检查。
|
||||
entrypoint: /bin/bash
|
||||
command:
|
||||
@@ -105,7 +105,7 @@ services:
|
||||
ollama serve &
|
||||
SERVE_PID=$$!
|
||||
sleep 6
|
||||
ollama pull qwen2.5:1.5b
|
||||
ollama pull qwen3:1.7b
|
||||
ollama pull bge-m3
|
||||
ollama pull qwen3-reranker:0.6b
|
||||
wait $$SERVE_PID
|
||||
|
||||
@@ -318,7 +318,7 @@ onMounted(() => {
|
||||
<a-form-item label="model">
|
||||
<a-input
|
||||
v-model:value="form.models[key].model"
|
||||
placeholder="例如 qwen2.5:1.5b"
|
||||
placeholder="例如 qwen3:1.7b"
|
||||
allow-clear
|
||||
/>
|
||||
</a-form-item>
|
||||
|
||||
Reference in New Issue
Block a user