LLaMA-Factory与Ollama:Linux下大模型微调部署全流程实战
在Linux环境下进行大模型微调与部署,对于许多开发者和运维人员来说,常常面临环境配置复杂、流程繁琐、工具链割裂的挑战。本文将为你整合一套从零开始的“懒人运维”实战方案,手把手教你如何使用 LLaMA-Factory 对大语言模型进行高效微调,并将训练好的模型无缝转换为 Ollama 格式,最终实现本地化部署与访问。无论你是想为特定业务定制AI助手,还是希望深入理解大模型微调落地的全链路,这篇教程都能提供从环境搭建到生产可用的完整代码和避坑指南。
1. 背景与核心概念:为什么需要这套工具链?
在深入实操之前,我们有必要厘清几个核心工具的作用以及它们如何串联起一个高效的工作流。
大模型微调 :预训练的大语言模型(如 LLaMA、Qwen、ChatGLM)拥有强大的通用知识,但可能不擅长你的特定领域任务(如法律咨询、医疗问答、代码风格转换)。微调(Fine-tuning)就是在预训练模型的基础上,使用你的领域数据对其进行“再训练”,使其适应特定任务或风格,而无需从头训练,成本极低。
LLaMA-Factory :这是一个功能强大且用户友好的开源大模型微调框架。它提供了可视化的 Web UI 和命令行接口,支持多种微调方法(如 LoRA、QLoRA、全参数微调),并集成了众多主流开源模型。其“懒人”特性在于,它将复杂的训练脚本、环境依赖、参数配置封装起来,让开发者能专注于数据准备和任务定义。
Ollama :这是一个专注于在本地运行、部署和管理大型语言模型的工具。它简化了模型的下载、加载和运行过程,提供了类似 Docker 的简单命令(如 ollama run ),并且支持通过 REST API 进行交互。将模型转换为 Ollama 格式(Modelfile),意味着你可以像使用官方模型一样,轻松地在本地服务器上运行你自己的微调模型。
工具链价值 : LLaMA-Factory(微调) -> 模型转换 -> Ollama(部署/服务化) 这条路径,完美解决了从“模型定制”到“服务上线”的最后一公里问题。它避免了手动编写复杂服务代码的麻烦,提供了一套标准化、可复制的生产部署方案。
2. 环境准备与版本说明
本教程基于 Linux 系统(Ubuntu 22.04 LTS 为例),但核心步骤在其他发行版上同样适用,只需注意包管理器的区别。我们将使用 Conda 管理 Python 环境,确保依赖隔离。
2.1 系统与基础环境
- 操作系统 :Ubuntu 22.04 LTS (x86_64)
- Python :3.10(推荐,与主流深度学习框架兼容性好)
- CUDA :12.1(对应 NVIDIA 驱动版本 >= 530.30.02),用于 GPU 加速训练与推理。如果你的显卡较旧,请选择对应的 CUDA 11.8 等版本。
- 内存与存储 :微调 7B 参数模型,建议至少有 16GB 以上内存和 50GB 可用磁盘空间。使用 QLoRA 技术可大幅降低显存需求。
2.2 关键软件安装
1. 安装 Miniconda (Python 环境管理)
# 下载 Miniconda 安装脚本
wget https://repo.anaconda.com/miniconda/Miniconda3-latest-Linux-x86_64.sh
# 运行安装脚本,按照提示操作,通常一路回车即可。
bash Miniconda3-latest-Linux-x86_64.sh
# 安装完成后,关闭并重新打开终端,或运行以下命令使 conda 命令生效
source ~/.bashrc
2. 创建并激活专用的 Python 环境
# 创建一个名为 `llamafactory` 的 Python 3.10 环境
conda create -n llamafactory python=3.10 -y
# 激活环境
conda activate llamafactory
3. 安装 PyTorch (与你的 CUDA 版本匹配) 访问 PyTorch 官网 获取最新安装命令。例如,对于 CUDA 12.1:
pip install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cu121
3. LLaMA-Factory 的安装与配置
我们将从源码安装 LLaMA-Factory,以便获得最新功能和进行定制。
3.1 克隆仓库与安装依赖
# 1. 克隆 LLaMA-Factory 仓库
git clone https://github.com/hiyouga/LLaMA-Factory.git
cd LLaMA-Factory
# 2. 安装核心依赖
pip install -e .[torch,metrics]
# 3. 安装可视化 Web UI 的额外依赖(可选但推荐)
pip install -e ".[webui]"
-e 参数代表以“可编辑”模式安装,这样你修改源码后无需重新安装。 [torch,metrics] 和 [webui] 是 extras,用于安装特定功能组的依赖。
3.2 启动 Web UI(懒人首选)
LLaMA-Factory 的 Web UI 极大地简化了微调过程。
# 在 LLaMA-Factory 项目根目录下执行
python src/train_web.py
执行后,终端会输出一个本地访问地址,通常是 http://127.0.0.1:7860 。在浏览器中打开此地址,即可看到图形化界面。
3.3 准备微调数据
微调的核心是数据。LLaMA-Factory 支持多种格式,最常用的是 JSON 格式,其中每条数据是一个对话记录。
示例数据 ( data/train.json ):
[
{
"conversations": [
{
"role": "human",
"content": "用Python写一个快速排序函数。"
},
{
"role": "assistant",
"content": "```python\ndef quick_sort(arr):\n if len(arr) <= 1:\n return arr\n pivot = arr[len(arr) // 2]\n left = [x for x in arr if x < pivot]\n middle = [x for x in arr if x == pivot]\n right = [x for x in arr if x > pivot]\n return quick_sort(left) + middle + quick_sort(right)\n```\n这是一个经典的快速排序实现,平均时间复杂度为 O(n log n)。"
}
]
},
{
"conversations": [
{
"role": "human",
"content": "解释一下什么是神经网络中的反向传播。"
},
{
"role": "assistant",
"content": "反向传播是训练神经网络的核心算法。它首先进行前向传播计算预测值和损失,然后从输出层向输入层反向计算损失函数对每个权重的梯度(导数),最后使用梯度下降等优化器根据梯度更新权重,从而最小化损失。"
}
]
}
]
数据格式说明 :
-
conversations: 一个列表,包含多轮对话。 - 每轮对话包含
role(human或assistant) 和content。 - 你可以准备几百到几千条这样的高质量对话数据,用于微调。
4. 使用 LLaMA-Factory Web UI 进行微调训练
这是“懒人运维”的核心环节,大部分操作都可以在浏览器中完成。
4.1 模型与参数配置
-
在 Web UI 的 “模型” 选项卡中:
- 模型名称 :选择你要微调的基础模型。例如,从
Model Hub选择Qwen2.5-7B-Instruct。首次选择时,工具会自动从 Hugging Face 下载模型,请确保网络通畅。 - 模型路径 :下载的模型会保存在本地,路径通常为
~/.cache/huggingface/hub。
- 模型名称 :选择你要微调的基础模型。例如,从
-
切换到 “训练” 选项卡:
- 微调方法 :对于资源有限的场景,强烈推荐
LoRA或QLoRA。QLoRA 在 LoRA 基础上进一步量化,显存占用更小。 - 数据集 :点击“预览数据集”,上传或选择你准备好的
train.json文件。系统会自动识别格式。 - 训练参数 :
-
学习率 (Learning Rate):LoRA/QLoRA 通常设为2e-4或5e-5。 -
训练轮数 (Epochs):根据数据量调整,3-5 轮常见。 -
批处理大小 (Batch Size):根据 GPU 显存调整,可从 1 开始尝试。 -
最大序列长度 (Max Source Length):根据你的数据中最长文本设置,如1024。
-
- LoRA 参数 :
-
LoRA Rank (lora_r):秩,一般设为8或16。值越大,参数量越多,能力越强,但可能过拟合。 -
LoRA Alpha (lora_alpha):缩放参数,一般设为16或32,通常为lora_r的 2 倍。 -
Target Modules:指定对模型哪些模块应用 LoRA。对于大多数 Transformer 模型,选择q_proj,v_proj(查询和值投影层)是一个好的起点。
-
- 微调方法 :对于资源有限的场景,强烈推荐
4.2 开始训练与监控
- 配置好所有参数后,点击 “开始训练” 。
- 训练开始后,可以切换到 “输出” 选项卡查看实时日志。你会看到损失(loss)值随着训练步数(step)下降。
- 训练完成后,模型文件(通常是适配器权重,如
adapter_model.bin和adapter_config.json)会保存在你指定的输出目录中(默认为./output下的一个以日期时间命名的文件夹)。
4.3 使用命令行进行微调(可选)
对于喜欢脚本化或需要集成到 CI/CD 流程的用户,LLaMA-Factory 也提供了强大的命令行工具。
# 一个基本的 QLoRA 训练命令示例
CUDA_VISIBLE_DEVICES=0 python src/train_bash.py \
--stage sft \ # 指令监督微调
--model_name_or_path Qwen/Qwen2.5-7B-Instruct \ # 基础模型
--do_train \
--dataset train_data \ # 数据集名称,对应你定义的数据文件
--template qwen2.5 \ # 使用与模型匹配的对话模板
--finetuning_type lora \ # 使用 LoRA
--lora_target q_proj,v_proj \ # LoRA 目标模块
--output_dir ./output/qwen_lora \ # 输出目录
--overwrite_cache \
--per_device_train_batch_size 2 \ # 根据显存调整
--gradient_accumulation_steps 4 \ # 梯度累积,等效增大 batch size
--lr_scheduler_type cosine \
--logging_steps 10 \
--save_steps 100 \
--learning_rate 5e-5 \
--num_train_epochs 3.0 \
--plot_loss \
--fp16 # 混合精度训练,节省显存
你需要提前将数据集文件放在 data/ 目录下,并在 dataset_info.json 中配置。详细配置请参考项目文档。
5. 将微调后的模型转换为 Ollama 格式
训练完成后,我们得到的是 LoRA 适配器权重,需要与基础模型合并,并打包成 Ollama 能识别的 Modelfile 格式。
5.1 合并 LoRA 权重(可选但推荐)
Ollama 目前对原生 LoRA 权重支持不完全,最稳妥的方式是将 LoRA 权重合并回基础模型,得到一个完整的“新”模型。
# 在 LLaMA-Factory 环境中,使用其提供的导出工具
python src/export_model.py \
--model_name_or_path Qwen/Qwen2.5-7B-Instruct \ # 原始基础模型路径
--adapter_name_or_path ./output/your_lora_output_dir \ # 你的 LoRA 权重目录
--template qwen2.5 \
--finetuning_type lora \
--export_dir ./merged_model \ # 合并后模型输出目录
--export_size 2 \ # 量化位数,2 表示 4-bit (GPTQ),也可以是 4 (8-bit) 或 0 (不量化)
--export_quantization_method gptq \ # 量化方法,也可以是 `bitsandbytes`
--export_legacy_format false
这个命令会生成一个完整的、可能经过量化的模型,保存在 ./merged_model 目录中。量化可以显著减小模型体积、加快加载和推理速度,是部署的常用手段。
5.2 创建 Ollama Modelfile
Ollama 通过一个名为 Modelfile 的配方文件来定义如何构建和运行一个模型。我们需要为合并后的模型创建此文件。
-
准备模型目录结构 :
my_custom_qwen/ ├── Modelfile └── merged_model/ # 上一步合并导出的整个模型文件夹 ├── config.json ├── model-00001-of-00002.safetensors ├── model-00002-of-00002.safetensors ├── tokenizer.json └── ... (其他文件) -
编写
Modelfile: 在my_custom_qwen/目录下创建Modelfile文件,内容如下:# 使用 FROM 指定基础镜像,这里我们直接使用本地 GGUF 文件或目录 # 方式一:如果 merged_model 已转换为 GGUF 格式(推荐,兼容性最好) # FROM ./merged_model/ggml-model-Q4_K_M.gguf # 方式二:直接指向包含 Hugging Face 格式模型的目录(Ollama 新版本支持) FROM ./merged_model # 设置模型的温度参数,控制生成随机性 (0.0-2.0) PARAMETER temperature 0.7 # 设置系统提示词,塑造模型的行为 SYSTEM """你是一个专业的Python编程助手,精通算法和代码优化。请用简洁、准确的方式回答用户的问题。""" # 定义停止生成的标记 # 例如,在对话中遇到 “<|im_end|>” 就停止 # STOP “<|im_end|>” # 模板定义了用户和助手消息的格式 # 这里使用 Qwen2.5 的默认聊天模板 TEMPLATE """{{- if .System }}<|im_start|>system {{ .System }}<|im_end|> {{- end }} {{- if .Prompt }}<|im_start|>user {{ .Prompt }}<|im_end|> {{- end }} <|im_start|>assistant {{ .Response }}<|im_end|>""" # 可选的许可证信息 LICENSE """ This model is built upon Qwen2.5, subject to its original license. Fine-tuned for educational purposes. """关键参数解释 :
-
FROM: 指定模型来源。对于本地 Hugging Face 格式目录,直接使用FROM ./merged_model是最简单的方式。确保 Ollama 版本 >= 0.1.29 以支持此功能。 -
SYSTEM: 系统提示词,强烈建议设置。它能在每次对话开始时隐式地指导模型行为,对于保持微调后模型的角色设定至关重要。 -
TEMPLATE: 必须与模型训练时使用的对话模板一致,否则会导致生成混乱。Qwen2.5、Llama-3、ChatGLM等都有各自特定的模板。
-
5.3 构建 Ollama 模型
在包含 Modelfile 的目录下,打开终端,执行构建命令:
# 在 my_custom_qwen/ 目录下执行
ollama create my-custom-qwen -f ./Modelfile
-
my-custom-qwen是你为自定义模型起的名字。 -
-f ./Modelfile指定配方文件路径。
Ollama 会读取 Modelfile 和 FROM 指定的模型文件,开始构建。构建成功后,会输出类似 Successfully created model 'my-custom-qwen' 的信息。
6. 部署与访问微调后的模型
模型构建成功后,就可以像使用任何官方 Ollama 模型一样来运行和访问它了。
6.1 运行模型
# 1. 直接在命令行中与模型交互(聊天模式)
ollama run my-custom-qwen
输入上述命令后,会进入一个交互式会话。你可以直接输入问题,例如“用Python写一个二分查找”,模型会基于你的微调数据生成回答。
6.2 作为后台服务运行
为了通过 API 调用,需要将 Ollama 作为服务运行。
# 启动 Ollama 服务(如果尚未运行)
ollama serve &
# 或者使用 systemd (推荐用于生产环境)
sudo systemctl enable ollama
sudo systemctl start ollama
6.3 通过 API 访问模型
Ollama 提供了与 OpenAI API 兼容的接口,方便集成到现有应用中。
使用 cURL 测试 :
curl http://localhost:11434/api/generate -d '{
"model": "my-custom-qwen",
"prompt": "解释一下梯度下降算法",
"stream": false,
"options": {
"temperature": 0.8,
"num_predict": 256
}
}'
使用 Python 客户端调用 :
import requests
import json
def ask_ollama(prompt, model="my-custom-qwen"):
url = "http://localhost:11434/api/generate"
payload = {
"model": model,
"prompt": prompt,
"stream": False,
"options": {"temperature": 0.7}
}
try:
response = requests.post(url, json=payload)
response.raise_for_status()
result = response.json()
return result.get("response", "")
except requests.exceptions.RequestException as e:
return f"Error calling Ollama API: {e}"
# 测试调用
answer = ask_ollama("写一个Python函数计算斐波那契数列。")
print(answer)
6.4 与 LangChain 等框架集成
Ollama 的 API 可以轻松接入 LangChain,构建更复杂的应用。
from langchain_community.llms import Ollama
from langchain_core.prompts import ChatPromptTemplate
# 初始化 Ollama LLM
llm = Ollama(model="my-custom-qwen", base_url="http://localhost:11434")
# 构建提示模板
prompt = ChatPromptTemplate.from_messages([
("system", "你是一个代码专家。"),
("human", "{input}")
])
# 创建链
chain = prompt | llm
# 调用链
response = chain.invoke({"input": "如何用Python实现一个简单的HTTP服务器?"})
print(response)
7. 常见问题与排查思路
在微调和部署过程中,你可能会遇到以下典型问题。
| 问题现象 | 可能原因 | 排查思路与解决方案 |
|---|---|---|
| Web UI 启动失败或无法访问 | 1. 端口被占用。 2. 依赖未安装完整。 3. 防火墙阻止。 | 1. 检查 7860 端口: lsof -i:7860 ,或更换端口 --port 7861 。 2. 重新安装 WebUI 依赖: pip install -e ".[webui]" 。 3. 检查本地防火墙或云服务器安全组规则。 |
| 训练时 GPU 内存不足 (OOM) | 1. 批处理大小太大。 2. 模型太大。 3. 未使用量化或 LoRA。 | 1. 减小 per_device_train_batch_size 。 2. 换用更小模型(如 7B->3B)。 3. 务必使用 QLoRA 微调方法,并尝试 --fp16 或 --bf16 。 4. 启用梯度检查点: --gradient_checkpointing 。 |
Ollama 构建模型失败: invalid model format | 1. Modelfile 中 FROM 路径错误。 2. 模型格式不被 Ollama 支持。 3. Ollama 版本过旧。 | 1. 检查 FROM 指向的路径是否存在且包含有效模型文件。 2. 最佳实践 :先将模型转换为 GGUF 格式(使用 llama.cpp 的 convert.py ),然后在 Modelfile 中 FROM ./model.gguf 。 3. 升级 Ollama 到最新版: ollama upgrade 。 |
| 模型响应速度慢 | 1. 模型未量化,体积大。 2. 硬件性能不足。 3. 系统内存不足。 | 1. 在导出合并模型时使用 --export_size 2 (4-bit GPTQ) 或 --export_size 4 (8-bit) 进行量化。 2. 确认 Ollama 正在使用 GPU(查看日志 ollama serve 输出)。 3. 为 Ollama 分配更多运行资源。 |
| 微调后模型效果不佳(胡言乱语或遗忘能力) | 1. 数据质量差或数量太少。 2. 学习率设置不当。 3. 训练轮数过多或过少。 4. 对话模板 ( TEMPLATE ) 不匹配。 | 1. 确保训练数据是高质量、多样化的指令-回答对。 2. 尝试调整学习率(如 1e-5 到 5e-5 )。 3. 监控验证集损失,防止过拟合。 4. 仔细检查 :训练时 ( --template ) 和 Ollama Modelfile 中的 TEMPLATE 必须完全匹配模型原生模板。 |
| Ollama API 调用返回 404 或连接拒绝 | 1. Ollama 服务未运行。 2. 端口不正确。 | 1. 运行 ollama serve 并确保它在前台或后台运行。 2. 默认端口是 11434 ,检查是否被修改。使用 curl http://localhost:11434/api/tags 测试服务状态。 |
8. 最佳实践与工程建议
遵循以下建议,可以让你的大模型微调与部署流程更加稳健、高效。
1. 数据质量是天花板
- 清洗与格式化 :去除噪音、纠正错别字、统一格式。确保
role和content字段准确。 - 多样性 :数据应覆盖你期望模型处理的所有场景和问题类型。
- 规模适中 :对于 LoRA 微调,几百到几千条高质量数据往往比数万条低质数据更有效。可以先用小数据集进行快速实验。
2. 训练过程监控与评估
- 使用验证集 :在 LLaMA-Factory 中划分一部分数据作为验证集,监控验证损失,避免过拟合。
- 保存检查点 :设置
--save_steps或--save_strategy,定期保存中间模型,以便选择最佳版本。 - 手动评估 :训练结束后,一定要用一些 未参与训练 的问题进行人工测试,检查模型是否学到了正确的模式,而没有产生灾难性遗忘。
3. 模型转换与量化策略
- 优先使用 GGUF 格式 :对于 Ollama 部署,将模型转换为 GGUF 格式兼容性最好。可以使用
llama.cpp项目中的convert.py脚本。 - 量化等级选择 :
Q4_K_M在精度和速度之间取得了很好的平衡。如果显存紧张,可以考虑Q3_K_S;如果追求精度,可以使用Q5_K_M或Q6_K。 - 保留原始模型 :始终保留一份未量化的完整模型副本,以备后续不同的部署需求。
4. 生产环境部署考量
- 资源隔离 :使用 Docker 容器化部署 Ollama 服务,便于资源管理和环境一致性。
- 配置系统服务 :在 Linux 服务器上,使用
systemd管理 Ollama 服务,设置开机自启和故障重启。 - API 安全 :如果通过公网暴露 Ollama API,务必配置反向代理(如 Nginx)、设置 API 密钥认证或 IP 白名单,防止未授权访问。
- 日志与监控 :启用 Ollama 的日志记录,并集成到你的监控系统(如 Prometheus + Grafana),关注服务的请求量、响应时间和错误率。
5. 版本管理与回滚
- 模型版本化 :为每个微调实验和最终模型打上清晰的版本标签(如
my-law-assistant-v1.2)。 - Modelfile 纳入版本控制 :将
Modelfile和相关的配置脚本纳入 Git 仓库管理。 - 快速回滚机制 :Ollama 可以同时存储多个版本的模型。在部署新版本前,确保旧版本模型仍可通过
ollama run <old-model-name>访问,以便快速切换。
通过本文的详细拆解,你应该已经掌握了在 Linux 环境下,使用 LLaMA-Factory 微调大模型,并将其转换为 Ollama 格式进行便捷部署的全套流程。这套“懒人运维”工具链的核心价值在于标准化和自动化,将复杂的 AI 工程流程简化为几个清晰的步骤。接下来,你可以尝试用自己的业务数据微调一个专属模型,体验定制化 AI 助手的强大能力。如果在实践中遇到新的问题,欢迎在社区交流探讨。
更多推荐




所有评论(0)