AI大模型微调、蒸馏实验手册
人工智能大模型技术这几年呈涌现式发展,随之带来的应用迭代来与日俱增,下面通过在阿里云PAI平台上进行两个简单的实验来感受一下大模型的一些概念。
目录
4.1执行lora微调脚本02_finetune_qwen3_medical.py. 23
4.2执行评估脚本02_test_finetuned_model.py. 28
5.1执行03_knowledge_distillation.py. 32
5.2 执行04_comparison_test_cases_final.py. 36
章节二 实验使用到的工具
2.1使用modelscope下载数据集和模型
ModelScope(魔搭)是由阿里巴巴通义实验室与 CCF 开源发展委员会于 2022 年 6 月推出的一站式 AI 模型开源平台,提供模型探索、训练、优化、部署到应用的全流程工具链,覆盖 NLP、CV、语音、多模态等领域,兼容 PyTorch、TensorFlow 等主流框架,支持多硬件后端与多种部署方式,并具备活跃的社区生态与丰富的模型资源,助力开发者快速落地 AI 应用。
https://www.modelscope.cn/models?name=qwen3&page=1&tabKey=task
进入后搜索qwen3,即可看到各渠道分布的qwen3系列模型(推荐优先选择官方渠道的模型:通义实验室)。


这几个文件就是大模型的‘本体’,目前主流的模型大多都是使用pytorch+nvidia生态进行开发训练

来到实例终端进行下载(modelscope也被封装集成第三方库,下载即可使用)
pip install modelscope
下载示例,下载qwen3-0.6b模型到实例的工作目录下
modelscope download --model Qwen/Qwen3-0.6B --local_dir ./qwen3-0.6b

等待模型下载
建议同时下载1.7b模型,减少实验教程时的等待时间
modelscope download --model Qwen/Qwen3-1.7B --local_dir ./qwen3-1.7b
回车后没有其它提示说明下载完成

下载8b模型:modelscope download --model Qwen/Qwen3-8B --local_dir ./qwen3-8b
下载数据集
modelscope download --dataset xiaofengalg/HuatuoGPT-sft-data-v1 --local_dir ./huatuo


对于大模型的训练数据集,json文件中描述了数据集的QA对,以及一些必要的输入、输出范式等重要信息
下载好后回到notebook,可以看到下载的内容都在workspace目录下

创建一个notebook文件

更多推荐



所有评论(0)