登录社区云,与社区用户共同成长
邀请您加入社区
本指南详细介绍如何使用Python微调大型语言模型(LLM),并通过Ollama在本地运行。文章从微调概念、原理、适用场景到完整实操流程(数据收集、环境设置、模型训练、本地部署)进行说明,使用Unsloth工具简化微调过程,帮助读者打造定制化AI模型解决特定任务,适合小白及程序员学习收藏。
本文将介绍如何在本地部署Llama 3.2 90B(900亿参数)视觉多模态大模型,并开发一些Use Case,展示其强大的视觉理解能力。
本文系统梳理了大模型部署的五层架构:硬件抽象层(各类GPU芯片)、深度学习框架(PyTorch/TensorFlow等)、专用推理引擎(vLLM/llama.cpp等)、模型服务工具(Ollama/LM Studio等)和模型分发平台(Hugging Face/ModelScope)。详细分析了各层主流工具的特点、适用场景和选择建议,帮助开发者理解大模型部署全景生态,根据需求选择合适技术组合,降低
本文测试对比了18种RAG技术,从简单分块到复杂自适应方法,全部使用基础库实现,适合入门学习。测试显示,自适应RAG以0.86分表现最佳,其次是分层索引(0.84)、融合RAG(0.83)和CRAG(0.824)。不同技术各有优势,选择应基于应用场景和需求。文章为构建高效RAG系统提供了全面参考。
本文将手把手教你使用高性能推理引擎vLLM部署Qwen大模型,并提供Python和Java两种语言的实现代码,帮助不同技术背景的开发者快速上手。