Physical Address
304 North Cardinal St.
Dorchester Center, MA 02124
Physical Address
304 North Cardinal St.
Dorchester Center, MA 02124
有趣分享
有趣分享

整理10个用于构建LLM应用的Python库,从模型加载、RAG、推理部署,到AI Agent、工作流和模型评测,涵盖Transformers、LangChain、LlamaIndex、vLLM、Unsloth、CrewAI等热门工具。

如果你正在学习 LLM 应用开发,或者准备自己搭建 AI Agent、RAG、智能客服、AI 工作流等项目,那么 Python 生态里有一批非常值得了解的工具。
从模型加载、RAG、模型推理,到 Agent、多智能体、模型微调和效果评估,下面这 10 个 Python 库基本覆盖了构建 LLM 应用时最常遇到的场景。
如果不知道从哪里开始,可以先收藏这篇文章,再根据自己的项目需求选择。
如果你接触过开源大模型,那么 Transformers 基本绕不开。
它是 Hugging Face 生态中非常核心的工具,可以用来加载、运行和微调各种 Transformer 架构模型。
你可以使用它完成:
对于刚开始学习开源大模型开发的人来说,Transformers 是非常值得掌握的基础库。
适合:
想学习开源大模型、模型推理和微调的开发者。
如果你不只是想“调用一次 AI”,而是希望把模型、Prompt、工具、API 和业务逻辑连接起来,那么可以看看 LangChain。
它可以帮助开发者把不同组件组合成完整的 AI 工作流。
例如:
用户问题 → Prompt → LLM → 工具/API → 返回结果
也可以进一步构建:
LangChain 的优势在于生态比较完整,适合快速搭建 LLM 应用原型。
适合:
希望快速开发 AI 应用和 Agent 的开发者。
大语言模型本身并不知道你的私人文档、企业资料、数据库内容。
这时候就可以使用 LlamaIndex。
它主要用于帮助 LLM 连接外部数据,也是构建 RAG(检索增强生成) 应用时经常使用的工具之一。
例如你有:
就可以把这些数据接入 AI,让模型根据你的资料回答问题。
典型应用:
上传 PDF → 建立索引 → 用户提问 → 检索相关内容 → LLM 生成答案
适合:
想做 AI 知识库、企业问答、PDF AI、RAG 应用的人。
如果你准备自己部署开源大模型,那么 vLLM 是值得重点关注的项目。
它主要解决的是 LLM 推理和服务效率问题,可以帮助开发者更加高效地运行模型。
它比较适合:
简单来说:
Transformers 更偏向模型使用和开发基础,而 vLLM 更适合关注模型服务和推理性能的场景。
适合:
想自己部署大模型 API 或搭建 AI 推理服务器的开发者。
如果你想对开源模型进行微调,可以了解一下 Unsloth。
它主要针对大模型微调进行了优化,并支持 LoRA、QLoRA 等常见方法。
对于 GPU 资源有限的开发者来说,这类工具尤其值得关注。
你可以利用它尝试:
例如,你可以使用自己的专业数据,让模型更加适应某个特定领域。
适合:
想学习 LLM 微调,又不希望一开始就投入大量硬件资源的人。
一个 AI Agent 负责所有任务,有时候并不是最高效的方式。
CrewAI 的思路是让多个 AI Agent 协同工作。
例如可以设计:
最终形成一个类似“AI 团队”的工作流。
例如:
研究 → 分析 → 写作 → 审核 → 输出
这类多智能体架构特别适合自动化复杂任务。
适合:
想尝试 AI Agent 和 Multi-Agent 系统的开发者。
AutoGPT 是早期受到大量关注的自主 AI Agent 项目之一。
它探索的是一种不同于普通聊天机器人的使用方式:
用户给出一个目标,AI 再尝试将目标拆解成多个步骤,并逐步执行。
这种思路推动了很多开发者开始研究:
虽然实际项目开发时需要考虑可靠性、成本和权限控制,但 AutoGPT 依然很适合作为理解 AI Agent 发展方向的项目。
适合:
想了解自主 Agent 和自动任务执行机制的开发者。
如果简单的 Prompt → LLM 工作流已经满足不了需求,可以进一步了解 LangGraph。
它更适合构建具有状态、分支和循环逻辑的复杂 AI 应用。
例如:
用户提问
↓
AI 判断问题类型
↓
需要搜索 → 调用搜索工具
↓
需要数据库 → 查询数据库
↓
检查答案
↓
不符合要求 → 返回重新处理
↓
最终输出
这种复杂流程很适合用图结构进行组织。
适合:
想开发复杂 Agent、AI 工作流和有状态应用的人。
AI 应用开发还有一个非常容易被忽略的问题:
模型到底回答得好不好?
普通软件可以通过测试用例判断功能是否正常,但 LLM 的输出具有一定的不确定性,因此 AI 应用需要专门的评估方式。
DeepEval 可以帮助开发者测试和评估 LLM 输出。
例如可以关注:
如果你正在从“玩 AI”进入真正的 AI 应用开发阶段,那么模型评估会越来越重要。
适合:
正在开发生产级 LLM 应用,需要测试 AI 输出质量的团队和开发者。
如果你希望快速在 Python 项目中接入 OpenAI 模型,那么官方 Python SDK 是非常直接的选择。
它可以帮助开发者在自己的程序中调用 AI 能力,例如:
相比自己部署模型,调用 API 的方式通常更加简单,特别适合快速验证一个 AI 产品想法。
适合:
想快速把 AI 能力加入现有 Python 项目的开发者。
看到这里可能会发现,这 10 个工具解决的问题其实并不一样。
可以简单按照用途选择:
| 需求 | 推荐工具 |
|---|---|
| 加载和运行开源模型 | Transformers |
| 快速构建 LLM 应用 | LangChain |
| RAG / AI 知识库 | LlamaIndex |
| 高性能模型推理 | vLLM |
| 大模型微调 | Unsloth |
| 多智能体系统 | CrewAI |
| 自主 AI Agent | AutoGPT |
| 复杂 AI 工作流 | LangGraph |
| LLM 应用测试 | DeepEval |
| 快速接入 OpenAI | OpenAI Python SDK |
如果你是刚开始学习 LLM 开发,不建议一次把 10 个项目全部学完。
可以按照自己的方向选择。
可以先从:
Transformers → LangChain → LlamaIndex
开始。
重点了解:
LlamaIndex + LangChain
可以研究:
LangChain + LangGraph + CrewAI
可以重点关注:
Transformers + vLLM
可以研究:
Transformers + Unsloth
则不要只关注模型本身,还应该考虑:
模型 → RAG → Agent → Evaluation → Deployment
也就是:
Transformers / API → LlamaIndex → LangGraph → DeepEval → vLLM
现在很多人学习 AI 编程时,第一步通常是:
调用 API
↓
发送 Prompt
↓
获得回答
但真正复杂的 LLM 应用通常远不止这些。
一个完整的 AI 产品可能需要:
用户
↓
应用界面
↓
Agent
↓
LLM
↓
RAG / 数据库
↓
工具 / API
↓
结果评估
↓
最终回答
因此,与其收藏几十个 AI 项目却一个都没真正使用,不如根据自己的需求挑选其中 2~3 个,做一个真正可以运行的小项目。
例如:
PDF AI 问答
可以尝试:
LlamaIndex + LLM + 向量数据库
AI 自动研究助手
可以尝试:
LangGraph + LLM + 搜索工具
本地 AI API 服务
可以尝试:
开源模型 + Transformers + vLLM
自己的 AI Agent
可以尝试:
LangGraph / CrewAI + LLM + Tools
LLM 应用开发的工具生态正在快速发展。
今天流行的框架,几个月后可能就会出现新的替代方案,所以真正值得掌握的并不是某一个库的 API,而是背后的开发思路:
模型怎么运行、数据怎么接入、Agent 怎么工作、工具怎么调用,以及如何评价 AI 输出。
如果你正在学习 Python AI 开发,这 10 个项目可以作为一个很不错的工具地图。
先选一个项目跑起来,再逐步扩展,比一次收藏几十个 GitHub 仓库更有用。