AI大模型应用开发实战:从RAG到智能体的系统化入门指南

📅 2026/7/28 11:54:44
AI大模型应用开发实战:从RAG到智能体的系统化入门指南
如果你是一名刚接触AI大模型开发的工程师面对网上铺天盖地的“从入门到精通”教程是否感到无从下手概念太多、环境复杂、代码跑不通、学完不知道能做什么——这是绝大多数新手开发者最真实的困境。今天要介绍的是一个在GitHub上获得了超过80,000颗星标的开源项目。它之所以能获得如此高的认可并非因为它提出了多么前沿的算法而恰恰是因为它精准地解决了上述所有痛点它可能是目前最适合新手系统化入门AI大模型应用开发的学习路线与实践指南。这个项目没有停留在理论空谈而是构建了一条清晰的路径从环境搭建、模型选择到核心应用模式如RAG、Agent再到项目实战与高级调优。它更像一份“开箱即用”的工程化手册告诉你每一步具体做什么、用什么工具、可能会遇到什么坑。对于想从“调API”进阶到“懂原理、能落地”的开发者来说这份教程的价值远超一个简单的“Hello World”示例。本文将为你深度拆解这个“神级”教程的核心内容。我们不会复述其所有文档而是提炼出最具实践价值的骨架并融入行业洞察与避坑指南。你将了解到为什么传统的学习路径效率低下而这个项目设计的路线有何不同。如何从零开始搭建一个可运行、可扩展的大模型开发环境。核心四大应用范式对话、检索增强、智能体、微调的实战代码与内在逻辑。如何组合这些技术完成一个像“金融问答机器人”这样的真实项目。通往进阶高效微调、量化部署的钥匙在哪里。无论你是想快速上手做出第一个AI应用还是希望构建系统的知识体系这篇文章都将为你提供一个可靠的起点和一张清晰的“地图”。1. 重新定义“入门”从“会用”到“会建”的思维转变在深入技术细节之前我们必须先厘清一个关键认知什么是真正有效的“AI大模型入门”很多教程的“入门”止步于调用OpenAI API这固然能快速看到效果但留下了巨大的知识黑箱。一旦需要处理私有数据、优化效果、控制成本或本地部署开发者立刻会陷入困境。真正的入门应该是理解技术栈的全景图并掌握在关键节点进行选择和实施的能力。这个80K星标教程的卓越之处在于它构建了一个分层渐进、目标导向的体系第一层工具与环境。不是简单教你pip install而是阐述不同工具如LangChain、FastAPI解决的问题域以及如何根据项目需求进行选型。第二层核心应用模式。将纷繁复杂的大模型应用归纳为几种核心范式如直接对话、检索增强生成RAG、智能体Agent每种范式配套最小可行代码。第三层项目集成实战。演示如何将前两层的能力组合起来构建一个端到端的应用例如一个具备知识库查询能力的问答机器人。第四层性能与定制化。深入模型本身介绍微调、量化等高级技术解决效果优化与成本控制的现实问题。这个结构确保了学习者在每个阶段都有明确的产出和正向反馈避免了在庞杂理论中迷失方向。接下来我们就沿着这条路线开始实战之旅。2. 环境准备打造你的专属大模型“工作台”工欲善其事必先利其器。一个稳定、可复现的开发环境是后续所有工作的基础。这里我们推荐使用Conda进行Python环境管理它能完美解决不同项目间的依赖冲突问题。2.1 基础环境搭建首先确保你的系统已安装Python建议3.8-3.11版本和Git。然后我们创建一个独立的虚拟环境。# 1. 安装Miniconda (如果尚未安装) # 访问 https://docs.conda.io/en/latest/miniconda.html 下载并安装对应系统版本 # 2. 创建一个名为ai-dev的新环境指定Python版本 conda create -n ai-dev python3.10 -y # 3. 激活环境 conda activate ai-dev # 4. 升级pip至最新版本 pip install --upgrade pip2.2 核心依赖安装大模型应用开发的核心库正在快速演进。以下是我们需要安装的基础包它们构成了开发栈的基石。# 安装核心框架与工具 pip install langchain langchain-community langchain-core pip install openai # 如需使用OpenAI官方API pip install fastapi uvicorn # 用于构建API服务 pip install pydantic # 数据验证与设置管理 pip install python-dotenv # 管理环境变量 # 安装向量数据库客户端以Chroma为例轻量且易用 pip install chromadb # 安装文本处理与嵌入模型相关 pip install sentence-transformers # 用于本地生成文本向量嵌入 pip install tiktoken # 用于OpenAI模型的Token计数关键选择解释LangChain当前大模型应用开发的事实标准框架。它抽象了与模型交互、记忆管理、工具调用等复杂逻辑让开发者能更专注于业务链的设计。对于新手理解LangChain的Chain、Agent、Tool、Memory这几个核心概念至关重要。Chroma一个轻量级、内存优先的向量数据库。对于入门和中小型项目它无需单独服务器简化了部署。生产环境可以考虑Qdrant、Weaviate或Pinecone。sentence-transformers提供开源的句子嵌入模型如all-MiniLM-L6-v2让你在不依赖OpenAI付费接口的情况下也能为文本生成高质量的向量表示这对于构建RAG系统至关重要。2.3 模型访问配置云端与本地双路径模型是AI应用的大脑。教程通常会引导你配置两种访问方式方式一使用云端API快速开始需付费在项目根目录创建.env文件存放你的API密钥。# .env 文件内容 OPENAI_API_KEYsk-your-openai-api-key-here # 后续可添加其他模型平台密钥如 DASHSCOPE_API_KEY (阿里通义千问)、ZHIPUAI_API_KEY (智谱)等在代码中通过os.getenv加载使用。方式二运行本地开源模型免费对硬件有要求对于想完全本地运行、研究模型内部机制或处理敏感数据的开发者可以部署开源模型。使用ollama或vLLM等工具可以简化这一过程。# 使用ollama在本地运行一个轻量级模型如Llama 3.1 8B # 首先安装ollama: https://ollama.com/ ollama pull llama3.1:8b ollama run llama3.1:8b # 模型服务将在本地启动通常端口为11434本地模型运行时你的代码将通过http://localhost:11434这样的本地端点与模型交互LangChain也提供了相应的集成类。给新手的建议初期可以先用云端API如GPT-3.5-Turbo快速验证想法和流程因为其稳定、响应快。当流程跑通后再尝试用本地小模型如Qwen2.5-7B-Instruct进行替换和对比理解其中的差异与配置调整。3. 核心应用范式拆解从对话到智能体环境就绪后我们进入核心环节。大模型的应用看似五花八门但抽象出来主要有以下几种范式。掌握它们你就掌握了绝大多数AI应用的构建方法。3.1 范式一基础对话与内容生成这是最直接的应用。核心是学会如何可靠地调用模型并管理对话历史记忆。# 示例使用LangChain与OpenAI模型进行带记忆的连续对话 from langchain_openai import ChatOpenAI from langchain.memory import ConversationBufferMemory from langchain.chains import ConversationChain from dotenv import load_dotenv import os load_dotenv() # 加载.env文件中的OPENAI_API_KEY # 1. 初始化模型 llm ChatOpenAI(modelgpt-3.5-turbo, temperature0.7) # temperature控制创造性越高回答越随机用于创意生成越低越确定用于事实问答。 # 2. 初始化记忆保存对话历史 memory ConversationBufferMemory(return_messagesTrue) # 3. 创建对话链 conversation ConversationChain(llmllm, memorymemory, verboseTrue) # verboseTrue 会打印详细的链执行过程便于调试。 # 4. 进行多轮对话 response1 conversation.predict(input你好请介绍下你自己。) print(fAI: {response1}) response2 conversation.predict(input我刚才问了你什么) print(fAI: {response2}) # 模型应该能回忆起第一轮的问题这得益于memory。关键点ChatOpenAI是LangChain对OpenAI聊天模型的封装。ConversationBufferMemory简单地将所有历史对话存储在内存中。对于长对话可以使用ConversationSummaryMemory或ConversationBufferWindowMemory只保留最近N轮。ConversationChain是一个预定义的链专门用于处理对话场景。3.2 范式二检索增强生成RAG—— 赋予模型“知识库”当模型需要回答关于特定、最新或私有信息的问题时比如公司内部文档、最新新闻RAG是首选方案。其核心流程是“检索-生成”。# 示例构建一个最简单的RAG系统回答关于给定文档的问题 from langchain_community.document_loaders import TextLoader from langchain_text_splitters import RecursiveCharacterTextSplitter from langchain_openai import OpenAIEmbeddings, ChatOpenAI from langchain_community.vectorstores import Chroma from langchain.chains import RetrievalQA # 1. 加载文档这里用文本文件示例 loader TextLoader(./your_document.txt) documents loader.load() # 2. 分割文本 text_splitter RecursiveCharacterTextSplitter(chunk_size500, chunk_overlap50) texts text_splitter.split_documents(documents) # chunk_size和chunk_overlap是关键参数影响检索质量。 # 3. 创建向量存储嵌入并存入向量数据库 embeddings OpenAIEmbeddings() # 使用OpenAI的嵌入模型也可换为sentence-transformers vectorstore Chroma.from_documents(documentstexts, embeddingembeddings, persist_directory./chroma_db) # persist_directory 指定向量数据库持久化路径。 # 4. 创建检索器 retriever vectorstore.as_retriever(search_kwargs{k: 3}) # 检索最相关的3个文本块 # 5. 创建RAG链 llm ChatOpenAI(modelgpt-3.5-turbo) qa_chain RetrievalQA.from_chain_type(llmllm, chain_typestuff, retrieverretriever) # 6. 提问 question 文档中主要讲述了什么内容 answer qa_chain.invoke({query: question}) print(answer[result])RAG的核心价值知识更新无需重新训练昂贵的大模型只需更新向量数据库中的文档模型就能获取新知识。来源可溯答案基于检索到的文档片段可以标注来源增强可信度。降低幻觉通过限制模型仅依据提供的上下文回答可以减少“胡言乱语”。3.3 范式三智能体Agent—— 让模型使用工具智能体是大模型能力的“放大器”。它让模型能够理解用户需求并自主决定调用哪个工具如计算器、搜索引擎、数据库来完成任务。# 示例创建一个能进行数学计算和网络搜索的智能体 from langchain_openai import ChatOpenAI from langchain.agents import AgentExecutor, create_react_agent from langchain import hub # LangChain Hub存储预定义的提示词 from langchain_community.tools import Tool from langchain_community.utilities import SerpAPIWrapper import math # 1. 定义自定义工具 def calculate_sqrt(input_str: str) - str: 计算一个数的平方根。 try: number float(input_str) return str(math.sqrt(number)) except ValueError: return 输入错误请输入一个数字。 math_tool Tool( nameSquareRootCalculator, funccalculate_sqrt, description当需要计算一个数的平方根时使用此工具。输入应为一个数字。 ) # 2. 定义网络搜索工具需要注册SerpAPI获取API key # 假设已在.env中设置SERPAPI_API_KEY search SerpAPIWrapper() search_tool Tool( nameWebSearch, funcsearch.run, description当需要回答关于当前事件或未知领域的问题时使用此工具。 ) # 3. 准备工具列表和模型 tools [math_tool, search_tool] llm ChatOpenAI(modelgpt-3.5-turbo, temperature0) # 4. 从Hub拉取智能体提示词模板ReAct范式 prompt hub.pull(hwchase17/react) # 5. 创建智能体 agent create_react_agent(llm, tools, prompt) agent_executor AgentExecutor(agentagent, toolstools, verboseTrue, handle_parsing_errorsTrue) # 6. 运行智能体 result agent_executor.invoke({input: 请先计算256的平方根然后搜索一下今天北京的天气。}) print(result[output])智能体的关键工具Tool任何可以被模型调用的函数需要清晰的名称和描述。推理框架如ReActReason Act模型会先“思考”一步再决定行动调用工具。自主性智能体可以根据目标串联多个工具调用完成复杂任务。3.4 范式四模型微调Fine-tuning—— 定制专属模型当通用模型在特定任务如法律文书分析、医疗报告生成上表现不佳或你希望统一输出格式、风格时就需要微调。微调是在预训练模型的基础上用你的专属数据继续训练使其适应特定领域。# 示例使用OpenAI API进行微调的数据准备步骤简化版 # 微调通常需要数百到数千条高质量的训练样例。 import json # 1. 准备训练数据格式需符合OpenAI要求 training_data [ { messages: [ {role: system, content: 你是一个专业的客服助手用友好、简洁的方式回答。}, {role: user, content: 我的订单号是12345为什么还没发货}, {role: assistant, content: 您好已为您查询订单12345已于今天上午处理完毕预计24小时内发货请留意物流信息。} ] }, # ... 更多对话样本 ] # 2. 将数据保存为JSONL格式每行一个JSON对象 with open(training_data.jsonl, w) as f: for item in training_data: f.write(json.dumps(item, ensure_asciiFalse) \n) # 3. 使用OpenAI命令行工具上传文件并创建微调任务以下为命令行操作 # 需要先安装OpenAI CLI: pip install --upgrade openai # openai api fine_tunes.create -t training_data.jsonl -m gpt-3.5-turbo-0613 # 这是一个耗时且付费的过程需在OpenAI平台监控进度。给新手的建议微调成本高、周期长。优先尝试“提示词工程Prompt Engineering”和“RAG”来解决领域适应问题。只有当它们无法满足要求如风格控制极严、任务极其特殊时再考虑微调。对于开源模型可以使用PEFT参数高效微调库通过LoRA等技术进行低成本微调。4. 项目实战构建金融大模型问答机器人现在我们将上述范式组合起来完成一个更贴近实际的项目一个金融领域问答机器人。这个项目将综合运用RAG接入金融知识库、智能体处理计算类查询和对话管理。4.1 项目设计与架构目标机器人能回答两类问题知识类基于提供的金融法规、产品说明书等文档回答。计算类如计算复利、投资回报率等。技术栈选择LLMQwen2.5-7B-Instruct本地部署兼顾能力与成本或 GPT-3.5-Turbo云端快速原型。框架LangChain应用编排、FastAPI提供HTTP API。知识库Chroma向量数据库。嵌入模型sentence-transformers的all-MiniLM-L6-v2本地免费。工具自定义金融计算工具。4.2 核心代码实现第一步构建知识库RAG部分# file: knowledge_base.py from langchain_community.document_loaders import DirectoryLoader, TextLoader from langchain_text_splitters import RecursiveCharacterTextSplitter from langchain_huggingface import HuggingFaceEmbeddings from langchain_community.vectorstores import Chroma import os class FinancialKnowledgeBase: def __init__(self, docs_path./financial_docs, persist_path./chroma_fin_db): self.docs_path docs_path self.persist_path persist_path # 使用本地嵌入模型 self.embeddings HuggingFaceEmbeddings(model_namesentence-transformers/all-MiniLM-L6-v2) self.vectorstore None def build(self): 加载文档分割创建向量存储 if not os.path.exists(self.docs_path): os.makedirs(self.docs_path) print(f请将金融文档放入 {self.docs_path} 目录) return None # 加载所有txt文件 loader DirectoryLoader(self.docs_path, glob**/*.txt, loader_clsTextLoader) documents loader.load() if not documents: print(未找到文档。) return None # 分割文本 text_splitter RecursiveCharacterTextSplitter(chunk_size1000, chunk_overlap100) splits text_splitter.split_documents(documents) print(f已将文档分割为 {len(splits)} 个片段。) # 创建并持久化向量存储 self.vectorstore Chroma.from_documents( documentssplits, embeddingself.embeddings, persist_directoryself.persist_path ) print(f知识库已构建并保存至 {self.persist_path}) return self.vectorstore.as_retriever(search_kwargs{k: 4}) def load_existing(self): 加载已构建的知识库 if os.path.exists(self.persist_path): self.vectorstore Chroma(persist_directoryself.persist_path, embedding_functionself.embeddings) return self.vectorstore.as_retriever(search_kwargs{k: 4}) else: print(未找到已存在的知识库请先运行 build() 方法。) return None第二步定义金融计算工具智能体部分# file: financial_tools.py from langchain.tools import Tool import numpy_financial as npf # 需要安装: pip install numpy-financial def calculate_compound_interest(principal: str, rate: str, years: str) - str: 计算复利。参数本金年利率小数形式年数。 try: p float(principal) r float(rate) t float(years) amount p * ((1 r) ** t) return f复利计算结果{p:.2f}元本金年利率{r*100:.2f}%经过{t}年后总额为{amount:.2f}元。 except ValueError as e: return f参数错误请确保输入的是数字。错误信息{e} def calculate_npv(rate: str, cash_flows_str: str) - str: 计算净现值。参数贴现率小数形式现金流逗号分隔如‘-1000,300,400,500’。 try: r float(rate) cash_flows [float(x.strip()) for x in cash_flows_str.split(,)] npv npf.npv(r, cash_flows) return f净现值(NPV)计算结果贴现率{r*100:.2f}%现金流{cash_flows}NPV为{npv:.2f}。 except Exception as e: return f计算NPV时出错{e} # 创建工具列表 financial_tools [ Tool( nameCompoundInterestCalculator, funccalculate_compound_interest, description当用户询问复利计算时使用。输入应为三个用空格或特定分隔符隔开的数字本金 年利率 年数。例如‘1000 0.05 10’。 ), Tool( nameNPVCalculator, funccalculate_npv, description当用户询问投资净现值(NPV)时使用。输入应为两个部分贴现率 和 用逗号分隔的现金流序列。例如‘0.1 -1000,300,400,500’。 ) ]第三步组装智能体与链集成部分# file: financial_agent.py from langchain_openai import ChatOpenAI # 若使用本地Qwen模型使用ChatOpenAI并配置base_url指向本地服务 # from langchain_openai import ChatOpenAI # llm ChatOpenAI(base_urlhttp://localhost:8000/v1, api_keynot-needed, modelqwen2.5-7b-instruct) from langchain.agents import AgentExecutor, create_react_agent from langchain import hub from knowledge_base import FinancialKnowledgeBase from financial_tools import financial_tools from langchain.chains import RetrievalQA from langchain.memory import ConversationBufferWindowMemory class FinancialQABot: def __init__(self, use_local_llmFalse): # 1. 初始化模型 if use_local_llm: # 假设本地部署了Qwen API服务 self.llm ChatOpenAI(base_urlhttp://localhost:8000/v1, api_keynot-needed, modelqwen2.5-7b-instruct, temperature0.1) else: self.llm ChatOpenAI(modelgpt-3.5-turbo, temperature0.1) # 2. 初始化记忆保留最近3轮对话 self.memory ConversationBufferWindowMemory(k3, memory_keychat_history, return_messagesTrue) # 3. 加载知识库检索器 self.kb FinancialKnowledgeBase() self.retriever self.kb.load_existing() or self.kb.build() if self.retriever: # 创建基于知识库的QA链 self.qa_chain RetrievalQA.from_chain_type(llmself.llm, chain_typestuff, retrieverself.retriever) # 4. 将QA链也包装成一个“工具”供智能体调用 def qa_tool_func(query: str) - str: 使用知识库回答金融知识问题。 result self.qa_chain.invoke({query: query}) return result[result] qa_tool Tool( nameFinancialKnowledgeBase, funcqa_tool_func, description当用户询问关于金融知识、法规、产品说明等需要查阅文档的问题时使用此工具。输入是用户的问题。 ) # 5. 组合所有工具 self.all_tools financial_tools [qa_tool] # 6. 创建智能体 prompt hub.pull(hwchase17/react) agent create_react_agent(llmself.llm, toolsself.all_tools, promptprompt) self.agent_executor AgentExecutor( agentagent, toolsself.all_tools, memoryself.memory, verboseTrue, # 生产环境可设为False handle_parsing_errorsTrue ) def ask(self, question: str) - str: 主问答接口 try: response self.agent_executor.invoke({input: question}) return response[output] except Exception as e: return f处理问题时出现错误{e}第四步用FastAPI包装成服务# file: main.py from fastapi import FastAPI, HTTPException from pydantic import BaseModel from financial_agent import FinancialQABot import uvicorn app FastAPI(title金融问答机器人API) bot FinancialQABot(use_local_llmFalse) # 初始化机器人使用云端模型 class QuestionRequest(BaseModel): question: str class AnswerResponse(BaseModel): answer: str status: str success app.post(/ask, response_modelAnswerResponse) async def ask_question(req: QuestionRequest): try: answer bot.ask(req.question) return AnswerResponse(answeranswer) except Exception as e: raise HTTPException(status_code500, detailstr(e)) if __name__ __main__: # 启动服务uvicorn main:app --reload --host 0.0.0.0 --port 8000 uvicorn.run(app, host0.0.0.0, port8000)4.3 运行与测试准备知识库文档在financial_docs文件夹中放入你的金融相关TXT文档。启动服务conda activate ai-dev python main.py测试API# 使用curl测试 curl -X POST http://localhost:8000/ask \ -H Content-Type: application/json \ -d {question: 请解释一下什么是市盈率}或者使用浏览器访问http://localhost:8000/docs查看自动生成的Swagger UI界面进行交互测试。5. 常见问题与排查思路在实践过程中你几乎一定会遇到以下问题。这里提供清晰的排查路径。问题现象可能原因排查方式解决方案导入LangChain模块失败(ModuleNotFoundError)1. 未安装对应包。2. LangChain版本更新模块路径已变更。1. 检查pip list确认包名和版本。2. 查阅对应版本LangChain官方文档。1. 使用pip install langchain-community等安装子包。2. 检查导入语句新版可能为from langchain_community.xxx import yyy。调用OpenAI API超时或报错1. API Key错误或未设置。2. 网络连接问题。3. 账户余额不足或速率限制。1. 检查.env文件及加载代码。2. 使用ping api.openai.com测试。3. 登录OpenAI平台检查用量。1. 确保Key正确格式为sk-...。2. 配置网络环境或使用代理。3. 充值或等待限制解除。RAG效果差回答不相关1. 文本分割参数不合理。2. 嵌入模型不匹配。3. 检索到的片段数量(k值)不合适。1. 检查分割后的文本块是否语义完整。2. 尝试不同的嵌入模型。3. 调整search_kwargs{k: n}中的n值。1. 调整chunk_size和chunk_overlap。2. 换用更强大的嵌入模型如text-embedding-3-small。3. 尝试k3, 5, 8等不同值。智能体陷入循环或调用错误工具1. 工具描述不够清晰。2. 模型温度(temperature)过高。3. ReAct提示词不适合当前任务。1. 观察verboseTrue输出的模型“思考”过程。2. 检查工具描述是否准确说明了输入格式和用途。1. 优化工具描述使其精确无歧义。2. 降低temperature至0。3. 尝试其他智能体类型如ZERO_SHOT_REACT_DESCRIPTION。本地模型响应慢或内存溢出1. 模型过大硬件不足。2. 未使用量化模型。3. 推理参数配置不当。1. 使用nvidia-smi(GPU)或任务管理器监控资源。2. 确认模型是否已量化如GGUF格式。1. 换用更小的模型如7B参数。2. 使用llama.cpp或vLLM等高效推理框架。3. 调整max_tokens等生成参数。FastAPI服务并发请求出错1. 智能体或链不是线程安全的。2. 向量数据库连接冲突。1. 模拟多个并发请求测试。2. 检查Chroma是否支持多线程访问。1. 考虑为每个请求创建独立的链实例注意资源消耗。2. 使用支持并发的向量数据库如Qdrant或将Chroma改为客户端-服务器模式。6. 从入门到进阶下一步学习方向完成上述实战项目你已经跨越了AI大模型应用开发最基本的门槛。但要想真正胜任企业级项目还需要在以下几个方向深入提示词工程Prompt Engineering这是成本最低的效果优化手段。学习如何设计系统提示System Prompt、少样本提示Few-shot、思维链Chain-of-Thought等高级技巧能极大提升模型输出的可靠性和质量。评估与监控如何衡量你的AI应用好坏需要建立评估体系包括人工评估设计评分卡。自动评估利用GPT-4等更强模型作为裁判或使用RAGAS、TruLens等专业框架评估RAG系统的相关性、忠实度等指标。监控记录每次交互的输入、输出、Token消耗、延迟用于分析和优化。高级RAG技巧基础RAG存在局限性。需要学习查询重写/扩展优化用户问题后再检索。混合检索结合关键词检索BM25和向量检索。重排序Re-ranking对检索出的文档进行精细排序。父文档检索检索时用小片段生成答案时用其所属的大文档保证上下文完整。生产化部署API服务化用FastAPI/Flask提供稳定接口并添加认证、限流、日志。异步处理对于耗时的任务如文档解析、嵌入使用Celery等队列异步执行。容器化使用Docker打包整个应用确保环境一致性。可观测性集成Prometheus、Grafana监控系统状态。成本与性能优化缓存对常见查询结果进行缓存减少模型调用。模型路由根据问题难度路由到不同成本的模型如简单问题用小模型。量化与蒸馏对开源模型进行量化如GGML, GPTQ以减少内存占用和加速推理或用知识蒸馏训练更小的学生模型。这个80K星标的教程之所以成功正是因为它为开发者指明了这条从“动手做”到“做得好”的清晰路径。它没有试图一次性灌输所有知识而是搭建了一个坚实的脚手架让你可以沿着它一步步向上攀登。现在你已经拿到了这张地图和第一套工具真正的学习始于你开始动手解决自己实际问题的那个时刻。建议你将本文和原教程项目结合从搭建环境、跑通第一个示例开始逐步迭代出属于你自己的AI应用。