【LLM】第一章:知识体系框架概览

📅 2026/8/12 20:23:32
【LLM】第一章:知识体系框架概览
【LLM】第一章知识体系框架概览大模型具体说就是大语言模型LLMlarge language model这个领域其实就是NLP所以本专栏也是NLP专栏的延续是NLP的高阶内容。我的NLP专栏的链接是 https://blog.csdn.net/friday1203/category_12833594.html?spm1001.2014.3001.5482想真正学习的同学建议从NLP看起如果NLP也看不懂就从机器学习看起。正确的学习路径是机器学习-深度神经网络--卷积神经网络--NLP--transformer--LLM,这样一个环环相扣、逻辑链条完整的路径。一、大模型研发的演化史和竞争态势在transformer之前NLP领域都是基于深度神经网络RNN、LSTM、GRU等架构学习文本数据的特征向量。2017年transformer横空出世后极大的提升了文本数据的理解和生成能力迅速成NLP领域绝对主流的网络架构。目前市面上的所有大模型基本都是从transformer进化而来的当前大热的GPT、BERT、Llama、Claude、文心一言等大语言模型(Large Language Model,LLM都以Transformer或者其变种作为主干网络。所以本专栏默认你对transformer的边边角角的细节都是非常清晰的。我NLP专栏中的Transformer总共写了10万多字相关细节数100个都不为过所以没有Transformer底子的同学最好是先补基础再图进阶。一国际大模型的研发态势1、从0到1谷歌的transformer横空出世2017年谷歌机器翻译团队发表的《Attention is all you need》论文以seq2seq架构(编码器-解码器,Encoder-Decoder)为基础、完全基于自注意力机制提出了全新的Transformer模型架构。Transformer迅速成为自然语言处理领域绝对主流的网络架构。2、OpenAI押宝生成技术进入GPT时代OpenAI是2015年12月由萨姆·奥尔特曼、埃隆·马斯克等在美国旧金山创立的人工智能研究公司核心使命是开发安全的通用人工智能(AGI)其实这个公司和微软有关是微软投资的。‌‌‌核心产品‌有ChatGPT系列、GPT-4/GPT-5系列大模型、Sora文生视频、DALL·E 3文生图、Whisper语音识别等。事实上Transformer之后大家对人工智能的技术发展方向也是迷茫的彼时谷歌认为首先要让模型像人类一样对自然语言能够理解所以未来的技术方向应该是编码器。新贵OpenAI为了和老牌谷歌形成错位竞争押注了解码器方向也就是自然语言生成方向也就是transformer的生成部分于2018年6月提出了第一个生成模型GPT。人们第一次看到对话模型的智能GPT迅速在C端的对话领域火爆起来开启了普通大众对人工智能的无限憧憬和遐想。同时OpenAI也第一个系统性提出预训练微调范式的语言模型。3、谷歌押宝编码方向开启自然语言理解的bert时代同一时期谷歌押注的是transformer的编码部分。2018年10月Google发布BERT走的是模型对自然语言的理解路线也就是语义表示路线。也是预训练微调的范式。BERT自诞生起就横扫NLP领域11项目任务的最佳成绩在BERT出现之前NLP领域占据统治地位的是LSTM和GRU模型但是BERT出世后基本就是NLP领域的标配了。其强大的自然语言表示能力被广泛应用于文本分类、序列标注比如命名实体识别、句子匹配等场景。但缺点是通用性比较差不同任务得不同的任务头不同任务头得继续训练所以通用性比较差。4、大一统T5时代尽管BERT也取得了极大的成功但BERT主要成果是在B端大众无法直接感知不像GPT那样火爆在媒体的聚光灯下谷歌作为transformer的造物主也改变了之前技术路线的押宝策略于2019年火速推出Text-To-Text Transfer Transformer (T5)模型将所有NLP任务统一为‌文本生成问题‌。‌‌‌就是所有NLP任务都可以被转换为统一的文本到文本格式任务的输入和输出始终是文本字符串开启了模型统一的时代。并且开启了transformer 预训练 prompt的范式的训练实现了“通用模型上的多任务”的实现方式。特点是自监督、一次训练多任务。主打降成本、一模型多用处。5、大模型研发进入多模态混战时代1谷歌推出Gemini全能系列可以同时处理文字、图像、声音等信息。大模型竞争进入多模态时代听说读写样样都可以文字、视频、声音、图像, 都是可以处理的。2OpenAI除了继续在聊天领域发力同时积极寻找细分领域发力比如编码、数学等细分领域进行错位竞争。此时自然语言大模型和人工智能、通用人工智能AGI深度绑定大家一致任务AI/AGI的技术方向就是大模型于是资本纷纷入场有实力的大厂和实验室开始研发自己的大模型后起之秀主要有Meta的Llama系列开源大语言模型、Anthropic的Claude系列大模型、亚马逊的Nova系列多模态模型。3Meta的Llama系列Meta元宇宙前身FaceBook作为后来者以低训练成本、开源对话模型为定位切入大模型竞争。2023年发布Llama系列开源大语言模型用极低的成本接近GPT-3.5的问答效果。核心创新是小基座少量指令数据就可以做出可聊天AI引爆开源大模型生态用极低的门槛、不依赖OpenAI闭源API普通人、小团队也能自制对话AI开启了全球开源大模型百模大战。Llama 405b在对话领域效果是仅次于OpenAI的。Meta凭借高性能和开放策略迅速成为开源社区的核心基座模型。截至2026年7月该系列已迭代至Llama 4‌并在多模态处理、推理效率及终端侧部署上取得了显著突破。4Anthropic的Claude系列Anthropic是一家主打“安全优先”的美国旧金山的一家人工智能公司‌由OpenAI前高管达里奥·阿莫迪Dario Amodei和丹妮拉·阿莫迪Daniela Amodei兄妹于2021年创立核心团队多来自OpenAI的GPT-2、GPT-3研发阵营 。核心产品是Claude系列大模型。公司主打解决大模型幻觉问题Claude系列是在生成的基础上添加了价值导向就是不会给你胡编乱造。5亚马逊的Nova系列2024年亚马逊推出的Nova系列多模态模型Nova Pro性能接近Claude 3.5 多模态的概念现在已经从文生图、文生视频进化为Any to Any, 将多模态推到极致。6、多领域混战在某个细分领域发力。比如有的专注聊天领域、编码领域、数学领域等。比如1聊天领域的OpenAI的ChatGPT2coding能力最强的模型也就是编码能力OpenAI o1 -- Claude 3.5 Sonnet -- GPT-4o3数学领域最强的模型OpenAI o1 -- GPT-4o -- Nova Pro4解决推理能力的多任务推理能力(Multitask Reasoning)最强的是OpenAI的O系列这个领域openai公司的模型是遥遥领先的其O1O2的推理能力非常强O3正在开发中。推理能力就是模型在回答问题的时候会有一个推理的过程。O系列的推理能力非常强。二国内的大模型竞争态势1、从技术创新上看国内的技术贡献是专家模型MoE系列mixture of expert以及与之对应的负载均衡技术。2、从细分领域来看1对话模型最好的是字节的doubao-pro-32k模型其次是百度的文心4.0ERNIE 4.0 TurboTurbo采用混合专家系统(MoE)架构,通过动态路由机制将任务分配至2048个专家子网络。2视觉模型最好的GPT-4o-20241120, 其次是Doubao-Pro-Vision-32k-24102b、Claude-3.5-Sonnet-202410223文成图模型最好的是华为的Hunyuan-Image, 其次是Doubao Image v2.14开源模型阿里的通义千问Qwen2.5-72b-Instruct, 其次是Deepseek-V2.5、Llama-3.1-405B-Instruct。国内小团队利用开源模型做开发、部署基本也就是上面这3款基座模型可选。3、国内开源的有通义千问的Qwen-Turbo、质谱的GLM-4-plus、deepseek-chat。其中1质谱AI2019年成立源自清华计算机系知识工程实验室核心团队是清华唐杰教授、张拔院士团队位于中关村港股上市是全球首个大模型上市公司chatGLM、质谱清言、CogVLM多模态、CodeGeeX都是质谱公司的。2deepseekDeepSeek-V2通用对话大模型DeepSeek-R1深度推理模型对标OpenAI o1DeepSeek-Coder代码专用模型DeepSeek-VL多模态视觉模型deepseek是由量化私募幻方量化创始人梁文锋于2023年7月在杭州独立创办的是幻方专门拆分出来做通用大模型的全资AI子公司。绝大多数模型开源、允许商用。说明上面提到的大模型都是已经有比较大用户量的模型其实现在每天都有数百上千的大模型在发布。三大模型的终极目标AGI大模型的终极目标是AGI通用智能Artificial General Intelligence, 具备多领域能力、自主意识、硅基生命。今年年初美国投资5000亿美金启动星际之门计划解决开发大模型需要的算力、电力、数据等问题目标是实现AGI。二、大模型的研发技术1、NLP建模范式的变化大模型的建模范式和我们之前的任务都不一样下面从建模范式出发梳理一下大模型的两个相关概念预训练模型(Pre-trained Model)、迁移学习(Transfer Learning)。何为大模型大模型不仅仅是大语言模型这么单一的定义从技术角度看大模型其实就是一个预训练模型。那么又何为预训练模型预训练模型是指模型已经在大规模数据集上训练好了。就是这个模型已经见过几乎所有的样本了而且在这些样本上已经收敛的很好了。模型已经见过几乎所有的样本就是这个模型已经是这个领域的通用模型了因为它学习了几乎所有的样本。模型已经在这些样本上收敛的很好了就是说这个领域的基本的、普遍的、大众的规律这个模型已经掌握了就是这个模型可以提取这个领域的普适特征和规律了。这就好比一个让一个识字的人去看医书这个识字的人就是一个预训练模型或者说是一个通用模型。这个识字的人学习医术的过程就叫迁移学习(Transfer Learning)就是把一个大型数据集上学习到的知识迁移到另一个相关但不同的任务上。如果你让一个不识字的人去看医书这个人还得从先识字开始学识完字了才能学医那这个人就不是一个预训练模型。这个人得从0开始学习就要费劲很多。所以我们都喜欢预训练模型因为让一个预训练模型去学习医学、法律、会计、计算机等等专业领域它起步很高能很快在这些专业方向学出规律省劲儿并高效嘛。简言之预训练模型就是一个通用模型迁移学习就是微调微调的目的是让通用模型变成专业模型赋能各行各业。2、大模型研发预训练阶段大模型研发指的就是如何训练一个预训练模型。上面大模型演化史中提到的所有大模型其实都是预训练模型。而要训练一个预训练模型得有强大的算力支持、得有海量且巨量的训练数据这些都不是小团队可以做到的所以大模型的研发基本都是大厂或者有实力的科研单位的专属小公司小团队基本没戏。然而除了强大的财力支持前沿的技术支持也是必不可少的各大厂穷尽才思各种五花八门的训练技术、降本增效方法层出不穷比如在提升模型对自然语言的理解方面通过在大规模没有标注的语料上通过挖空让模型填坑的方式或者通过比如前面任务中的使用滑窗自动生成特征和标签的方式亦或者通过输入一个序列让模型rightshift一个位置原封不动输出这个序列的方式让模型学习大规模语料中的词汇、句法和上下文等通用的语言规律。比如在降低成本方面通过自动语料生成、构建大规模预料库等任务来降低训练大模型的成本。3、预训练模型的分类目前市面上的预训练模型的基础架构基本上都是Transformer。我们知道Transformer是编码器-解码器的架构其中编码器是进行特征提取或者特征压缩的过程解码器是进行特征还原或者特征解压的过程。所以编码器可以做情感分类、文本分析等任务而解码器可以生成任务。所以根据使用Transformer的不同方式预训练模型分1编码器(Encoder-only)模型仅使用Transformer的编码器代表模型为BERT, Bidirectional Encoder Representations from Transformers,由Google于2018年10月提出论文是《BERT:Pre-training of Deep Bidirectional Transformers for Language Understanding》。就是一个上下文相关的词表示模型。2解码器(Decoder-only)模型仅使用Transformer的解码器代表模型为GPTGenerative Pre-trained Transforer,由OpenAI于2018年6月提出论文是《Improving Language Understanding by Generative Pre-Training》。3编码器-解码器(Encoder-Decoder)模型同时使用Transformer的编码器和解码器代表模型是T5Text-to-Text Transfer Transformer, 由Google于2019年10月提出论文是《Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer》。这里的Transfer就是迁移学习的意思也就是预训练模型微调的意思。也所以此后我们直接将transformer的编码器叫BERTtransformer的解码器叫GPT。后面我会对GPT、BERT、T5这三个模型分别整理一个篇章详细写这三个模型的细节问题。这3个模型是整个AI领域的原理基础彻底理解了这3个模型理解AI领域的其他大模型就非常简单了因为此后的大模型基本就是在这3个模型的基础上堆参数、堆数据量scaling出来的。自GPT、BERT、T5等模型发布以来基于Transforer的预训练模型呈爆发态势大家争先恐后的在模型架构上增加层数扩大模型深度增加模型参数也就是后来的Scaling竞赛大力出奇迹大模型的预测能力也持续提升直到Scaling不动才消停。下图是2008年至2023年间具有代表性的预训练模型及其发展脉络‌4、大模型效果评价平台GLUE Benchmark‌是自然语言处理NLP领域用来给AI模型“打分”的一套标准考试题全称为The General Language Understanding Evaluation‌(通用语言理解评估)。它由纽约大学等机构在2018年推出目的是通过不同的任务全面测试模型能不能读懂人类语言比如判断句子情感、逻辑关系或语义相似度 。如果你想查看官方榜单或下载数据可以访问GLUE官网GLUE Benchmark本系列后面将讲的一些模型比如BERT、T5等它们的benchmark都是使用该网站上的数据集测评出来的分值如果你对你的模型非常自信的话就用上面的数据集去测试一下能排到前列是非常牛的。三、大模型的微调技术微调fine-tune为什么要微调其实前面已经说过了微调是让模型从通用模型变成专业模型。这里我再从大模型的痛点角度阐述一下为什么要微调因为当下几乎所有的微调技术都是为了应对大模型的痛点而诞生的所以从这个角度我们可以深刻理解为什么会出现五花八门、各种各样的微调技术。一预训练模型的痛点预训练模型只是见过几乎所有的语言样本而且在这些样本上已经收敛得很好了也就是说预训练模型仅仅只是理解了自然语言的语言规律至于语言承载的意识大模型是无能为力的。所以大模型(也就是预训练模型)的痛点有下面几点1无法访问实时数据。预训练时被投喂的是啥数据就学的是啥数据对新数据、实时数据大模型是不会的。2大模型生成的内容是无法符合人类价值观的。比如生成黄色内容、不道德内容等。3大模型是会胡乱生成内容的比如是会胡说八道的我们也叫模型幻觉。4大模型更是无法直接操作外部工具的。上述的痛点限制了大模型的使用场景似乎大模型只能聊天这严重制约了大模型赋能各行各业的美好期愿。所以针对这些痛点人们研发了对应的微调技术。二大模型的微调技术1、学习新知识方面1添加任务头的微调Fine-tuning也叫有监督的微调SFT。在前面NLP专栏里我写过两个实操项目从中可以看出针对不同的任务我们要根据具体任务的特点开发出适配这个任务的任务头然后再训练模型直到模型达到任务预设的精度才算是完成了任务。所以SFT就是将预训练模型迁移至具体任务比如医疗、法律等专业领域。具体操作就是使用这些专业领域的少量标注数据微调(fine-tune)模型直到模型效果达到预期从而赋能专业领域。也就是前面说的预训练微调的建模范式目前这种建模范式已经成为当前NLP的主流技术路线广泛应用于文本分类、问答系统、翻译、对话等任务中。然而这种微调方式成本也非常高因为一是任务头需要用大量专业数据微调模型而且每种任务需要的数据和标签都不一样数据和标签又是严重依赖人工标注的那这个时间成本和资金成本就非常高昂了。二是需要计算资源GPU三是全参微调的时间成本也是非常高的。所以市面上又出现了低成本微调技术2低成本微调lora低秩微调lora是微调技术的基石是入门微调的基础技能。 低秩微调lora--Qlora(用量化解决显存问题)--AdaLoRA(解决的是秩分配均匀的问题)--DoRA(提高模型性能的)这是lora微调及其变体此外还有下面等策略a、基座模型lora适配器b、不调基座模型的参数只训练lora适配器c、不同任务训练不同的lora适配器2、实时知识更新方面SFT和lora微调都是一次训练但不能解决实时感知的问题就是无法进行实时知识更新。所以又诞生了下面的微调技术1RAG可以很好的解决实时知识更新的问题把专业数据或者实时数据loading--chunking--embedding到vector database, 当用户输入问题时rag 系统先通过问题在vector database中索引可能的答案然后把索引结果和用户问题打包成data augmented prompt发给大模型大模型生成答案返回给用户。这就可以很好的解决私有数据、实时数据的问题。2嵌入embedding成本较低比较灵活不需要训练相当于给大模型做了个外挂需要的时候才调用这个外挂所以一定程度上可以解决实时感知新信息的问题。比如今年最新的数学题你可以通过embedding的方式存储到其他地方需要的时候再调用。3、模型价值观问题1RLHF强化学习(对齐) 通过引入强化学习让模型学习人类的偏好这样模型生成的内容就会更加的遵守人类的指令。用一个小数据集跑强化学习的成本也是非常高的所以强化学习都是大厂在搞。4、模型幻觉问题就是解决模型胡说八道的问题最轻量的解决方式是Prompt engineering, 提示词工程。1硬提示词2软提示词soft prompt就是更改输入数据的前面部分维度进行全参微调。比如提示词前缀微调方法prefix tuning、比如百倍效率提升的微调方法P-Tuning V2。5、操作外部工具更智能一点Al agent--人形机器人--具身智能就是给硬件(机器人)安装智能体agent让硬件自己去感知周围、自己去学习从而让硬件具备思考推理能力。也就是用AI agent做下游开发和应用。四、大模型的下游应用开发一大模型行业应用基座大模型---行业垂直大模型---AI-Native开发大模型应用To B/C---appAPI1、基座大模型就是目前各大有实力的大厂和实验室在做。2、行业垂直大模型比如滴滴、大众点评等有大量行业数据沉淀的公司有数据可以做。3、AI-Native开发大模型应用To B/C互联网公司、科技公司、科创公司最爱干的事情C端notion ai智能体辅助写作比如调格式、错误检查B端所有的saas都会被重构。FDC前沿部署,Forward Deployed Engineer主打大模型分布式分离部署、离线私有化落地将AI模型落地到企业的具体场景。4、appAPI就是如果你不会coding你还想搭建一个应用那你用特定的app比如百度的coz, 用拖拽的方式来搭建。也就是调用api来搭建。这种方式不能自定义但可以实现你的粗框架。这就是基于低代码平台的快速工作流。快速开发产品原型MVP。二下游应用选择大模型的原则这是做AI开发我们首先要面对的问题。不同企业有不同的考虑和关注点比如效率部署的时间、响应的速度成本时间成本、人力成本、GPU资源(高性能显卡)、技术能力、成本和收入问题任务场景是做对话应用、需要识别语音、图片视频的多模态、上下文窗口的大小1、政府、金融机构、大型企业及其重视隐私和安全的企业适合开源大模型私有化部署或者自主开发闭源大模型。比如滴滴、大众点评等有大量行业数据沉淀的公司有数据而且数据隐私非常重要这类公司不倾向用别人做好的模型倾向于自己开发模型或者对开源模型进行私有化部署这样模型和数据是隔离的。2、中小企业不太介意隐私和安全问题可以使用羊驼或HuggingFace上的开源模型用自己的数据进行微调即可。3、大模型下游应用公司不介意隐私和安全的应用可以快速开发产品原型(MVP)、通用服务使用GPT或Gemini等API。Minimum Viable Product用最小成本做出核心功能版本快速推向市场验证想法是否可行‌再根据用户反馈迭代优化。‌‌4、大模型下游应用公司但是介意隐私和安全可以使用闭源API厂商服务或者本地开源部署开箱即用让自己的隐私数据进行隔离。三大模型资源1、闭源 申请质谱系列大模型获取API KEY通过代理站申请海外大模型API KEY2、开源使用Ollama本地部署羊驼8B使用LLM Studio HG来部署开源大模型四大模型开发平台1、HuggingFaceHuggingFace是一个提供开源预训练模型和相关工具链的平台目前已经是一个完整的AI开发生态系统支持NLP、计算机视觉、语音处理、多模态任务等多个领域。我们使用HF可以简化预训练模型的使用加速项目的开发和落地。2、VellumVellum是一个开发平台用于构建LLM应用。它提供了快速工程、语义搜索、版本控制、测试和监控等工具兼容主要的LLM提供商。Vellum可以帮助用户将LLM功能带入生产环境支持迅速开发和部署LLM模型同时提供质量测试和性能监控等功能。Vellum也是一个大模型评测机构评测的基本都是国外的大模型总体来说评测结果是以open ai为领头羊其次是claude。所以我们选择模型时最好也是首选open ai其次是claude效果会好一点。五硬件配置你的电脑配置得跟得上内存至少得大于等于12GB英伟达的显卡GPU至少大于等于6GB你才能训练或者微调一下大模型。哪怕是最古老的1060显卡都可以凑合跑大模型。但是如果你完全没有GPU只用CPU那一个bert-base模型训练一轮一般就得20多个小时这种训练效率会让你瞬间丧失继续学习的兴趣。一个8B参数大模型推理时至少需要24GB以上的显存来推理所以你没有GPU训练大模型是不可能的微调的难度也是极大的。也所以现在发布的大模型已经没有训练的必要了现在的重点是如何在特定领域中使用目前已经开源的大模型。如果自己部署大模型那你电脑的单卡GPU显卡得在3060以上这是最低的硬件要求。五、本系列专栏的内容介绍1、因为AI大模型的平台是HuggingFace所以我们会先简单介绍一下HuggingFace的基本操作。2、此后我们会详细讲解GPT\BERT\T5这三个经典预训练模型的架构、输入输出、根据下游具体任务的微调方式并配上一些小案例。虽然这3个大模型已经很老了但它们是你入门大模型原理的必备基础。3、介绍一些比较经典的大模型微调技术比如LoRA、RLFH等。4、大模型训练和开发不是个人有实力来做的但是大量的下游应用开发必然逃不过AI agen这个方向。所以智能体开发会介绍一下。