AI 编程不得不知道的二三事

📅 2026/8/25 14:16:57
AI 编程不得不知道的二三事
一句话记忆模型是「大脑」IDE/终端 Agent 是「手脚」范式是「怎么用它」MCP 等协议是「接口标准」Coze/Dify 是「搭积木的台子」。以下内容仅为一家之言旨在统计AI相关的东西目前以2026年8月份的数据进行整理一、大语言模型1.1 国外模型模型厂商核心优势短板适合场景ChatGPT / GPTGPT-5.x 系列OpenAI综合最均衡推理、数学、端到端编程都很强生态Codex、API、Copilot最完整中文语感略逊强模型价格偏高全能型主力英语场景首选ClaudeOpus / Sonnet / Haiku最新为 Claude 5 家族Anthropic编程 长文本的「天花板」Agent 能力工具调用、自主任务业界公认最强代码质量、代码审查口碑好多模态相对基础图文为主价格较高复杂编码、代码重构、Agent 开发GeminiGemini 3.xGoogle多模态原生最强科学推理强与 Google 全家桶搜索/Workspace深度集成性价比高编码 Agent 手感略逊 Claude/GPT多模态、文档/图表理解、长上下文GrokGrok 4.xxAI实时联网X 数据、风格活泼、多模态生态与工具链不如前三家实时信息、社交媒体相关任务Llama / MistralMeta / Mistral开源可私有化是大量本地部署/微调的底座旗舰能力略逊闭源头部自建/私有化部署、垂直微调1.2 国内模型模型厂商核心优势适合场景DeepSeekV4 / R 系列深度求索成本效益之王开源 MoE 架构中文/数学/代码强价格极低是国产编程 Agent 首选「大脑」之一编程、低成本规模化、开源生态通义千问 QwenQwen3.x阿里国产第一梯队Agent/工具调用能力突出全尺寸开源生态好智能体、工程化部署、To BKimiK2/K3月之暗面长上下文国产领跑多智能体协作能力强长文档分析、多 Agent 任务智谱 GLMGLM-5.x智谱 AI清华系代码与 Agent 能力均衡开源积极学术/研究、国产替代豆包 Doubao字节与 Trae/扣子生态绑定编程模型 Doubao-Seed-Code 成本极低字节生态内开发文心一言 ERNIE百度中文理解 百度搜索/地图生态中文内容、搜索增强其他MiniMax、阶跃星辰、百川、讯飞星火、腾讯混元各有垂直优势语音/多模态/政务等特定行业/垂直场景1.3 选型建议二、AI IDE 与编辑器2.1 国外工具厂商形态定位与优势CursorAnysphereIDEVS Code 分支独立 AI IDE 的综合最强Tab 补全是行业标杆并行子 Agent、插件/MCP 生态最全Claude CodeAnthropic终端 CLI终端 Agent 的代表大型多文件重构、代码库级理解的王者被大量资深开发者选作主力OpenAI CodexOpenAI终端 CLI开源终端 AgentRust 重写性能强与 ChatGPT/API 深度绑定/goal长时域任务、多 Agent 并行Windsurf→Devin DesktopCognitionIDEVS Code 分支Cascade 结对编程体验好2026 年 6 月已更名为 Devin Desktop路线图有不确定性GitHub CopilotGitHub/微软插件各 IDE 通用老牌补全助手覆盖面最广、上手成本最低企业集成好Cline开源VS Code 插件开源自主 Agent模型自由切换、MCP 生态成熟Aider开源终端 CLI轻量终端 Agentgit 集成好适合脚本化ZedZed编辑器性能极致ACP 协议的推动者AntigravityGoogleIDEGoogle 的 Agentic IDE与 Gemini 深度绑定DevinCognition云端自主 Agent「AI 软件工程师」云端独立完成整块工程任务2.2 国内工具厂商形态定位与优势Trae含 SOLO字节跳动独立 AI IDE国内首个 AI 原生 IDESOLO 模式多智能体协同、白盒可监督月活数百万Qoder / Qoder CN原通义灵码阿里插件 IDE CLI2026 年 5 月通义灵码更名国产模型自由切换Qwen/DeepSeek/Kimi/GLM企业合规强CodeBuddy腾讯插件 IDE CLI国内首款同时支持三种形态混元DeepSeek 底座微信生态集成深引入 Skills/Plan 模式文心快码百度插件 IDE百度 Comate中文场景、百度生态KiroAWS亚马逊独立 IDE主打 Spec-Driven 规范驱动开发 Hooks 自动化2.3 选型流程图三、开发范式3.1 Vibe Coding氛围编程提出者OpenAI 联合创始人 Andrej Karpathy2025 年 2 月被《柯林斯词典》评为 2025 年度词汇。定义用自然语言描述需求让 AI 直接生成/修改代码人不再逐行审查、甚至不完全理解代码「感觉对了就行」。典型做法下指令 → 点「全部接受」→ 报错直接贴给 AI → 修不好就绕过去。优点门槛极低、原型产出极快。风险技术债、安全漏洞、难以维护大项目。适用周末 demo、一次性脚本、验证想法。3.2 Spec-Driven Development规范驱动开发定义先让 AI 写「规格文档」需求 → 设计 → 任务清单人确认后再写代码。代表Kiro 的 Specs 机制、Trae SOLO 的 Plan 模式、Claude Code/Codex 的 plan。优势解决 Vibe Coding「边做边想、反复返工」的问题更可控、更适合工程化项目。3.3 Agentic Engineering智能体工程趋势Karpathy 2026 年提出的新阶段——99% 的时间不再直接写代码而是指挥、监督 AI 智能体干活并加入审查与质量控制。本质Vibe Coding 的「进阶成熟版」——保留了自然语言驱动的高效但补回了工程严谨性。四、核心概念 / 热词4.1 Agent智能体定义能自主规划、调用工具、多步执行、自我纠错的 AI 系统。区别于「你问一句它答一句」的聊天模型Agent 是「给目标它自己干完」。关键能力任务拆解Plan、工具调用Tool use / Function calling、记忆、循环执行直到目标达成。在编程里Claude Code、Codex、Cline 本质都是「编码 Agent」。4.2 Skill技能定义把「一类任务的固定做法」沉淀成可复用的指令文件如SKILL.mdAgent 遇到对应任务时自动加载执行。意义让 AI 从「每次都重新摸索」变成「调用已知套路」质量更稳定。关联Claude Code、CodeBuddy、OpenClaw、Hermes 等都已支持 Skill 机制。4.3 Superpowers超能力技能库定义一个开源「技能包」由 Jesse Vincent/obra 发起给 Claude Code 等 Agent 装上一套结构化的工程方法论——brainstorming头脑风暴、TDD测试驱动、systematic-debugging系统化调试、writing-plans写计划等。本质把「资深工程师的工作流程」做成一个个可调用的 Skill让 AI 干活时先想清楚再动手而不是瞎写。一句话Superpowers 「教你 AI 按工程纪律干活」的一套技能集合。4.4 MCPModel Context Protocol模型上下文协议定义Anthropic 发起的开放协议标准化AI Agent 如何连接外部工具/数据/API。类比「AI 的 USB-C 接口」——一个 MCP 服务器如 GitHub、数据库、文件系统可以被任何支持 MCP 的 Agent 复用。地位已成为事实标准几乎所有主流 AI 工具都支持。4.5 ACP / A2A容易混淆务必分清协议全称解决什么类比MCPModel Context ProtocolAgent ↔ 工具/数据AI 的 USB-CACPAgent Client Protocol编辑器 ↔ 编码 AgentAgent 的 LSP语言服务器协议A2AAgent-to-AgentAgent ↔ Agent 协作Agent 间的「通信协议」ACPZed/JetBrains 发起让「任何 Agent 都能跑在任何编辑器里」。A2AGoogle 发起已捐 Linux 基金会让多个 Agent 互相通信协作。注意缩写 ACP 其实对应三个不同协议编码语境下通常指Agent Client Protocol。4.6 小龙虾OpenClaw全称OpenClaw曾用名 ClawdBot → Moltbot因图标是红龙虾被国内叫「小龙虾/龙虾」。作者奥地利程序员 Peter Steinberger。定位本地优先、开源的自主 AI Agent 框架TypeScript/MIT被称为「AI Agent 的操作系统」——让 AI 真正在电脑上「动手」操作文件、终端、浏览器自主拆解任务、纠错、重试。与聊天 AI 的区别聊天 AI「动口」OpenClaw「动手」。风险权限大、误判可能误删文件Skill 供应链安全算力消耗大。4.7 Hermes Agent「爱马仕」厂商美国 Nous Research2026 年 2 月开源。定位终端原生、可「自进化」的 AI 编程智能体——口号「与你一同成长的智能体」。四大特色① 持久记忆迭代跨会话记住项目/习惯② 自主任务拆解③技能自我沉淀自动生成SKILL.md④ 安全沙箱。对比Claude Code「活在仓库里读写代码」OpenClaw「记忆静态、技能靠手写」Hermes「自己长出能力越用越懂你」。4.8 扣子Coze厂商字节跳动/火山引擎。定位零代码/低代码 AI Agent 平台SaaS拖拽式编排上手最快约 15 分钟搭一个 Agent。优势插件生态丰富800、一键发布到微信/飞书/豆包等渠道。局限不支持私有化部署数据过字节云。适合业务人员/非技术用户、智能客服、内容创作、快速验证创意。4.9 Dify厂商开源社区GitHub 50k Stars。定位开源 LLMOps / Agent 开发平台API 优先、支持 Docker 一键私有化部署。优势RAG 引擎深度可调混合检索、分段、Embedding 可换、20 模型供应商、每个应用自动生成 REST API。适合需要私有化/数据合规、复杂业务逻辑、深度二次开发、嵌入自有系统的团队。维度Coze 扣子Dify类型零代码 SaaS开源 LLMOps用户非技术/业务人员开发者/企业核心易用 生态分发工程化 RAG 私有化部署仅 SaaS可私有化4.10 其他关键概念RAG检索增强生成让模型「先查知识库再回答」解决幻觉、私有知识问答的核心技术。AGENTS.md / CLAUDE.md项目级「AI 记忆文件」告诉 Agent 项目的规则、命令、约定。Function calling / Tool use让模型能调用外部函数/API 的能力是 Agent 的基石。Embedding / 向量数据库把文本转成向量做语义检索RAG 的底层。SLOPStructured Output Protocol开源社区推动的「用 prompt 声明输出结构」的轻量协议与 MCP 互补。五、开发 AI 应用需要学什么按优先级展开Prompt 工程必学门槛最低怎么写清楚需求、怎么给上下文、怎么让输出稳定。这是所有 AI 开发的「基本功」。Function calling / Tool use必学让模型能查数据库、调 API、操作工具——没有它模型只是个「聊天框」。理解 JSON Schema 定义工具。RAG 向量数据库高频刚需私有知识问答、企业知识库都靠它。理解「分块 → 向量化 → 检索 → 拼进 prompt」这条链路。Agent 框架进阶LangChain / LangGraph编排工作流、CrewAI / AutoGen多智能体、或直接用 Claude Agent SDK / OpenAI Agents SDK 手写循环。建议先手写一个最简 Agent 循环再上框架理解本质。MCP工程化必备会写/会接 MCP Server就能把任何工具「插」进任何 Agent。评测与微调高级用基准如 SWE-bench 测编程 Agent、构建 eval 集评估你的应用必要时做 Fine-tuning微调或 LoRA。一个务实的建议不要一上来啃框架。真正的核心链路只有一句话——「模型 工具调用 循环/记忆」。手写一个小 Agent10 分钟能跑通比背 LangChain 文档有用得多。六、其他值得关注的热门6.1 网页/应用「一句话生成」类Vibe Coding 的产物v0Vercel一句话生成 React 前端 UI。bolt.newStackBlitz浏览器内一句话生成并运行全栈应用。Lovable面向非程序员的「想法 → 可上线产品」。Replit Agent云端一体化「从想法到部署」。6.2 智能体/工作流框架LangChain / LangGraph最主流的 LLM 应用与有状态工作流编排框架。CrewAI多智能体「角色协作」框架。AutoGen / Semantic Kernel微软多智能体对话/编排。Anthropic Agent SDK / OpenAI Agents SDK官方 SDK手写 Agent 循环的首选。6.3 基础设施向量数据库Pinecone、Weaviate、Milvus、Qdrant、Chroma以及 pgvector。模型网关/聚合OpenRouter、硅基流动 SiliconCloud国内、OneAPI。评测基准SWE-bench / SWE-bench Verified编程 Agent 能力、Aider Polyglot、LMArena模型盲测排行榜。6.4 趋势性概念Agentic IDEIDE 从「补全工具」升级为「可自主完成任务的智能体环境」Kiro、Antigravity 等都主打这个概念。长时域 AgentDurable Goals让 Agent 跨会话、跨中断持续干一个长期目标如 Codex 的/goal。AGENTS.md / 项目记忆把项目规则写进文件让 Agent「懂你的项目」。七、快速选型建议几句话总结写代码主力国外 Cursor / Claude Code国内 Trae / Qoder / CodeBuddy。模型「大脑」编程Agent 选 Claude全能均衡选 GPT多模态选 Gemini性价比/中文/私有化选 DeepSeek、Qwen、GLM、Kimi。搭应用快速上线选 Coze 扣子私有化/深度定制选 Dify。后台数字助手OpenClaw小龙虾动手能力强Hermes爱马仕记忆/自进化强。底层协议MCP连工具、ACP连编辑器、A2AAgent 协作——分清三者是理解现代 Agent 生态的关键。拓展cpugpu有什么区别对于ai部署本地模型都有哪些影响简单说CPU 擅长通用、复杂的串行任务GPU 擅长大量重复的并行计算。本地运行大语言模型时GPU 通常决定速度内存/显存决定模型能不能装下。对比项CPUGPU核心数量少量强核心大量并行小核心擅长任务系统逻辑、数据处理、控制流程矩阵乘法、神经网络推理和训练内存系统内存 RAM通常容量大、便宜独立显存 VRAM容量较小但带宽很高AI 推理速度通常较慢通常明显更快AI 生态通用性好NVIDIA CUDA 支持通常最完善功耗与价格相对低高性能显卡价格、功耗都较高对本地 AI 模型部署的影响1. 能否运行主要看内存或显存模型参数需要被加载到内存中。可以粗略理解为模型占用 ≈ 参数量 × 每个参数的字节数 上下文缓存 运行时开销使用常见的 4-bit 量化时大致需求为模型规模模型文件/基础内存建议可用内存7B/8B46 GB8 GB以上14B810 GB1216 GB32B1822 GB24 GB以上70B4048 GB4864 GB以上实际占用还受模型架构、量化格式、上下文长度和并发数量影响。上下文越长KV Cache 占用越大。如果显存不够可以把部分模型放到系统内存由 CPU 计算。一部分层放 GPU、一部分层放 CPU即 GPU offload。使用更低精度量化例如 8-bit、6-bit、4-bit。缩短上下文长度或降低并发。换更小的模型。但显存溢出到系统内存后速度通常会明显下降。2. 运行速度GPU 通常优势明显大语言模型推理主要包含两个阶段提示词处理prefill需要大量计算GPU 并行优势明显。逐字生成decode很依赖内存带宽GPU 显存带宽通常远高于普通内存。因此同一个模型纯 CPU能运行但速度可能只有每秒几 token具体取决于模型和内存带宽。全部放入 GPU通常会快很多。CPU GPU 混合性能介于两者之间并受 CPU/GPU 数据传输影响。3. 显存容量与算力哪个更重要对个人本地大模型推理来说通常优先级是显存或统一内存容量内存带宽GPU 算力CPU 性能原因很简单模型装不下再高的 GPU 算力也发挥不了。比如高算力但只有 8 GB 显存的显卡往往不如较慢但拥有 24 GB 显存的显卡适合运行大模型。4. 不同硬件平台NVIDIA 显卡CUDA 生态成熟。兼容 PyTorch、Transformers、vLLM、TensorRT-LLM 等大量工具。适合推理、微调和训练。主要限制通常是显存容量和价格。AMD 显卡可以通过 ROCm、Vulkan 等方式运行。部分系统和软件兼容性不如 CUDA需要确认具体显卡和框架支持。性价比可能不错但部署折腾成本可能更高。Apple Silicon MacCPU、GPU 共用统一内存没有传统意义上的独立显存限制。例如 32 GB 统一内存可以在系统允许的范围内同时供 CPU 和 GPU 使用。MLX、llama.cpp、Ollama 等工具体验较好。内存容量和带宽很重要适合安静、低功耗的本地推理。不适合依赖 CUDA 的工作流大规模训练能力也有限。只有 CPU通过 llama.cpp、Ollama 等仍然可以运行量化模型。适合 3B8B 小模型、低频使用、后台摘要或隐私场景。模型越大生成等待越明显。多通道高频内存对性能帮助很大。5. 推理、微调和训练的要求不同日常聊天/推理4-bit 量化最实用显存要求较低。LoRA/QLoRA 微调比推理占用更多显存通常更适合 NVIDIA GPU。全参数训练显存、算力和显卡互联要求极高个人电脑通常不现实。多人并发服务除了模型本身还要为每个请求预留 KV Cache因此显存需求会继续增加。实用选择建议偶尔本地聊天CPU 或 16 GB 统一内存的 Mac可运行小型量化模型。希望响应流畅优先 GPU并确保模型能完整进入显存。运行 7B/8B建议 812 GB 显存。运行 14B建议 16 GB左右显存。运行 32B建议 24 GB以上显存。运行 70B通常需要 48 GB以上显存/统一内存或多 GPU、CPU 混合。准备做微调优先考虑 NVIDIA 及其 CUDA 生态。一句话总结CPU 决定系统是否顺畅以及模型的最低运行能力GPU 决定 AI 推理速度RAM/VRAM 容量决定能运行多大的模型。能适应本地模型开发或者部署的电脑最低配置参考本地大语言模型LLM开发、推理或微调可以按下面配置参考。关键不是 CPU 型号而是显存/统一内存容量。配置档位使用目标最低配置参考大致适用模型学习、接口开发、验证流程6 核 CPU、16GB 内存、512GB NVMe可无独显1B3B 量化模型7B 可纯 CPU 跑但较慢实用入门8 核 CPU、32GB 内存、NVIDIA 1216GB 显存、1TB NVMe7B/8B 很舒适14B 4-bit 推理本地开发推荐12 核左右 CPU、64GB 内存、24GB 显存、2TB NVMe7B32B 量化推理7B/14B QLoRA 微调大模型工作站128GB 内存、48GB 以上总显存、24TB NVMe32B 高精度、70B 4-bit 推理及多并发训练基础模型多张专业 GPU/服务器通常不适合普通个人电脑以上是单用户、文本模型、4-bit 量化情况下的经验值。上下文越长、并发越高额外显存消耗越大。按模型规模估算显存模型规模4-bit 推理最低显存/可用内存比较稳妥1B3B34GB68GB7B/8B68GB1012GB14B1012GB16GB30B32B2024GB32GB70B4248GB6496GB实际内存占用包括模型权重、KV Cache、运行框架和系统开销。建议至少保留约 20% 余量。Hugging Face 举例说明8B 模型以 FP32 加载约需 32GB而 FP16/BF16 每参数约占 2 字节4-bit 量化还能进一步降低占用。Hugging Face Transformers如果现在配一台“最低但能认真干活”的电脑我会建议CPU现代 8 核以上支持 AVX2内存32GB最好可升级到 64GB显卡NVIDIA 16GB 显存硬盘1TB NVMe最好预留第二个 M.2 插槽系统Ubuntu 24.04 LTS或者 Windows 11 WSL2电源根据显卡选型留足余量例如当前 RTX 5060 Ti 有 16GB 版本官方建议整机电源最低约 600W对本地模型而言应优先选择 16GB 版本而不是显存更小但游戏性能略高的卡。NVIDIA 官方规格如果预算允许24GB 显存的显卡会明显延长机器寿命因为它可以容纳32B级4-bit模型。Mac 怎么选Apple Silicon 也很适合安静、低功耗的本地推理llama.cpp对 Apple Silicon、Metal 和 CPU/GPU 混合推理有原生优化。llama.cpp 官方项目建议绝对入门24GB 统一内存实用开发48GB 统一内存32B模型或长期使用64GB以上硬盘至少512GB推荐1TB以 Mac mini M4 Pro 为例官方配置可选48GB或64GB统一内存内存带宽为273GB/s。Apple 技术规格需要注意Mac 很适合 Ollama、MLX、llama.cpp 推理但如果重点是 PyTorch/CUDA微调、训练和复现研究项目NVIDIA Linux 的兼容性通常更好。微调配置微调和推理不是一个量级7B/8B QLoRA建议16GB显存起24GB更从容14B QLoRA建议24GB显存32B QLoRA通常需要48GB左右或激进的内存优化全参数微调个人显卡通常不现实在极限设置下4-bit双重量化甚至能让13B模型在16GB T4上进行微调但需要短上下文、batch size 1和梯度累积不能视为舒适配置。Hugging Face量化文档一句话结论仅学习可从“16GB内存、无独显”开始准备长期做本地模型开发建议直接上“64GB内存1624GB NVIDIA显存2TB SSD”。