Linux下载、安装llama.cpp-b10068(附安装包llama-b10068-bin-ubuntu-vulkan-x64.tar.gz)

📅 2026/7/25 22:00:04
Linux下载、安装llama.cpp-b10068(附安装包llama-b10068-bin-ubuntu-vulkan-x64.tar.gz)
文章目录1. llama.cpp 简介2. b10068 版本亮点3. 获取安装包4. 快速开始1. llama.cpp 简介llama.cpp 是由保加利亚软件工程师 Georgi Gerganov 于 2023 年 3 月创建的开源 LLMLarge Language Model大语言模型推理引擎。最初是 Gerganov 在一个周末为了让 Meta 的 LLaMA 模型在 MacBook 上运行而发起的项目如今已发展成为本地 AI 推理领域的事实标准。截至 2026 年中该项目在 GitHub 上已获得约 12 万颗星Stars、超过 1600 位贡献者增长速度超过 PyTorch 和 TensorFlow。2026 年 2 月Gerganov 及 ggml.ai 团队正式加入 Hugging Face项目仓库从ggerganov/llama.cpp迁移至ggml-org/llama.cpp团队保留完全技术自主权项目保持 100% 开源MIT License。llama.cpp 的核心目标是实现 LLM 推理以最少的配置和最先进的性能在广泛的硬件上运行——无论是本地还是云端。它采用纯 C/C 实现编译为无任何运行时依赖的单一二进制文件支持超过 100 种 LLM 架构包括 LLaMA、Mistral、Phi、Gemma、DeepSeek、Qwen 等覆盖从手机到服务器的各类设备。知名的 Ollama、LM Studio、GPT4All 等工具均构建在 llama.cpp 之上。核心特色零依赖纯 C/C 实现无需 Python、PyTorch 或任何运行时库极致量化支持 1.5-bit 至 8-bit 整数量化大幅降低内存占用和推理延迟多后端加速CUDANVIDIA、Vulkan跨平台、MetalApple、SYCLIntel、HIPAMD、ROCmAMD、OpenVINOIntelCPUGPU 混合推理可部分加速超过总 VRAM 容量的模型GGUF 模型格式已成为本地 AI 推理的标准模型格式被 Hugging Face 推理端点原生支持Apple Silicon 优先通过 ARM NEON、Accelerate 和 Metal 框架深度优化丰富的绑定生态Python、Go、Node.js、Rust、C#、Java、Swift 等数十种语言绑定多模态支持LLaVA、Qwen2-VL、MobileVLM 等视觉语言模型2. b10068 版本亮点该版本汇集了2 位贡献者的1 条贡献。b10068 是 llama.cpp 的 CI 自动构建版本发布于 2026-07-18主要包含以下改进DFlash 模型 K/V 缓存旋转支持#25823在使用 K/V 量化时DFlash 模型现在能够正确旋转注入的 K/V 缓存Key/Value Cache提升了 DFlash 模型的推理准确性和兼容性。此改动由社区贡献者与项目创始人 Georgi Gerganov 协作完成。此版本提供多平台、多后端预编译二进制文件覆盖 LinuxCPU、CUDA、Vulkan、ROCm、OpenVINO、SYCL、WindowsCPU、CUDA、Vulkan、OpenVINO、SYCL、HIP、macOSARM/x64和 AndroidARM等全平台。3. 获取安装包如果访问 GitHub 不便安装包及中文文档https://hanshuixin.org/go/223R内含 llama-b10068-bin-ubuntu-vulkan-x64.tar.gz、README 中英对照、发布说明中英对照和 LICENSE。适用于 Linux x86_64amd64Vulkan 后端。Vulkan 为跨平台 GPU API支持 NVIDIA、AMD、Intel 三大品牌显卡。Linux安装llama.cpp-b10068llama-b10068-bin-ubuntu-vulkan-x64.zip ├── llama-b10068-bin-ubuntu-vulkan-x64.tar.gz ├── Linux安装llama.cpp-b10068llama-b10068-bin-ubuntu-vulkan-x64.pdf ├── README/ │ ├── README.md │ └── README-中文版.md ├── 发布说明/ │ ├── RELEASE-NOTES.md │ └── RELEASE-NOTES-中文版.md └── LICENSE4. 快速开始解压llama-b10068-bin-ubuntu-vulkan-x64.tar.gz到目标目录tar-xzfllama-b10068-bin-ubuntu-vulkan-x64.tar.gz解压后目录中包含以下主要可执行文件命令功能llama-cli命令行推理工具llama-serverOpenAI 兼容 API 服务器llama-perplexity困惑度评估工具llama-embedding文本嵌入生成工具使用本地 GGUF 模型文件进行推理# 命令行对话./llama-cli-mmy_model.gguf-p你好请介绍一下自己# 或直接从 Hugging Face 下载并运行./llama-cli-hfggml-org/gemma-3-1b-it-GGUF-p你好# 启动 OpenAI 兼容 API 服务默认 http://localhost:8080./llama-server-mmy_model.gguf系统要求Linux x86_64 系统Vulkan 驱动已安装。可通过vulkaninfo命令检查 Vulkan 支持状态。在终端中使用--list-devices参数可查看 llama.cpp 识别到的 GPU 设备。