Skip to main content
PromptQuorum
主页/本地LLM软件完整目录:224款工具,在自有硬件上运行AI(2026)
Overview & Reference

本地LLM软件完整目录:224款工具,在自有硬件上运行AI(2026)

·阅读约28分钟·Hans Kuepper 作者 · PromptQuorum创始人,多模型AI调度工具 · PromptQuorum

这份2026年更新版目录(最近更新于2026年8月)梳理了跨十个层级的224款本地LLM工具、部署工具、框架与视觉AI系统。2026年本地LLM生态系统清晰地分为十个层级。运行时(Ollama、llama.cpp、vLLM)将token送入模型;桌面应用(LM Studio、Jan、GPT4All)将运行时封装进聊天界面;Web界面(Open WebUI、LibreChat)在浏览器中实现相同功能;IDE集成(Continue.dev、PearAI、Windsurf)将本地模型接入代码编辑器;终端工具(Aider、ShellGPT、aichat)处理命令行工作流;RAG系统(AnythingLLM、PrivateGPT)使模型能够回答基于自有文档的问题;智能体框架(LangChain、CrewAI、LangGraph、SuperAGI)将调用串联成多步骤工作流;语音与音频技术栈(Whisper.cpp、Piper、XTTS)将能力延伸至文本以外;移动端客户端(MLC Chat、PocketPal AI)将其带到手机上;专业化生产力插件(Obsidian、Logseq、AutoGPT)将其嵌入您已在使用的工具;图像生成系统(Stable Diffusion、ComfyUI、Invoke AI)负责视觉AI任务。优先选择运行时(几乎所有人选Ollama),再在上面叠加一到两层。下方目录列出了每个层级中所有值得了解的项目及其许可证,方便您规划一个从头到尾完全开源的技术栈(如果这对您很重要)。**

224款本地LLM工具,分为7大类——Run & Serve、Chat & Assistants、Code & Development、Knowledge & Retrieval、Voice & Audio、Images & Video、Train & Operate。可在下方筛选、搜索与对比。

224款工具

完全本地: 121混合: 103云端: 0

Ollama

推理引擎
100%本地

整体最易上手——一条命令安装,OpenAI兼容API,庞大的模型库

使用自带引擎运行免费
取决于运行的模型
命令行桌面应用macOSWindowsLinux
180,722283篇文章
专题评测

llama.cpp

推理引擎
100%本地

大多数其他工具底层的基础C++引擎,可在任何平台运行,包括Apple Silicon

使用自带引擎运行免费
取决于运行的模型
命令行库/SDKmacOSWindowsLinux
126,800150篇文章
专题评测

vLLM

推理引擎
100%本地

多用户GPU部署的高吞吐量推理服务

使用自带引擎运行免费
取决于运行的模型
命令行库/SDKLinux
90,80091篇文章
专题评测

text-generation-webui

推理引擎
100%本地

面向高级用户的UI,拥有丰富的插件生态

使用自带引擎运行免费
取决于运行的模型
网页应用命令行WindowsLinuxmacOS
47,60015篇文章
专题评测

exo

推理引擎
100%本地

分布式推理——通过汇集多台日常设备的算力来运行大型模型

使用自带引擎运行免费
取决于运行的模型
命令行macOSLinux
47,2602篇文章
专题评测

SGLang

推理引擎
100%本地

面向智能体流水线的结构化推理服务

使用自带引擎运行免费
取决于运行的模型
命令行库/SDKLinux
33,5009篇文章
专题评测

Llamafile

推理引擎
100%本地

Mozilla出品的单文件可移植LLM运行方案

使用自带引擎运行免费
取决于运行的模型
命令行macOSWindowsLinux
25,9006篇文章
专题评测

MLC LLM

推理引擎
100%本地

移动端与边缘设备部署运行时

使用自带引擎运行免费
取决于运行的模型
库/SDK移动应用macOSWindowsLinuxiOSAndroid
23,1346篇文章
专题评测

oMLX

推理引擎
100%本地

基于MLX的Apple Silicon本地推理服务器,具备分页SSD缓存,专为本地编码智能体提供算力支持而设计

使用自带引擎运行免费
Claude CodeCursorOpenClaw
取决于运行的模型
桌面应用命令行macOS
21,8596篇文章
专题评测

TensorRT-LLM

推理引擎
100%本地

NVIDIA针对企业级GPU优化的推理方案

使用自带引擎运行免费
取决于运行的模型
命令行库/SDKWindowsLinux
14,50010篇文章
专题评测

OpenLLM

推理引擎
混合

可自托管的推理服务器,通过OpenAI兼容API运行DeepSeek、Llama等开源大模型

使用自带引擎运行免费
LlamaDeepSeekQwen
取决于运行的模型
命令行库/SDK
12,5351篇文章
专题评测

KoboldCpp

推理引擎
100%本地

内置UI的轻量级llama.cpp封装

使用自带引擎运行免费
取决于运行的模型
命令行网页应用WindowsLinuxmacOS
11,60013篇文章
专题评测

MLX-LM

推理引擎
100%本地

Apple研究院出品的Apple Silicon原生运行时

使用自带引擎运行免费
取决于运行的模型
命令行库/SDKmacOS
8,90010篇文章
专题评测

NVIDIA Dynamo

推理引擎
100%本地

自托管、数据中心级别的分布式推理服务框架,可在多GPU、多节点上部署大规模LLM

需要Ollama/LM Studio免费
vLLMTensorRT-LLMSGLangKubernetes
取决于运行的模型
命令行库/SDKLinux
8,1133篇文章
专题评测

LMDeploy

推理引擎
100%本地

自托管工具包,用于压缩、量化并以高吞吐量、OpenAI兼容的推理引擎提供LLM服务

使用自带引擎运行免费
InternLMLlamaQwenBaichuanDeepSeek
取决于运行的模型
命令行库/SDKLinux
8,0805篇文章
专题评测

TurboFieldfare

推理引擎
100%本地

原生Swift与Metal运行时,可在任意M系列MacBook上以约2GB内存本地运行Gemma 4 26B-A4B

使用自带引擎运行免费
Gemma
最低2GB内存
桌面应用命令行macOS
6,7682篇文章
专题评测

Shimmy

推理引擎
100%本地

纯Rust单文件二进制、OpenAI兼容的推理服务器,无需Python或llama.cpp依赖即可提供本地GGUF与SafeTensors模型服务

使用自带引擎运行免费
GGUFSafeTensors
取决于运行的模型
命令行macOSWindowsLinux
5,8902篇文章
专题评测

ExLlamaV2

推理引擎
100%本地

针对RTX GPU优化的快速量化推理

使用自带引擎运行免费
最低8GB显存
命令行库/SDKWindowsLinux
4,6004篇文章
专题评测

LoRAX

推理引擎
100%本地

自托管推理服务器,可在单张GPU上服务数千个微调LoRA适配器,且无需为每个适配器单独付费

自带引擎+外部引擎免费
HuggingFacePEFTLudwigDocker
取决于运行的模型
命令行库/SDKLinux
3,8322篇文章
专题评测

Rapid-MLX

推理引擎
100%本地

兼容OpenAI接口的Apple Silicon本地推理引擎,可作为Claude Code、Cursor、Aider的现成后端使用

使用自带引擎运行免费
Claude CodeCursorAiderCline
最低8GB内存
命令行macOS
3,7734篇文章
专题评测

claude-code-local

推理引擎
100%本地

MLX原生本地服务器,让Claude Code在Apple Silicon设备上100%本地运行,无需云端或API费用

使用自带引擎运行免费
Claude Code
取决于运行的模型
命令行macOS
3,3141篇文章
专题评测

Lucebox

推理引擎
100%本地

本地LLM推理服务器,针对特定消费级GPU提供手工调优内核和推测解码

使用自带引擎运行免费
Claude CodeCodexOpenCodeOpen WebUIGGUF
取决于运行的模型
命令行库/SDKLinux
2,8671篇文章
专题评测

vllm-mlx

推理引擎
100%本地

通过原生MLX将vLLM式连续批处理引入Apple芯片的OpenAI与Anthropic兼容推理服务器。

使用自带引擎运行免费支持MCP
Claude CodeOpenAI APIAnthropic API
取决于运行的模型
命令行macOS
1,5803篇文章
专题评测

mlx-serve

推理引擎
100%本地

面向Apple芯片的原生Zig推理服务器,通过OpenAI和Anthropic兼容API提供MLX与GGUF模型服务,并附带macOS菜单栏应用。

使用自带引擎运行免费支持MCP
Claude CodeContinueCursorOpen WebUI
取决于运行的模型
命令行桌面应用macOS
1,3731篇文章
专题评测

本页包含指向第三方产品的参考链接。PromptQuorum 未加入任何联盟计划——这些是不产生佣金的普通链接。点击链接和后续步骤由您自行承担责任。这些链接不代表 PromptQuorum 的任何认可或验证。

常见实用技术栈

不想逐一阅读九个类别的读者,直接选择最接近的技术栈并复用即可。每行将实际目标与经过验证的工具组合及最低硬件要求配对。

目标
技术栈
最低硬件要求
日常随意聊天LM Studio单独运行16 GB内存,无需GPU
高级用户最佳平衡Ollama + Open WebUI16 GB内存,可选GPU
文档问答Ollama + AnythingLLM16 GB内存,可选GPU
编程开发Ollama + Continue.dev16 GB内存 + 推荐GPU
角色扮演/创意写作KoboldCpp + SillyTavern16 GB内存,推荐GPU
隐私优先的企业场景Ollama + Open WebUI + PrivateGPT32 GB内存 + 12 GB VRAM
移动/外出使用MLC Chat或PocketPal AIiPhone 13+/Pixel 7+
Apple SiliconOllama(MLX后端)或LM StudioM2/M3/M4/M5,16+ GB统一内存
多用户团队vLLM + Open WebUI32+ GB内存 + 多GPU
9种常见本地LLM实用配置:从LM Studio单机版(16GB内存、无需GPU)到vLLM+Open WebUI多用户团队配置(32GB内存+多GPU),Ollama+Open WebUI为推荐的均衡默认方案。
9种常见本地LLM实用配置:从LM Studio单机版(16GB内存、无需GPU)到vLLM+Open WebUI多用户团队配置(32GB内存+多GPU),Ollama+Open WebUI为推荐的均衡默认方案。

关键要点

  • 十层架构,224个项目,一份全景图。运行时、桌面应用、Web界面、IDE集成、终端工具、RAG系统、智能体框架、语音/音频/视觉、移动端客户端、专业化生产力插件以及图像生成——2026年几乎所有主流项目都能归入其中某一层。
  • 优先选择运行时。Ollama是约95%用户的默认选择;llama.cpp是大多数其他工具底层的核心引擎;vLLM适合在真实GPU上为多用户提供并发推理服务。
  • 运行时以上的大多数层都是可选的。聊天只需一个桌面应用或Web界面即可。仅当需要代码辅助时才添加IDE集成;仅当需要CLI工作流时才添加终端工具;仅当需要基于自有文档问答时才添加RAG系统;仅当单次调用不够用时才添加智能体框架;仅当需要视觉输出时才添加图像生成。
  • 商业使用时许可证至关重要。MIT和Apache 2.0许可证主导生态系统。少数Web界面(text-generation-webui、KoboldCpp、Jan、SillyTavern)采用AGPL——个人使用无碍,商业部署前需仔细评估。下方"许可证"列已明确列出每个项目的许可证。
  • 多工具组合技术栈是常态。Ollama + Open WebUI + AnythingLLM + Continue.dev + Stable Diffusion在单台机器上即可同时覆盖聊天、RAG、编程和图像生成需求,互不冲突。下方"常见实用技术栈"表格列出了2026年经验证、实际可用的配方。
本地LLM技术栈的10个层次:224个活跃项目,涵盖运行时(Ollama、llama.cpp、vLLM)、桌面应用(LM Studio、Jan、GPT4All)、Web界面、IDE编辑器、终端工具、RAG系统、智能体框架、语音与音频、移动端、专用工具及图像生成(Stable Diffusion、ComfyUI)的完整生态地图。
本地LLM技术栈的10个层次:224个活跃项目,涵盖运行时(Ollama、llama.cpp、vLLM)、桌面应用(LM Studio、Jan、GPT4All)、Web界面、IDE编辑器、终端工具、RAG系统、智能体框架、语音与音频、移动端、专用工具及图像生成(Stable Diffusion、ComfyUI)的完整生态地图。

本目录如何保持及时更新

本目录每三个月审查一次,并在两次审查之间进行重点性的每月更新——最近更新于2026年8月,下次计划审查为2026年11月。2026年8月的扩充在所有层级新增了72多款工具,将语音/多模态拆分为三个专注层级(STT、TTS、视觉),将编程助手拆分为IDE集成(4a)和终端工具(4b),并新增了一个全新的图像生成层级。所有链接与许可证均已重新核实;新增条目(PearAI、Windsurf、Sourcegraph Cody、SuperAGI、Leon AI、Draw Things、Fooocus、StableSwarmUI等)均已验证处于活跃维护状态。纳入标准:项目在过去90天内活跃维护、具备可验证的开源许可证或明确的商业使用声明,并在2026年拥有一定用户份额或填补了某一层原本的空缺。连续两个以上发布周期未活跃的项目将被移除;符合标准的新项目将在下次审查时纳入。如需建议纳入某个项目,请向PromptQuorum仓库提交issue或PR,附上项目URL、许可证及采用上述格式的一句话描述。

参考来源

常见问题

本地LLM运行时与桌面应用有什么区别?

运行时(Ollama、llama.cpp、vLLM)是加载模型权重并提供API的引擎——通常与OpenAI兼容。桌面应用(LM Studio、Jan、GPT4All)是调用底层运行时的聊天界面。部分应用内置运行时(LM Studio内嵌llama.cpp),其他则需要单独安装运行时(Open WebUI调用Ollama)。运行时决定能做什么;应用决定使用是否便捷。

我可以同时使用此列表中的多个工具吗?

可以——大多数技术栈会组合2-4个工具。常见配置:Ollama作为运行时,Open WebUI用于聊天,AnythingLLM用于文档问答,Continue.dev用于编程——这四个工具可在单台机器上同时运行,共享同一个Ollama实例。上方"常见实用技术栈"表格列出了互不冲突的配方。

哪些工具支持完全离线使用且无遥测?

Ollama、llama.cpp、vLLM、Jan、GPT4All、Open WebUI、AnythingLLM、PrivateGPT、Continue.dev、Aider、KoboldCpp、Llamafile、MLX-LM以及本目录中大多数AGPL/MIT许可证应用在模型下载完成后均可完全离线使用。LM Studio和部分闭源工具提供可在设置中禁用的可选分析功能——建议安装后运行一次抓包验证。基于本地后端配置的Web界面(Open WebUI、LibreChat)仅在本地运行。

这些工具中是否有商业许可限制?

部分工具有限制:LM Studio、Msty、Backyard AI、Layla和Cursor是闭源软件——通常免费使用但不可再分发,商业条款各异。Private LLM需付费。AGPL许可工具(Jan、KoboldCpp、text-generation-webui、SillyTavern、Khoj、Copilot for Obsidian)可用于任何用途包括商业用途,但AGPL条款要求在公开托管修改版本时披露源代码。Apache 2.0和MIT项目(占多数)在任何场景下均可使用,无需超出许可证文本范围的归因要求。

哪些工具原生支持Apple Silicon(M系列芯片)?

Ollama、llama.cpp、MLX-LM、LM Studio、Jan、Enchanted、GPT4All、MLC Chat、AnythingLLM以及大多数Electron/Tauri应用均可原生运行于Apple Silicon并使用Metal后端。MLX-LM专为Apple设计,是M系列芯片上大型模型的最快选择。vLLM、TensorRT-LLM和ExLlamaV2以NVIDIA为主,在Apple Silicon上无法运行或性能欠佳——对于Apple用户,使用Metal后端的Ollama是默认选择。

这些工具都支持GGUF模型格式吗?

GGUF是llama.cpp及所有基于它的工具(Ollama、LM Studio、Jan、GPT4All、KoboldCpp、Llamafile)的原生格式。vLLM和TensorRT-LLM使用其自有优化格式(通常为AWQ或FP16)以获得更高吞吐量。ExLlamaV2使用EXL2量化。MLX-LM使用MLX转换后的权重。大多数列出的工具支持GGUF;少数(vLLM、TensorRT-LLM、ExLlamaV2、MLX-LM)需要从原始Hugging Face权重进行一次性格式转换。

对于没有编程经验的用户,哪些工具最合适?

GPT4All安装最简单(一键安装,8 GB内存即可运行),不过其自身的更新节奏近期有所放缓。LM Studio功能最丰富且无需使用终端。Jan是无代码选项中隐私保护最完善的。无需命令行的文档问答首选AnythingLLM。以上四款均列于上方桌面图形界面应用类别中。

我能在服务器上运行这些工具并远程访问吗?

大多数支持服务器部署的工具(Ollama、vLLM、LocalAI、Open WebUI、LibreChat、PrivateGPT、AnythingLLM)提供HTTP API,并可在设置中配置网络接口。标准模式:在家庭服务器或VPS上运行Ollama,在笔记本或手机上运行指向服务器IP的UI界面。将API视为普通Web服务处理——通过反向代理绑定到localhost,或在配有适当认证的私有网络中使用。Open WebUI开箱即支持多用户管理。

哪些工具支持多用户/团队使用场景?

Open WebUI、LibreChat、h2oGPT、AnythingLLM(启用管理功能时)和Dify专为多用户设计,具备基于角色的访问控制和用户独立的对话历史。当并发推理性能至关重要时,vLLM是合适的服务层——它通过批处理多用户请求实现Ollama在并发超过约3个时无法达到的吞吐量。

本目录多久更新一次?

每三个月更新一次,两次审查之间还有重点性的每月更新——最近审查为2026年7月,下次计划更新为2026年11月。每月的变化(项目失活、新工具取得显著份额、许可证变更)将以补丁形式应用到现有条目。全新类别或层级等待季度审查以保持结构稳定。上方"参考来源"部分列出了更新之间用于监测生态系统动态的社区索引。

我能否在不联网的情况下本地生成图像?

可以——Stable Diffusion、ComfyUI、Invoke AI、AUTOMATIC1111 WebUI以及第10层中的其他工具均完全运行在本地硬件上。Stable Diffusion需要6 GB以上显存(RTX 3060、RTX 4060或同等级别);Fooocus等优化后的UI可在4-6 GB显存的显卡上运行。Real-ESRGAN用于放大生成的图像;ControlNet提供空间控制(边缘、姿态、深度图);AnimateDiff可根据文本生成视频。以上工具均无需向外部服务器发送任何数据。

浏览以下幻灯片或下载PDF以供离线参考。 下载参考卡(PDF)

About this data

This directory is compiled with AI-assisted research from public sources (project READMEs, official sites, GitHub repositories). It is not exhaustive and may contain errors — hardware requirements, pricing, and platform support change frequently and some fields have not been independently verified yet.

Most entries carry no status badge: they are listed from public sources but not independently reviewed. A "Verified" badge means core facts (license, platforms, pricing) have been manually checked. A "PromptQuorum-tested" badge is only shown for tools PromptQuorum has actually installed and run — most entries do not have this badge yet.

The "PromptQuorum-tested" badge is reserved for tools we have personally installed and run — an untested tool never carries it, regardless of popularity or stars.

Spotted something wrong? Email hello@promptquorum.com and we will correct it.

← 返回 本地LLM进阶