Skip to main content
PromptQuorum
主页/本地LLM进阶/本地LLM软件完整目录:160+款工具,在自有硬件上运行AI(2026)
Overview & Reference

本地LLM软件完整目录:160+款工具,在自有硬件上运行AI(2026)

·阅读约28分钟·Hans Kuepper 作者 · PromptQuorum创始人,多模型AI调度工具 · PromptQuorum

这份2026年更新版目录(最近更新于2026年8月)梳理了跨十个层级的160+款本地LLM工具、部署工具、框架与视觉AI系统。2026年本地LLM生态系统清晰地分为十个层级。运行时(Ollama、llama.cpp、vLLM)将token送入模型;桌面应用(LM Studio、Jan、GPT4All)将运行时封装进聊天界面;Web界面(Open WebUI、LibreChat)在浏览器中实现相同功能;IDE集成(Continue.dev、PearAI、Windsurf)将本地模型接入代码编辑器;终端工具(Aider、ShellGPT、aichat)处理命令行工作流;RAG系统(AnythingLLM、PrivateGPT)使模型能够回答基于自有文档的问题;智能体框架(LangChain、CrewAI、LangGraph、SuperAGI)将调用串联成多步骤工作流;语音与音频技术栈(Whisper.cpp、Piper、XTTS)将能力延伸至文本以外;移动端客户端(MLC Chat、PocketPal AI)将其带到手机上;专业化生产力插件(Obsidian、Logseq、AutoGPT)将其嵌入您已在使用的工具;图像生成系统(Stable Diffusion、ComfyUI、Invoke AI)负责视觉AI任务。优先选择运行时(几乎所有人选Ollama),再在上面叠加一到两层。下方目录列出了每个层级中所有值得了解的项目及其许可证,方便您规划一个从头到尾完全开源的技术栈(如果这对您很重要)。**

这是一份收录160+款本地LLM工具、应用、框架与部署软件的2026年更新版目录——最近更新于2026年8月。2026年本地LLM生态系统已扩展到十个不同层级,在每一层做出正确选择对于构建能解决您问题且不过度复杂的技术栈至关重要。本目录整理了160+个活跃维护的项目,覆盖十个层级——运行时、桌面应用、Web界面、IDE集成、终端工具、RAG系统、智能体框架、语音/音频、移动端客户端、专业化生产力插件和图像生成——每项附有描述、许可证和主要链接。无论您是在挑选本地LLM工具、面向多用户服务的部署工具、用于构建智能体的框架,还是视觉AI系统,都可在确定技术栈之前将其作为"现有工具"全景图使用;每个类别末尾附有PromptQuorum该层详细对比指南的链接。

151 tools

Fully local: 76Hybrid: 75Cloud: 0

LM Studio

General chat clients
100% local

最精良的GUI,内置HuggingFace模型浏览器,支持服务器模式

Runs its own engineFree
≈8 GB RAM for a 7B model
Desktop appmacOSWindowsLinux
107 articles
Closed source

Atomic Chat

General chat clients
100% local

支持桌面和移动端的离线聊天应用,一键运行本地智能体

Runs its own engineFree
≈8 GB RAM for a 7B model
Mobile appiOSAndroid
3 articles
Apache 2.0

Msty

General chat clients
Hybrid

简洁的消费级UX,支持多提供商

Own engine + externalFree + paid tier
OllamaLM Studiollama.cppOpenAI API
≈8 GB RAM for a 7B model
Desktop appmacOSWindowsLinux
10 articles
Closed source

Backyard AI

Roleplay & companions
100% local

角色聊天与角色扮演桌面客户端

Runs its own engineFree + paid tier
≈8 GB RAM for a 7B model
Desktop appmacOSWindows
3 articles
Closed source

BoltAI

General chat clients
Hybrid

原生macOS桌面AI客户端,支持Ollama

Own engine + externalFree + paid tier
OllamaLM Studio
≈8 GB RAM for a 7B model
Desktop appmacOS
6 articles
Closed source

Draw Things

Image generation
100% local

基于Stable Diffusion的macOS和iOS本地图像生成

Runs its own engineFree
≈8 GB RAM for a 7B model
Desktop appMobile appmacOSiOS
1 article
Closed source

Hanoki

General chat clients
Hybrid

macOS 分支式聊天,通过 Ollama 本地运行或使用云端 API

Own engine + externalFree + paid tier
OllamaOpenAI APIAnthropic APIGoogle Gemini APIOpenRouter
≈8 GB RAM for a 7B model
Desktop appmacOS
1 article
MIT

Open Felix

Autonomous agents
Hybrid

macOS 智能体,在 Apple Silicon 本地运行或切换至云端

Own engine + externalFree + paid tier
≈8 GB RAM for a 7B model
Desktop appmacOS
1 article
Apache 2.0

Osaurus

General chat clients
100% local

原生 macOS 应用,通过 Ollama/MLX/LM Studio 本地运行模型

Own engine + externalFree
OllamaLM Studio
≈8 GB RAM for a 7B model
Desktop appmacOS
1 article
MIT

BoBe

General chat clients
100% local

免费的 Mac 本地 AI 桌面助手,设备端运行

Runs its own engineFree
≈8 GB RAM for a 7B model
Desktop appmacOS
1 article
Open source

Voxa

Real-time voice agents
Hybrid

本地优先的桌面语音助手,可选云端语音

Own engine + externalFree + paid tier
≈8 GB RAM for a 7B model
Desktop appmacOSWindows
1 article
MIT

Jarvis

Real-time voice agents
100% local

macOS 语音助手,完全离线运行(Llama、Whisper、Kokoro)

Runs its own engineFree
≈8 GB RAM for a 7B model
Desktop appmacOS
3 articles
Open source

Windsurf

Code assistants & IDE plugins
Hybrid

支持本地模型集成的AI优先IDE

Needs Ollama/LM StudioFree + paid tier
Set by your engine
Desktop appmacOSWindowsLinux
8 articles
Closed source

Sourcegraph Cody

Code assistants & IDE plugins
Hybrid

支持本地模型的AI编程助手

Needs Ollama/LM StudioFree + paid tier
Ollama
Set by your engine
Editor / notes pluginmacOSWindowsLinux
4 articles
Apache 2.0

CodeGPT

Code assistants & IDE plugins
Hybrid

支持多编辑器的IDE集成工具

Needs Ollama/LM StudioFree + paid tier
OllamaLM Studio
Set by your engine
Editor / notes pluginmacOSWindowsLinux
1 article
MIT

Cursor (local mode)

Code assistants & IDE plugins
Hybrid

支持本地模型的AI优先代码编辑器

Needs Ollama/LM StudioFree + paid tier
Set by your engine
Desktop appmacOSWindowsLinux
Closed source
Get it ↗

Bodega One Code

Code assistants & IDE plugins
Hybrid

本地优先的AI编程IDE,通过Ollama/LM Studio自带模型

Needs Ollama/LM StudioFree
OllamaLM Studiollama.cppLocalAIKoboldCpp
Set by your engine
Editor / notes pluginmacOSWindowsLinux
3 articles
Closed source

Blackbox AI (CLI)

Code assistants & IDE plugins
Hybrid

在Shell中进行终端代码生成与聊天

Needs Ollama/LM StudioFree + paid tier
Set by your engine
Command linemacOSWindowsLinux
Apache 2.0
Get it ↗

Hermes Agent

Autonomous agents
Hybrid

自我提升的个人AI代理,具备持久记忆

Needs Ollama/LM StudioFree
OllamaLM StudiovLLMllama.cpp
Set by your engine
Command linemacOSLinux
1 article
MIT

Msty Go

Autonomous agents
Hybrid

自主多步骤任务代理,支持本地或云端模型

Own engine + externalFree + paid tier
Ollamallama.cpp
≈8 GB RAM for a 7B model
Desktop appmacOSWindowsLinux
3 articles
Closed source

XTTS v2

Voice cloning
100% local

通过简短音频样本实现多语言语音克隆

Library / SDKFree
Set by the model you load
Library / SDKmacOSWindowsLinux
8 articles
CPML

Ollama vision models

Vision & OCR
100% local

通过Ollama运行的视觉模型(Llama 3.2 Vision、LLaVA等)

Needs Ollama/LM StudioFree
Ollama
Set by your engine
Command linemacOSWindowsLinux
4 articles
Various

Idefics

Vision & OCR
100% local

支持视觉与语言的开源多模态模型

Library / SDKFree
Set by the model you load
Library / SDKmacOSWindowsLinux
2 articles
Apache 2.0

Private LLM

General chat clients
100% local

精良的iOS和macOS本地LLM应用

Runs its own enginePaid
≈8 GB RAM for a 7B model
Mobile appiOSmacOS
14 articles
Closed source

本页包含指向第三方产品的参考链接。PromptQuorum 未加入任何联盟计划——这些是不产生佣金的普通链接。点击链接和后续步骤由您自行承担责任。这些链接不代表 PromptQuorum 的任何认可或验证。

常见实用技术栈

不想逐一阅读九个类别的读者,直接选择最接近的技术栈并复用即可。每行将实际目标与经过验证的工具组合及最低硬件要求配对。

目标
技术栈
最低硬件要求
日常随意聊天LM Studio单独运行16 GB内存,无需GPU
高级用户最佳平衡Ollama + Open WebUI16 GB内存,可选GPU
文档问答Ollama + AnythingLLM16 GB内存,可选GPU
编程开发Ollama + Continue.dev16 GB内存 + 推荐GPU
角色扮演/创意写作KoboldCpp + SillyTavern16 GB内存,推荐GPU
隐私优先的企业场景Ollama + Open WebUI + PrivateGPT32 GB内存 + 12 GB VRAM
移动/外出使用MLC Chat或PocketPal AIiPhone 13+/Pixel 7+
Apple SiliconOllama(MLX后端)或LM StudioM2/M3/M4/M5,16+ GB统一内存
多用户团队vLLM + Open WebUI32+ GB内存 + 多GPU
9种常见本地LLM实用配置:从LM Studio单机版(16GB内存、无需GPU)到vLLM+Open WebUI多用户团队配置(32GB内存+多GPU),Ollama+Open WebUI为推荐的均衡默认方案。
9种常见本地LLM实用配置:从LM Studio单机版(16GB内存、无需GPU)到vLLM+Open WebUI多用户团队配置(32GB内存+多GPU),Ollama+Open WebUI为推荐的均衡默认方案。

关键要点

  • 十层架构,160+个项目,一份全景图。运行时、桌面应用、Web界面、IDE集成、终端工具、RAG系统、智能体框架、语音/音频/视觉、移动端客户端、专业化生产力插件以及图像生成——2026年几乎所有主流项目都能归入其中某一层。
  • 优先选择运行时。Ollama是约95%用户的默认选择;llama.cpp是大多数其他工具底层的核心引擎;vLLM适合在真实GPU上为多用户提供并发推理服务。
  • 运行时以上的大多数层都是可选的。聊天只需一个桌面应用或Web界面即可。仅当需要代码辅助时才添加IDE集成;仅当需要CLI工作流时才添加终端工具;仅当需要基于自有文档问答时才添加RAG系统;仅当单次调用不够用时才添加智能体框架;仅当需要视觉输出时才添加图像生成。
  • 商业使用时许可证至关重要。MIT和Apache 2.0许可证主导生态系统。少数Web界面(text-generation-webui、KoboldCpp、Jan、SillyTavern)采用AGPL——个人使用无碍,商业部署前需仔细评估。下方"许可证"列已明确列出每个项目的许可证。
  • 多工具组合技术栈是常态。Ollama + Open WebUI + AnythingLLM + Continue.dev + Stable Diffusion在单台机器上即可同时覆盖聊天、RAG、编程和图像生成需求,互不冲突。下方"常见实用技术栈"表格列出了2026年经验证、实际可用的配方。
本地LLM技术栈的10个层次:160+个活跃项目,涵盖运行时(Ollama、llama.cpp、vLLM)、桌面应用(LM Studio、Jan、GPT4All)、Web界面、IDE编辑器、终端工具、RAG系统、智能体框架、语音与音频、移动端、专用工具及图像生成(Stable Diffusion、ComfyUI)的完整生态地图。
本地LLM技术栈的10个层次:160+个活跃项目,涵盖运行时(Ollama、llama.cpp、vLLM)、桌面应用(LM Studio、Jan、GPT4All)、Web界面、IDE编辑器、终端工具、RAG系统、智能体框架、语音与音频、移动端、专用工具及图像生成(Stable Diffusion、ComfyUI)的完整生态地图。

本目录如何保持及时更新

本目录每六个月审查一次,并在两次审查之间进行补丁更新——最近更新于2026年8月,下次计划审查为2026年11月。2026年8月的扩充在所有层级新增了72多款工具,将语音/多模态拆分为三个专注层级(STT、TTS、视觉),将编程助手拆分为IDE集成(4a)和终端工具(4b),并新增了一个全新的图像生成层级。所有链接与许可证均已重新核实;新增条目(PearAI、Windsurf、Sourcegraph Cody、SuperAGI、Leon AI、Draw Things、Fooocus、StableSwarmUI等)均已验证处于活跃维护状态。纳入标准:项目在过去90天内活跃维护、具备可验证的开源许可证或明确的商业使用声明,并在2026年拥有一定用户份额或填补了某一层原本的空缺。连续两个以上发布周期未活跃的项目将被移除;符合标准的新项目将在下次审查时纳入。如需建议纳入某个项目,请向PromptQuorum仓库提交issue或PR,附上项目URL、许可证及采用上述格式的一句话描述。

参考来源

常见问题

本地LLM运行时与桌面应用有什么区别?

运行时(Ollama、llama.cpp、vLLM)是加载模型权重并提供API的引擎——通常与OpenAI兼容。桌面应用(LM Studio、Jan、GPT4All)是调用底层运行时的聊天界面。部分应用内置运行时(LM Studio内嵌llama.cpp),其他则需要单独安装运行时(Open WebUI调用Ollama)。运行时决定能做什么;应用决定使用是否便捷。

我可以同时使用此列表中的多个工具吗?

可以——大多数技术栈会组合2-4个工具。常见配置:Ollama作为运行时,Open WebUI用于聊天,AnythingLLM用于文档问答,Continue.dev用于编程——这四个工具可在单台机器上同时运行,共享同一个Ollama实例。上方"常见实用技术栈"表格列出了互不冲突的配方。

哪些工具支持完全离线使用且无遥测?

Ollama、llama.cpp、vLLM、Jan、GPT4All、Open WebUI、AnythingLLM、PrivateGPT、Continue.dev、Aider、KoboldCpp、Llamafile、MLX-LM以及本目录中大多数AGPL/MIT许可证应用在模型下载完成后均可完全离线使用。LM Studio和部分闭源工具提供可在设置中禁用的可选分析功能——建议安装后运行一次抓包验证。基于本地后端配置的Web界面(Open WebUI、LibreChat)仅在本地运行。

这些工具中是否有商业许可限制?

部分工具有限制:LM Studio、Msty、Backyard AI、Layla和Cursor是闭源软件——通常免费使用但不可再分发,商业条款各异。Private LLM需付费。AGPL许可工具(Jan、KoboldCpp、text-generation-webui、SillyTavern、Khoj、Copilot for Obsidian)可用于任何用途包括商业用途,但AGPL条款要求在公开托管修改版本时披露源代码。Apache 2.0和MIT项目(占多数)在任何场景下均可使用,无需超出许可证文本范围的归因要求。

哪些工具原生支持Apple Silicon(M系列芯片)?

Ollama、llama.cpp、MLX-LM、LM Studio、Jan、Enchanted、GPT4All、MLC Chat、AnythingLLM以及大多数Electron/Tauri应用均可原生运行于Apple Silicon并使用Metal后端。MLX-LM专为Apple设计,是M系列芯片上大型模型的最快选择。vLLM、TensorRT-LLM和ExLlamaV2以NVIDIA为主,在Apple Silicon上无法运行或性能欠佳——对于Apple用户,使用Metal后端的Ollama是默认选择。

这些工具都支持GGUF模型格式吗?

GGUF是llama.cpp及所有基于它的工具(Ollama、LM Studio、Jan、GPT4All、KoboldCpp、Llamafile)的原生格式。vLLM和TensorRT-LLM使用其自有优化格式(通常为AWQ或FP16)以获得更高吞吐量。ExLlamaV2使用EXL2量化。MLX-LM使用MLX转换后的权重。大多数列出的工具支持GGUF;少数(vLLM、TensorRT-LLM、ExLlamaV2、MLX-LM)需要从原始Hugging Face权重进行一次性格式转换。

对于没有编程经验的用户,哪些工具最合适?

GPT4All安装最简单(一键安装,8 GB内存即可运行)。LM Studio功能最丰富且无需使用终端。Jan是无代码选项中隐私保护最完善的。无需命令行的文档问答首选AnythingLLM。以上四款均列于上方桌面图形界面应用类别中。

我能在服务器上运行这些工具并远程访问吗?

大多数支持服务器部署的工具(Ollama、vLLM、LocalAI、Open WebUI、LibreChat、PrivateGPT、AnythingLLM)提供HTTP API,并可在设置中配置网络接口。标准模式:在家庭服务器或VPS上运行Ollama,在笔记本或手机上运行指向服务器IP的UI界面。将API视为普通Web服务处理——通过反向代理绑定到localhost,或在配有适当认证的私有网络中使用。Open WebUI开箱即支持多用户管理。

哪些工具支持多用户/团队使用场景?

Open WebUI、LibreChat、h2oGPT、AnythingLLM(启用管理功能时)和Dify专为多用户设计,具备基于角色的访问控制和用户独立的对话历史。当并发推理性能至关重要时,vLLM是合适的服务层——它通过批处理多用户请求实现Ollama在并发超过约3个时无法达到的吞吐量。

本目录多久更新一次?

每六个月更新一次——最近审查为2026年7月,下次计划更新为2026年11月。中期变化(项目失活、新工具取得显著份额、许可证变更)将以补丁形式应用到现有条目。全新类别或层级等待定期更新以保持结构稳定。上方"参考来源"部分列出了更新之间用于监测生态系统动态的社区索引。

我能否在不联网的情况下本地生成图像?

可以——Stable Diffusion、ComfyUI、Invoke AI、AUTOMATIC1111 WebUI以及第10层中的其他工具均完全运行在本地硬件上。Stable Diffusion需要6 GB以上显存(RTX 3060、RTX 4060或同等级别);Fooocus等优化后的UI可在4-6 GB显存的显卡上运行。Real-ESRGAN用于放大生成的图像;ControlNet提供空间控制(边缘、姿态、深度图);AnimateDiff可根据文本生成视频。以上工具均无需向外部服务器发送任何数据。

浏览以下幻灯片或下载PDF以供离线参考。 下载参考卡(PDF)

About this data

This directory is compiled with AI-assisted research from public sources (project READMEs, official sites, GitHub repositories). It is not exhaustive and may contain errors — hardware requirements, pricing, and platform support change frequently and some fields have not been independently verified yet.

Most entries carry no status badge: they are listed from public sources but not independently reviewed. A "Verified" badge means core facts (license, platforms, pricing) have been manually checked. A "PromptQuorum-tested" badge is only shown for tools PromptQuorum has actually installed and run — most entries do not have this badge yet.

The "PromptQuorum-tested" badge is reserved for tools we have personally installed and run — an untested tool never carries it, regardless of popularity or stars.

Spotted something wrong? Email hello@promptquorum.com and we will correct it.

← 返回 本地LLM进阶