常见实用技术栈
不想逐一阅读九个类别的读者,直接选择最接近的技术栈并复用即可。每行将实际目标与经过验证的工具组合及最低硬件要求配对。
目标 | 技术栈 | 最低硬件要求 |
|---|---|---|
| 日常随意聊天 | LM Studio单独运行 | 16 GB内存,无需GPU |
| 高级用户最佳平衡 | Ollama + Open WebUI | 16 GB内存,可选GPU |
| 文档问答 | Ollama + AnythingLLM | 16 GB内存,可选GPU |
| 编程开发 | Ollama + Continue.dev | 16 GB内存 + 推荐GPU |
| 角色扮演/创意写作 | KoboldCpp + SillyTavern | 16 GB内存,推荐GPU |
| 隐私优先的企业场景 | Ollama + Open WebUI + PrivateGPT | 32 GB内存 + 12 GB VRAM |
| 移动/外出使用 | MLC Chat或PocketPal AI | iPhone 13+/Pixel 7+ |
| Apple Silicon | Ollama(MLX后端)或LM Studio | M2/M3/M4/M5,16+ GB统一内存 |
| 多用户团队 | vLLM + Open WebUI | 32+ GB内存 + 多GPU |
关键要点
- 十层架构,160+个项目,一份全景图。运行时、桌面应用、Web界面、IDE集成、终端工具、RAG系统、智能体框架、语音/音频/视觉、移动端客户端、专业化生产力插件以及图像生成——2026年几乎所有主流项目都能归入其中某一层。
- 优先选择运行时。Ollama是约95%用户的默认选择;llama.cpp是大多数其他工具底层的核心引擎;vLLM适合在真实GPU上为多用户提供并发推理服务。
- 运行时以上的大多数层都是可选的。聊天只需一个桌面应用或Web界面即可。仅当需要代码辅助时才添加IDE集成;仅当需要CLI工作流时才添加终端工具;仅当需要基于自有文档问答时才添加RAG系统;仅当单次调用不够用时才添加智能体框架;仅当需要视觉输出时才添加图像生成。
- 商业使用时许可证至关重要。MIT和Apache 2.0许可证主导生态系统。少数Web界面(text-generation-webui、KoboldCpp、Jan、SillyTavern)采用AGPL——个人使用无碍,商业部署前需仔细评估。下方"许可证"列已明确列出每个项目的许可证。
- 多工具组合技术栈是常态。Ollama + Open WebUI + AnythingLLM + Continue.dev + Stable Diffusion在单台机器上即可同时覆盖聊天、RAG、编程和图像生成需求,互不冲突。下方"常见实用技术栈"表格列出了2026年经验证、实际可用的配方。
本目录如何保持及时更新
本目录每六个月审查一次,并在两次审查之间进行补丁更新——最近更新于2026年8月,下次计划审查为2026年11月。2026年8月的扩充在所有层级新增了72多款工具,将语音/多模态拆分为三个专注层级(STT、TTS、视觉),将编程助手拆分为IDE集成(4a)和终端工具(4b),并新增了一个全新的图像生成层级。所有链接与许可证均已重新核实;新增条目(PearAI、Windsurf、Sourcegraph Cody、SuperAGI、Leon AI、Draw Things、Fooocus、StableSwarmUI等)均已验证处于活跃维护状态。纳入标准:项目在过去90天内活跃维护、具备可验证的开源许可证或明确的商业使用声明,并在2026年拥有一定用户份额或填补了某一层原本的空缺。连续两个以上发布周期未活跃的项目将被移除;符合标准的新项目将在下次审查时纳入。如需建议纳入某个项目,请向PromptQuorum仓库提交issue或PR,附上项目URL、许可证及采用上述格式的一句话描述。
参考来源
- ggml-org/llama.cpp GitHub — 运行时架构和支持模型的主要信息来源。
- Ollama Library — 官方模型目录和运行时文档。
- LM Studio Documentation — 主流桌面GUI的功能参考。
- Open WebUI Documentation — 主流自托管Web界面的功能参考。
- Hugging Face Hub — 上述所有运行时消费的模型权重的主要下载来源。
- awesome-local-llm GitHub list — 用于验证项目纳入范围的社区维护清单。
常见问题
本地LLM运行时与桌面应用有什么区别?
运行时(Ollama、llama.cpp、vLLM)是加载模型权重并提供API的引擎——通常与OpenAI兼容。桌面应用(LM Studio、Jan、GPT4All)是调用底层运行时的聊天界面。部分应用内置运行时(LM Studio内嵌llama.cpp),其他则需要单独安装运行时(Open WebUI调用Ollama)。运行时决定能做什么;应用决定使用是否便捷。
我可以同时使用此列表中的多个工具吗?
可以——大多数技术栈会组合2-4个工具。常见配置:Ollama作为运行时,Open WebUI用于聊天,AnythingLLM用于文档问答,Continue.dev用于编程——这四个工具可在单台机器上同时运行,共享同一个Ollama实例。上方"常见实用技术栈"表格列出了互不冲突的配方。
哪些工具支持完全离线使用且无遥测?
Ollama、llama.cpp、vLLM、Jan、GPT4All、Open WebUI、AnythingLLM、PrivateGPT、Continue.dev、Aider、KoboldCpp、Llamafile、MLX-LM以及本目录中大多数AGPL/MIT许可证应用在模型下载完成后均可完全离线使用。LM Studio和部分闭源工具提供可在设置中禁用的可选分析功能——建议安装后运行一次抓包验证。基于本地后端配置的Web界面(Open WebUI、LibreChat)仅在本地运行。
这些工具中是否有商业许可限制?
部分工具有限制:LM Studio、Msty、Backyard AI、Layla和Cursor是闭源软件——通常免费使用但不可再分发,商业条款各异。Private LLM需付费。AGPL许可工具(Jan、KoboldCpp、text-generation-webui、SillyTavern、Khoj、Copilot for Obsidian)可用于任何用途包括商业用途,但AGPL条款要求在公开托管修改版本时披露源代码。Apache 2.0和MIT项目(占多数)在任何场景下均可使用,无需超出许可证文本范围的归因要求。
哪些工具原生支持Apple Silicon(M系列芯片)?
Ollama、llama.cpp、MLX-LM、LM Studio、Jan、Enchanted、GPT4All、MLC Chat、AnythingLLM以及大多数Electron/Tauri应用均可原生运行于Apple Silicon并使用Metal后端。MLX-LM专为Apple设计,是M系列芯片上大型模型的最快选择。vLLM、TensorRT-LLM和ExLlamaV2以NVIDIA为主,在Apple Silicon上无法运行或性能欠佳——对于Apple用户,使用Metal后端的Ollama是默认选择。
这些工具都支持GGUF模型格式吗?
GGUF是llama.cpp及所有基于它的工具(Ollama、LM Studio、Jan、GPT4All、KoboldCpp、Llamafile)的原生格式。vLLM和TensorRT-LLM使用其自有优化格式(通常为AWQ或FP16)以获得更高吞吐量。ExLlamaV2使用EXL2量化。MLX-LM使用MLX转换后的权重。大多数列出的工具支持GGUF;少数(vLLM、TensorRT-LLM、ExLlamaV2、MLX-LM)需要从原始Hugging Face权重进行一次性格式转换。
对于没有编程经验的用户,哪些工具最合适?
GPT4All安装最简单(一键安装,8 GB内存即可运行)。LM Studio功能最丰富且无需使用终端。Jan是无代码选项中隐私保护最完善的。无需命令行的文档问答首选AnythingLLM。以上四款均列于上方桌面图形界面应用类别中。
我能在服务器上运行这些工具并远程访问吗?
大多数支持服务器部署的工具(Ollama、vLLM、LocalAI、Open WebUI、LibreChat、PrivateGPT、AnythingLLM)提供HTTP API,并可在设置中配置网络接口。标准模式:在家庭服务器或VPS上运行Ollama,在笔记本或手机上运行指向服务器IP的UI界面。将API视为普通Web服务处理——通过反向代理绑定到localhost,或在配有适当认证的私有网络中使用。Open WebUI开箱即支持多用户管理。
哪些工具支持多用户/团队使用场景?
Open WebUI、LibreChat、h2oGPT、AnythingLLM(启用管理功能时)和Dify专为多用户设计,具备基于角色的访问控制和用户独立的对话历史。当并发推理性能至关重要时,vLLM是合适的服务层——它通过批处理多用户请求实现Ollama在并发超过约3个时无法达到的吞吐量。
本目录多久更新一次?
每六个月更新一次——最近审查为2026年7月,下次计划更新为2026年11月。中期变化(项目失活、新工具取得显著份额、许可证变更)将以补丁形式应用到现有条目。全新类别或层级等待定期更新以保持结构稳定。上方"参考来源"部分列出了更新之间用于监测生态系统动态的社区索引。
我能否在不联网的情况下本地生成图像?
可以——Stable Diffusion、ComfyUI、Invoke AI、AUTOMATIC1111 WebUI以及第10层中的其他工具均完全运行在本地硬件上。Stable Diffusion需要6 GB以上显存(RTX 3060、RTX 4060或同等级别);Fooocus等优化后的UI可在4-6 GB显存的显卡上运行。Real-ESRGAN用于放大生成的图像;ControlNet提供空间控制(边缘、姿态、深度图);AnimateDiff可根据文本生成视频。以上工具均无需向外部服务器发送任何数据。