关键要点
- AGPL 3.0 许可证——免费使用;若修改后作为网络服务重新分发,则需承担著佐权义务
- 底层基于 llama.cpp(MIT 许可)构建,在其上添加了自有界面和额外功能
- 每个平台一个可执行文件:Windows、Linux x64、macOS ARM64——无需安装程序
- 内置网页界面 KoboldAI Lite 专为故事写作和角色扮演设计:可编辑输出、Memory/World Info 字段,以及多种聊天/冒险模式
- 通过 CUDA(NVIDIA)或 Vulkan(跨厂商,AMD 推荐路径)实现 GPU 加速;Linux 上还有滚动更新的 ROCm 构建版;纯 CPU 运行同样完全支持
- 同一可执行文件中还内置了 Stable Diffusion 图像生成和 Whisper 语音转文字
📍 简单一句话
KoboldCpp 是一款免费、AGPL 3.0 许可的单文件本地 LLM 应用,基于 llama.cpp 构建,无需安装即可运行 GGUF 模型,并内置面向故事写作和角色扮演的 KoboldAI Lite 网页界面。
💬 简单来说
下载一个文件,双击运行,浏览器标签页就会打开,已内置聊天和故事编辑界面——不需要单独的安装程序,不需要命令行配置,也不需要再叠加一个包装应用。
📌注: 唯一官方下载来源是 GitHub Releases 页面。其他网站上同名文件无法验证是否为正版构建。
KoboldCpp 是什么
KoboldCpp 是一款免费的单文件程序,基于 llama.cpp 推理引擎构建,在本地运行 GGUF 格式的语言模型,由化名为 LostRuins 的开发者维护。 它继承了原始 KoboldAI 项目的界面设计理念,并改为运行在 llama.cpp 后端之上,而非基于 Python 的推理栈。
该项目托管在 github.com/LostRuins/koboldcpp,以 GNU Affero 通用公共许可证第 3 版(AGPL 3.0)发布——这是一种著佐权许可证,不同于 llama.cpp 自身底层使用的宽松 MIT 许可证。版本更新频繁;截至测试时(2026 年 8 月底)最新版本为 v1.120。
- 按平台分发为单一可执行文件——koboldcpp.exe(Windows)、koboldcpp-linux-x64(Linux)、koboldcpp-mac-arm64(macOS Apple Silicon)
- 运行不需要安装程序、Python 环境或 Docker
- 实际模型推理依赖 llama.cpp,并在其上添加了自有服务器、网页界面和 API 层
- 除主要的 CUDA 构建版外,还提供 nocuda 构建版(无需 CUDA,支持 Vulkan)和面向旧硬件的 oldpc 构建版(CUDA11 + AVX1)
KoboldAI Lite 是什么,它额外提供了什么
KoboldAI Lite 是直接内置在 KoboldCpp 可执行文件中的网页界面——服务器一启动就会自动在浏览器标签页中打开,无需单独的安装步骤。 它专为长篇写作和角色扮演设计,而不仅仅是逐轮聊天。
- 可编辑输出:生成的文本可以直接编辑,而不仅仅是重新生成——这对协作式故事写作很重要
- Memory 和 World Info 字段:模型始终可见的持久上下文块,用于在长会话中保持角色细节或故事设定的一致性
- 多种模式:标准聊天、面向协作创作的"Story"模式,以及仿文字冒险游戏风格的"Adventure"模式
- Author's Note 与指令格式控制,可在不手动编辑底层提示模板的情况下调整语气和风格
- 完全在同一个可执行文件和同一本地服务器中运行——无需单独的前端应用或浏览器扩展
如何下载并运行 KoboldCpp
从官方 GitHub Releases 页面下载适合你平台的文件,然后直接运行——不存在安装步骤。 选择与自己硬件匹配的构建版本是唯一真正需要做的决定。
- 1访问 GitHub 上的 KoboldCpp Releases 页面——这是唯一的官方下载来源。
- 2选择对应平台的构建版本:Windows 用 koboldcpp.exe,Linux 用 koboldcpp-linux-x64,Apple Silicon 上的 macOS 用 koboldcpp-mac-arm64。
- 3选择对应的 GPU 路径:主构建版内置 NVIDIA CUDA 支持;项目方建议 AMD 用户优先尝试 nocuda 构建版中的 Vulkan 选项;Linux 上另有独立维护的滚动 ROCm 构建版;不具备现代指令集的旧硬件应使用 oldpc 构建版(CUDA11 + AVX1)。
- 4如果还没有 GGUF 模型文件,可从 Hugging Face 下载一个。
- 5运行可执行文件,在启动窗口中选择 GGUF 文件和 GPU 层卸载数量,然后启动服务器。
- 6浏览器标签页会自动打开 KoboldAI Lite 界面,并已连接到正在运行的本地服务器。
KoboldCpp 需要安装吗?
不需要。它是一个单一可执行文件——下载后直接运行即可。不涉及安装程序、单独的 Python 环境或 Docker 容器。
KoboldCpp 可以在没有 GPU 的情况下运行吗?
可以。纯 CPU 运行完全受支持;GPU(通过 CUDA、Vulkan 或 ROCm)只会加快生成速度,并非必需。
KoboldCpp 支持哪些 GPU 和硬件
KoboldCpp 通过不同的构建版本分别支持 NVIDIA、AMD 和纯 CPU 配置,而不是提供一个能自动检测一切的通用二进制文件。 要让 GPU 加速生效,需要选择与自己硬件匹配的构建版本。
- NVIDIA——主发行版二进制文件内置 CUDA 加速
- AMD——项目方自身建议优先尝试兼容性最广的 nocuda 构建版中的 Vulkan 后端;Linux 上另有独立维护的滚动 ROCm 二进制版本
- 跨厂商——Vulkan 后端也能在 Intel 显卡以及较旧的 NVIDIA/AMD 显卡上运行,无需厂商专用驱动
- 旧硬件——oldpc 构建版面向仅支持 CUDA 11 和 AVX1 的 CPU,适用于无法运行现代默认构建版的机器
- 纯 CPU——nocuda 构建版可在完全没有 GPU 的情况下运行,速度低于 GPU 加速推理
谁适合使用 KoboldCpp
如果故事写作、角色扮演或免安装单文件比原始吞吐量或最小体积更重要,就使用 KoboldCpp;如果需要多用户生产级服务或最小的下载体积,请选择其他工具。
KoboldCpp 与 Ollama 及其他本地工具相比如何
与 KoboldCpp 最接近的比较对象,一类是同样基于 llama.cpp 构建的工具,另一类是面向完全不同任务(高并发、多 GPU 吞吐量)的专用生产级服务引擎。
评估 KoboldCpp 时常见的误区
大多数误解都源于把 KoboldCpp 当作常规安装型应用来对待,或是从非官方渠道下载它。
常见问题
KoboldCpp 是什么?
KoboldCpp 是一款基于 llama.cpp 构建的免费单文件本地 LLM 应用。它无需安装步骤即可运行 GGUF 模型,并内置了专为故事写作和角色扮演设计的 KoboldAI Lite 网页界面。
谁在维护 KoboldCpp?
KoboldCpp 由化名为 LostRuins 的开发者在仓库 github.com/LostRuins/koboldcpp 上维护。版本更新频繁,截至 2026 年 8 月底最新版本为 v1.120。
KoboldCpp 免费吗?
是的。KoboldCpp 是采用 AGPL 3.0 许可的免费开源软件。没有付费层级,也没有托管产品——每一次 KoboldCpp 部署都运行在你自己掌控的硬件上。
KoboldCpp 采用什么许可证发布?
AGPL 3.0(GNU Affero 通用公共许可证第 3 版),一种著佐权许可证。这不同于底层引擎 llama.cpp 所使用的 MIT 许可证。
KoboldCpp 需要安装吗?
不需要。它以每个平台一个可执行文件的形式分发(Windows、Linux、macOS ARM64)——下载后直接运行,无需安装程序、Python 环境或 Docker 容器。
KoboldCpp 支持 AMD GPU 吗?
支持,但不是通过主 CUDA 构建版。项目方推荐将 nocuda 构建版中的 Vulkan 选项作为 AMD 的首选路径,并在 Linux 上另行维护滚动更新的 ROCm 构建版。
KoboldAI Lite 是什么?
KoboldAI Lite 是内置在 KoboldCpp 可执行文件中的网页界面。服务器一启动就会自动在浏览器中打开,提供可编辑输出、Memory/World Info 字段,以及专为角色扮演和协作写作设计的聊天、故事和冒险模式。
KoboldCpp 能生成图像或转录语音吗?
可以。同一可执行文件在主要的文本生成功能之外,还内置了 Stable Diffusion 图像生成和 Whisper 语音转录功能。
KoboldCpp 适合生产环境或多用户场景吗?
不适合,这不是它的设计目标。KoboldCpp 是为拥有丰富写作界面的单用户本地使用而构建的;对于高并发的多用户生产级服务,vLLM 或 NVIDIA TensorRT-LLM 才是合适的工具。
KoboldCpp 与 Ollama 有什么区别?
两者都基于 llama.cpp,但 Ollama 专注于没有内置界面的极简命令行工具和模型注册表,而 KoboldCpp 在同一个单一可执行文件中内置了完整的浏览器端写作与角色扮演界面(KoboldAI Lite)。
