关键要点
- 16款工具,两类任务:图像与视频生成(13款)以及视觉与OCR(3款)。
- 表格根据每款工具的记录生成,并对照其官方README或网站核对;短横线表示“文档中未说明”,绝不表示“没有”。
- 许可证的差异很重要,例如AUTOMATIC1111、DiffusionBee、Stable Diffusion WebUI Forge和Locally Uncensored为AGPL-3.0,ComfyUI和Fooocus为GPL-3.0,AnimateDiff、ControlNet和InvokeAI为Apache-2.0,StableSwarmUI和ToolNeuron为MIT,而Stable Diffusion使用OpenRAIL许可证。
- 表格中的每个工具名称都链接到其自己的PromptQuorum评测,安装步骤和局限都在评测中介绍。
📍 简单一句话
本地图像工具承担两类不同的任务——生成图像和视频,以及理解图像——因此PromptQuorum目录中的16款工具在各自任务内进行对比,所用表格与各工具自己的评测出自同一份工具数据。
💬 简单来说
有些工具根据文字提示绘制图片,有些则查看一张图片并回答与之相关的问题。拿绘图工具和读图模型比较“局部重绘”毫无意义,所以本指南只在同类之间进行对比。
我们如何对比
每款工具的各项事实——价格、许可证、平台、硬件需求以及类别专属属性——都只在该工具的目录记录中存储一次。下方的对比表根据这些记录生成,而该工具自己的评测也采用同一份记录,因此两者不会给出不同的数值。
类别专属属性(例如局部重绘或扩展支持)取自各项目的官方README或网站,并对照其中的确切措辞进行核对。文档没有提及的地方,表格显示短横线而不是猜测;如果某项说法带有限定条件(实验性、依赖某个分支,或是托管服务而非本地功能),该属性不会列入表格,而是在该工具的评测中说明。
只有拥有自己PromptQuorum评测的工具才会出现在表格中。本对比列出的是可在你自己设备上运行的工具,不对它们排名,因为合适的选择取决于你的限制条件。
对比表
请在下方选择一类任务,然后横向阅读每一行。点击工具名称可打开其完整的PromptQuorum评测。
| 工具 | 价格 | 许可证 | 平台 | 运行方式 | 硬件 | 版本 | 局部重绘(Inpainting) | 视频生成 | 节点/图形工作流编辑器 | 扩展/插件 | 低显存(VRAM)模式 | 本地API服务器 | 评测 | 产品链接 · 已披露 |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| AnimateDiff | 免费 | Apache-2.0 | Windows, Linux, macOS | 本地 | 13 GB显存 | — | — | 是 | — | — | — | — | 阅读评测 → | AnimateDiff |
| AUTOMATIC1111 | 免费 | AGPL-3.0 | macOS, Windows, Linux | 本地 | CPU即可 | v1.10.1 | 是 | — | — | 是 | 是 | 是 | 阅读评测 → | AUTOMATIC1111 |
| ComfyUI | 免费 | GPL-3.0 | macOS, Windows, Linux | 本地 | CPU即可 | v0.36.0 | — | — | — | — | — | 是 | 阅读评测 → | ComfyUI |
| ControlNet | 免费 | Apache-2.0 | Windows, Linux, macOS | 本地 | 8 GB显存 | — | — | — | — | — | 是 | — | 阅读评测 → | ControlNet |
| DiffusionBee | 免费 | AGPL-3.0 | macOS | 本地 | CPU即可 | — | 是 | 是 | — | — | — | — | 阅读评测 → | DiffusionBee |
| Draw Things | 免费 | Proprietary | macOS, iOS | 本地 | 8 GB内存 | — | — | 是 | — | — | — | — | 阅读评测 → | Draw Things |
| Fooocus | 免费 | GPL-3.0 | Windows, Linux, macOS | 本地 | CPU即可 | v2.5.5 | 是 | — | — | — | 是 | — | 阅读评测 → | Fooocus |
| Invoke AI | 免费增值 | Apache-2.0 | Windows, Linux, macOS | 本地 | 4 GB显存 | — | 是 | — | 是 | — | — | — | 阅读评测 → | Invoke AI |
| Locally Uncensored | 付费 | AGPL-3.0 | Windows | 本地 | 因模型而异 | — | — | — | — | — | — | — | 阅读评测 → | Locally Uncensored |
| Stable Diffusion | 免费 | OpenRAIL | macOS, Windows, Linux | 本地 | 10 GB显存 | — | — | — | — | — | — | — | 阅读评测 → | Stable Diffusion |
| Stable Diffusion WebUI Forge | 免费 | AGPL-3.0 | Linux, macOS, Windows | 本地 | 因模型而异 | — | — | — | — | 是 | — | 是 | 阅读评测 → | Stable Diffusion WebUI Forge |
| StableSwarmUI | 免费 | MIT | Windows, Linux | 本地 | 8 GB显存 | — | — | 是 | 是 | 是 | — | — | 阅读评测 → | StableSwarmUI |
| ToolNeuron | 免费 | MIT | Android | 本地 | 因模型而异 | — | — | — | — | — | — | 是 | 阅读评测 → | ToolNeuron |
“—”表示该项目自己的文档未说明,并不代表该功能不存在。数值取自各项目的官方README或网站,并在更新该工具评测时重新核对。
图像与视频生成:差异所在
- 工作流风格。 ComfyUI、Invoke AI和StableSwarmUI在文档中说明了基于节点或图的工作流。其他工具的文档没有描述节点编辑器。
- 扩展与插件。 AUTOMATIC1111、ComfyUI、Stable Diffusion WebUI Forge、StableSwarmUI和ToolNeuron在文档中说明了扩展或插件系统。
- 视频。 ComfyUI、StableSwarmUI、DiffusionBee、Draw Things、Locally Uncensored和AnimateDiff在文档中说明了视频或动画生成。
- 局部重绘。 AUTOMATIC1111、ComfyUI、DiffusionBee、Fooocus和Invoke AI在文档中说明了局部重绘。
- 低显存运行。 AUTOMATIC1111、Fooocus和ControlNet在文档中说明了低显存模式或明确的小显存需求;其他工具请查看其评测,因为显存需求取决于你加载的模型。
- 本地API。 AUTOMATIC1111、ComfyUI、Stable Diffusion WebUI Forge和ToolNeuron在文档中说明了可供其他应用调用的API。
- 许可证与价格。 AUTOMATIC1111、DiffusionBee、Stable Diffusion WebUI Forge和Locally Uncensored为AGPL-3.0;ComfyUI和Fooocus为GPL-3.0;AnimateDiff、ControlNet和Invoke AI为Apache-2.0;StableSwarmUI和ToolNeuron为MIT;Stable Diffusion使用OpenRAIL许可证。Draw Things是闭源应用,Locally Uncensored是付费应用,Invoke AI为免费增值。Copyleft许可证会对分发修改后的版本附加条件——参见AI工具许可证详解。
视觉与OCR:差异所在
- 读取图像中的文字。 LLaVA和Ollama视觉模型在文档中说明了读取或识别图像中的文字。
- 单次提示多张图像。 Idefics在文档中说明了可在一次提示中接受多张图像。
- 本地API。 Ollama视觉模型在文档中说明了本地API;Idefics文档中所述的API是托管的而非本地的,因此不计入。
- 许可证。 LLaVA和Idefics为Apache-2.0;Ollama视觉模型是一组许可证各不相同的模型,请查看每个模型自己的许可证。
本对比无法告诉你的事
- 它对比的是文档中说明的能力,而不是质量。它无法说明图像看起来效果如何,也无法说明文字读取的准确程度——这需要你用自己的提示词和自己的硬件来验证。
- 它不包含速度基准测试:PromptQuorum没有对这些工具做过相关测量。
- 短横线是项目文档中的空白,而不是否定的结论。有些工具可能支持其README中没有提及的功能。
- 编辑和放大工具(Real-ESRGAN、FunClip)以及通过Ollama使用的DALL-E 3不在此处对比:前两者可比较的共同点太少,后者没有PromptQuorum评测。
- 工具更新很快。每篇评测都会说明所核对的版本,评测更新时本指南也会随之更新。
常见问题
为什么图像生成与视觉模型要分开对比?
它们承担不同的任务,因此大多数属性只在同一类任务内才有意义——局部重绘适用于图像生成,读取图像中的文字适用于视觉模型。放在同一张表里,大多数单元格会是空的或没有意义。
对比表中的短横线是什么意思?
表示项目自己的文档没有说明该属性,并不表示该功能不存在;请查看该工具的评测或其代码仓库。
Stable Diffusion本身是一款应用吗?
Stable Diffusion是一系列图像模型,而不是一款应用。它与各应用一起列出,是因为它有自己的PromptQuorum评测,而且这里的大多数生成工具都可以运行Stable Diffusion模型。
这些工具有推广(联盟)链接吗?
没有。截至撰写本文时,PromptQuorum与本对比中的任何工具都没有联盟关系,这里的任何链接都不会带来佣金。
这份对比多久更新一次?
每年更新两次,并且每当所列工具的评测有更新时也会更新,因为表格与这些评测出自同一份数据。
资料来源
- 各工具的官方README或网站,列在该工具的PromptQuorum评测中(可从对比表链接进入)。
- PromptQuorum本地AI应用目录——表格每一行所依据的记录。
- AI工具许可证详解——上文所列各许可证系列的含义。