Skip to main content
PromptQuorum
主页/本地LLM进阶/本地图像、视频与视觉工具对比(2026):生成、视觉与OCR
Image & Video Generation

本地图像、视频与视觉工具对比(2026):生成、视觉与OCR

·阅读约9分钟·Hans Kuepper 作者 · PromptQuorum创始人,多模型AI调度工具 · PromptQuorum

PromptQuorum目录中的16款本地图像工具分为两类应分别对比的任务:图像与视频生成(13款)以及视觉与OCR(3款)。 在生成类中,ComfyUI、InvokeAI和StableSwarmUI在文档中说明了基于节点的工作流;AUTOMATIC1111、ComfyUI、Stable Diffusion WebUI Forge、StableSwarmUI和ToolNeuron在文档中说明了扩展系统;AUTOMATIC1111、ComfyUI、Stable Diffusion WebUI Forge和ToolNeuron在文档中说明了本地API。在视觉类中,LLaVA在文档中说明了读取图像中的文字,Idefics在文档中说明了单次提示可处理多张图像。请使用下方的对比表,并在安装前阅读各工具自己的评测。

本地图像工具承担两类不同的任务——根据提示词生成图像和视频,以及理解你提供的图像——任何单一的功能清单都无法公平地对比它们。本指南按任务逐一对比16款可在你自己设备上运行的免费和付费工具,所用的对比表与各工具的PromptQuorum评测出自同一份数据,因此表格与评测不会互相矛盾。

本页包含指向第三方产品的参考链接。PromptQuorum 未加入任何联盟计划——这些是不产生佣金的普通链接。点击链接和后续步骤由您自行承担责任。这些链接不代表 PromptQuorum 的任何认可或验证。

关键要点

  • 16款工具,两类任务:图像与视频生成(13款)以及视觉与OCR(3款)。
  • 表格根据每款工具的记录生成,并对照其官方README或网站核对;短横线表示“文档中未说明”,绝不表示“没有”。
  • 许可证的差异很重要,例如AUTOMATIC1111、DiffusionBee、Stable Diffusion WebUI Forge和Locally Uncensored为AGPL-3.0,ComfyUI和Fooocus为GPL-3.0,AnimateDiff、ControlNet和InvokeAI为Apache-2.0,StableSwarmUI和ToolNeuron为MIT,而Stable Diffusion使用OpenRAIL许可证。
  • 表格中的每个工具名称都链接到其自己的PromptQuorum评测,安装步骤和局限都在评测中介绍。

📍 简单一句话

本地图像工具承担两类不同的任务——生成图像和视频,以及理解图像——因此PromptQuorum目录中的16款工具在各自任务内进行对比,所用表格与各工具自己的评测出自同一份工具数据。

💬 简单来说

有些工具根据文字提示绘制图片,有些则查看一张图片并回答与之相关的问题。拿绘图工具和读图模型比较“局部重绘”毫无意义,所以本指南只在同类之间进行对比。

我们如何对比

每款工具的各项事实——价格、许可证、平台、硬件需求以及类别专属属性——都只在该工具的目录记录中存储一次。下方的对比表根据这些记录生成,而该工具自己的评测也采用同一份记录,因此两者不会给出不同的数值。

类别专属属性(例如局部重绘或扩展支持)取自各项目的官方README或网站,并对照其中的确切措辞进行核对。文档没有提及的地方,表格显示短横线而不是猜测;如果某项说法带有限定条件(实验性、依赖某个分支,或是托管服务而非本地功能),该属性不会列入表格,而是在该工具的评测中说明。

只有拥有自己PromptQuorum评测的工具才会出现在表格中。本对比列出的是可在你自己设备上运行的工具,不对它们排名,因为合适的选择取决于你的限制条件。

对比表

请在下方选择一类任务,然后横向阅读每一行。点击工具名称可打开其完整的PromptQuorum评测。

工具价格许可证平台运行方式硬件版本局部重绘(Inpainting)视频生成节点/图形工作流编辑器扩展/插件低显存(VRAM)模式本地API服务器评测产品链接 · 已披露
AnimateDiff免费Apache-2.0Windows, Linux, macOS本地13 GB显存阅读评测AnimateDiff
AUTOMATIC1111免费AGPL-3.0macOS, Windows, Linux本地CPU即可v1.10.1阅读评测AUTOMATIC1111
ComfyUI免费GPL-3.0macOS, Windows, Linux本地CPU即可v0.36.0阅读评测ComfyUI
ControlNet免费Apache-2.0Windows, Linux, macOS本地8 GB显存阅读评测ControlNet
DiffusionBee免费AGPL-3.0macOS本地CPU即可阅读评测DiffusionBee
Draw Things免费ProprietarymacOS, iOS本地8 GB内存阅读评测Draw Things
Fooocus免费GPL-3.0Windows, Linux, macOS本地CPU即可v2.5.5阅读评测Fooocus
Invoke AI免费增值Apache-2.0Windows, Linux, macOS本地4 GB显存阅读评测Invoke AI
Locally Uncensored付费AGPL-3.0Windows本地因模型而异阅读评测Locally Uncensored
Stable Diffusion免费OpenRAILmacOS, Windows, Linux本地10 GB显存阅读评测Stable Diffusion
Stable Diffusion WebUI Forge免费AGPL-3.0Linux, macOS, Windows本地因模型而异阅读评测Stable Diffusion WebUI Forge
StableSwarmUI免费MITWindows, Linux本地8 GB显存阅读评测StableSwarmUI
ToolNeuron免费MITAndroid本地因模型而异阅读评测ToolNeuron

“—”表示该项目自己的文档未说明,并不代表该功能不存在。数值取自各项目的官方README或网站,并在更新该工具评测时重新核对。

图像与视频生成:差异所在

  • 工作流风格。 ComfyUIInvoke AIStableSwarmUI在文档中说明了基于节点或图的工作流。其他工具的文档没有描述节点编辑器。
  • 扩展与插件。 AUTOMATIC1111、ComfyUI、Stable Diffusion WebUI Forge、StableSwarmUI和ToolNeuron在文档中说明了扩展或插件系统。
  • 视频。 ComfyUI、StableSwarmUI、DiffusionBeeDraw ThingsLocally UncensoredAnimateDiff在文档中说明了视频或动画生成。
  • 局部重绘。 AUTOMATIC1111、ComfyUI、DiffusionBee、Fooocus和Invoke AI在文档中说明了局部重绘。
  • 低显存运行。 AUTOMATIC1111、Fooocus和ControlNet在文档中说明了低显存模式或明确的小显存需求;其他工具请查看其评测,因为显存需求取决于你加载的模型。
  • 本地API。 AUTOMATIC1111、ComfyUI、Stable Diffusion WebUI Forge和ToolNeuron在文档中说明了可供其他应用调用的API。
  • 许可证与价格。 AUTOMATIC1111、DiffusionBee、Stable Diffusion WebUI Forge和Locally Uncensored为AGPL-3.0;ComfyUI和Fooocus为GPL-3.0;AnimateDiff、ControlNet和Invoke AI为Apache-2.0;StableSwarmUI和ToolNeuron为MIT;Stable Diffusion使用OpenRAIL许可证。Draw Things是闭源应用,Locally Uncensored是付费应用,Invoke AI为免费增值。Copyleft许可证会对分发修改后的版本附加条件——参见AI工具许可证详解

视觉与OCR:差异所在

  • 读取图像中的文字。 LLaVAOllama视觉模型在文档中说明了读取或识别图像中的文字。
  • 单次提示多张图像。 Idefics在文档中说明了可在一次提示中接受多张图像。
  • 本地API。 Ollama视觉模型在文档中说明了本地API;Idefics文档中所述的API是托管的而非本地的,因此不计入。
  • 许可证。 LLaVA和Idefics为Apache-2.0;Ollama视觉模型是一组许可证各不相同的模型,请查看每个模型自己的许可证。

本对比无法告诉你的事

  • 它对比的是文档中说明的能力,而不是质量。它无法说明图像看起来效果如何,也无法说明文字读取的准确程度——这需要你用自己的提示词和自己的硬件来验证。
  • 它不包含速度基准测试:PromptQuorum没有对这些工具做过相关测量。
  • 短横线是项目文档中的空白,而不是否定的结论。有些工具可能支持其README中没有提及的功能。
  • 编辑和放大工具(Real-ESRGAN、FunClip)以及通过Ollama使用的DALL-E 3不在此处对比:前两者可比较的共同点太少,后者没有PromptQuorum评测。
  • 工具更新很快。每篇评测都会说明所核对的版本,评测更新时本指南也会随之更新。

常见问题

为什么图像生成与视觉模型要分开对比?

它们承担不同的任务,因此大多数属性只在同一类任务内才有意义——局部重绘适用于图像生成,读取图像中的文字适用于视觉模型。放在同一张表里,大多数单元格会是空的或没有意义。

对比表中的短横线是什么意思?

表示项目自己的文档没有说明该属性,并不表示该功能不存在;请查看该工具的评测或其代码仓库。

Stable Diffusion本身是一款应用吗?

Stable Diffusion是一系列图像模型,而不是一款应用。它与各应用一起列出,是因为它有自己的PromptQuorum评测,而且这里的大多数生成工具都可以运行Stable Diffusion模型。

这些工具有推广(联盟)链接吗?

没有。截至撰写本文时,PromptQuorum与本对比中的任何工具都没有联盟关系,这里的任何链接都不会带来佣金。

这份对比多久更新一次?

每年更新两次,并且每当所列工具的评测有更新时也会更新,因为表格与这些评测出自同一份数据。

资料来源

← 返回 本地LLM进阶