Skip to main content
PromptQuorum
主页/本地LLM进阶/LLaVA评测(2026):开启本地视觉AI的研究模型
Voice, Speech & Multimodal

LLaVA评测(2026):开启本地视觉AI的研究模型

·13分钟阅读·Hans Kuepper 作者 · PromptQuorum创始人,多模型AI调度工具 · PromptQuorum

LLaVA(Large Language and Vision Assistant)是一个开源视觉语言模型,将视觉编码器与生成文本的LLM结合起来回答关于图像的问题。 由威斯康星大学麦迪逊分校、微软研究院和哥伦比亚大学的研究人员创建,发布于GitHub,如今更常通过Ollama运行(ollama run llava)。其代码采用Apache-2.0许可证,但预训练检查点依赖于其微调所用基础LLM的许可证(Vicuna,而Vicuna本身携带Llama 2社区许可证)——这是商业使用前值得理解的细微差别。有关当前本地视觉模型更广泛的比较,请参阅PromptQuorum的本地视觉模型指南

LLaVA(Large Language and Vision Assistant)是开源视觉语言模型,确立了当今大多数本地多模态AI的构建方式:视觉编码器输入到生成文本的LLM中。由威斯康星大学麦迪逊分校、微软研究院和哥伦比亚大学的研究人员创建,发布于GitHub并通过Ollama库分发,现在只需一条命令即可运行(ollama run llava)。本评测介绍LLaVA的实际功能、真实的安装和使用命令、其双层许可证(Apache-2.0代码加基础模型相关的权重许可证),以及它在2026年相较于更新的本地视觉模型所处的位置——真实全貌。

LLaVA评测(2026):开启本地视觉AI的研究模型

关键要点

  • 结合CLIP视觉编码器与Vicuna(基于Llama 2)文本解码器的视觉语言模型。
  • 代码许可证:Apache-2.0。预训练检查点通过其Vicuna基础继承Llama 2社区许可证。
  • 通过ollama pull llava以三种尺寸运行:7B、13B和34B。
  • 官方GitHub仓库自2024年5月11日起无任何提交;超过25,000颗星,未被归档。
  • 确立了大多数后续本地视觉语言模型所使用的架构模式。
  • 更新的模型(Qwen2.5-VL、Llama 3.2 Vision、MiniCPM-V)如今在OCR、图表和多语言文档方面已超越它。

📍 简单一句话

LLaVA是来自UW-Madison、微软研究院和哥伦比亚大学的开源视觉语言模型,确立了大多数本地多模态AI至今仍在使用的视觉编码器加LLM架构,代码采用Apache-2.0许可证,预训练检查点带有源自Llama 2的许可证条件,如今可通过Ollama用一条命令运行。

💬 简单来说

这是一个可以查看图像并回答相关问题的免费AI模型——这个研究项目证明了这种方式可以运作良好且成本低廉,如今最简单的运行方式是输入ollama run llava并指定一个图像文件。

📌: LLaVA的原始项目页面声明其数据、代码和检查点"仅供研究使用并据此授权",这一声明早于且比后来应用于GitHub仓库代码的Apache-2.0许可证更为严格。商业使用前请同时阅读GitHub的LICENSE文件和项目页面——参见下方的许可证与费用部分。

历史:从一篇研究论文到本地AI的标准

LLaVA由Haotian Liu、Chunyuan Li、Qingyang Wu和Yong Jae Lee创建,他们是隶属于威斯康星大学麦迪逊分校、微软研究院和哥伦比亚大学的研究人员,发表于2023年论文《Visual Instruction Tuning》,并被NeurIPS 2023接收为口头报告。

该论文的核心理念是使用GPT-4生成多模态指令跟随训练数据,然后利用这些数据教导一个开源视觉编码器和语言模型遵循视觉指令——描述图像、回答有关图像的问题,并以对话形式对视觉内容进行推理,训练成本仅为从零构建专有多模态模型的一小部分。

LLaVA-1.5于2023年10月发布,仅通过对原始架构的简单修改就在11个基准测试上取得了最先进的结果——主要是更高容量的视觉语言连接器和面向学术任务的训练数据——根据项目自身的页面,训练在8块A100 GPU上耗时约一天。

LLaVA-NeXT(也称LLaVA-1.6)于2024年1月发布,通过动态分块增加了对更高分辨率图像输入的支持(最高可达672×672,宽/高图像则可达336×1344),同时改进了OCR和视觉推理能力,并支持了Vicuna之外的其他基础LLM。

**公开的haotian-liu/LLaVAGitHub仓库已积累超过25,000颗星**,且未被标记为归档——但根据项目自身公开的提交历史,PromptQuorum发现其主分支自2024年5月11日起没有任何提交。这与一个已实现其目标(确立并推广该架构)的大学研究成果相符,而非一个持续商业开发的产品。

LLaVA是谁创建的?

LLaVA由Haotian Liu、Chunyuan Li、Qingyang Wu和Yong Jae Lee创建,他们是隶属于威斯康星大学麦迪逊分校、微软研究院和哥伦比亚大学的研究人员,发表于2023年论文《Visual Instruction Tuning》,并被NeurIPS 2023接收为口头报告。

LLaVA的实际功能

LLaVA将视觉编码器连接到大型语言模型,使组合系统能够同时接受图像和文本提示,然后生成关于该图像的自然语言回应——回答问题、描述场景、读取可见文本,并以对话方式对视觉内容进行推理。

  • CLIP编码器加LLM解码器。 LLaVA使用CLIP ViT-L/14视觉编码器将图像转换为一系列视觉特征,通过连接器模块将这些特征投影到与语言模型文本词元相同的嵌入空间,并将组合序列输入Vicuna(基于Llama 2)或在后续版本中输入Mistral或其他基础LLM以生成回应。
  • 视觉指令微调。 LLaVA没有在原始的图像-标题对上进行训练,而是在LLaVA-Instruct-150K上进行了微调,这是一个通过向GPT-4提供图像标题和目标检测标注生成的多轮视觉对话数据集——教会模型遵循开放式视觉指令,而不仅仅是生成标题。
  • 通过Ollama提供三种模型尺寸。 Ollama库将LLaVA打包为7B(4.7 GB)、13B(8.0 GB)和34B(20 GB)三种尺寸——通常更大的模型能产生更详细、更准确的描述,但代价是更多的VRAM消耗和更慢的推理速度。
  • LLaVA-1.6(LLaVA-NeXT)的分辨率改进。 通过Ollama和官方仓库支持的当前版本通过动态分块处理更高的输入分辨率,与2023年的原始版本相比,在文本阅读和细节任务方面有明显改善。
  • 以英语为中心的训练。 LLaVA-Instruct-150K以及用于评估该模型的基础基准测试主要为英语,因此对图像中非英语文本的开箱即用表现,弱于专门在多语言文档数据上训练的模型。

安装和运行LLaVA:分步指南

本指南涵盖最快、最常见的方式(Ollama),并提及原始仓库自身的方式以供参考。

  1. 1
    安装Ollama。
    Why it matters: 为macOS、Linux或Windows下载并安装[Ollama](https://ollama.com)。根据其[Ollama库页面](https://ollama.com/library/llava),这是官方列出的运行LLaVA的方式,耗时不到两分钟。
  2. 2
    下载LLaVA的模型尺寸。
    Why it matters: 运行`ollama pull llava`以获取默认的7B模型(约4.7 GB),或运行`ollama pull llava:13b`(约8.0 GB)或`ollama pull llava:34b`(约20 GB)以获得更高质量,但代价是更多的VRAM和磁盘空间。
  3. 3
    从CLI结合图像运行。
    Why it matters: 运行`ollama run llava "describe this image: ./photo.jpg"`,直接在提示文本中引用本地图像文件路径——无需单独的标志。
  4. 4
    (替代方案)使用原始仓库获得研究级控制。
    Why it matters: 克隆[haotian-liu/LLaVA](https://github.com/haotian-liu/LLaVA),安装其`requirements.txt`,并从Hugging Face下载检查点,以完全访问训练脚本、评估工具和Gradio网页演示——适用于研究或微调,但安装门槛明显高于Ollama。
  5. 5
    (可选)通过Ollama API以编程方式调用。
    Why it matters: 向`http://localhost:11434/api/generate`发送POST请求,将图像作为Base64编码的字符串放入`images`数组中,或使用官方的`ollama` Python或JavaScript库——参见下方的代码示例。

真实使用示例

这些示例使用Ollama的文档化CLI语法和HTTP API——这是当今运行LLaVA的主要支持方式。

  • 在CLI提示中引用文件路径即可 —— Ollama会检测.jpg/.png路径并自动附加图像;没有单独的--image标志。
  • 更大的模型尺寸会消耗更多的VRAM和时间。 7B模型是速度最快、VRAM消耗最低的选项;当描述准确性比速度更重要时,请使用13B或34B。
bash
# 安装并下载模型
# (先从 https://ollama.com 下载Ollama)
ollama pull llava

# CLI:通过在提示中引用文件路径来描述图像
ollama run llava "describe this image: ./photo.jpg"

# --- HTTP API(记录于Ollama自身的docs/api.md中) ---
# 使用Base64编码图像的 /api/generate
curl http://localhost:11434/api/generate -d '{
  "model": "llava",
  "prompt": "What is in this picture?",
  "stream": false,
  "images": ["<Base64编码的图像数据>"]
}'

# 使用Base64编码图像的 /api/chat(多轮对话)
curl http://localhost:11434/api/chat -d '{
  "model": "llava",
  "messages": [
    { "role": "user", "content": "What is in this image?", "images": ["<Base64编码的图像数据>"] }
  ]
}'

# --- 使用官方ollama库的Python示例 ---
import ollama

response = ollama.chat(
    model="llava",
    messages=[{
        "role": "user",
        "content": "What is in this image?",
        "images": ["photo.jpg"],
    }],
)
print(response["message"]["content"])

许可证与费用

**LLaVA在官方GitHub仓库中的代码采用Apache-2.0许可证**,这通过仓库的LICENSE文件及GitHub报告的许可证元数据得到确认。Apache-2.0是一种宽松的许可证:你可以使用、修改和再分发该代码,包括商业用途,只需附带署名和专利授权,且几乎没有其他限制。

预训练检查点则是另一回事:它们继承了其基础LLM的条件。 官方发布的LLaVA检查点是从Vicuna微调而来,而Vicuna本身是一个基于Meta的Llama 2构建的指令微调聊天机器人,项目自身的文档声明用户"必须遵守"原始许可证的"所有条款和条件"——具体列出了Llama 2、Vicuna、CLIP的许可证条款,以及OpenAI的使用条款(因为GPT-4被用于生成训练数据)。这意味着检查点的允许使用受Llama 2社区许可证条款约束(包括其可接受使用限制,以及要求非常大规模的商业部署需从Meta获得单独许可证),而不仅仅是Apache-2.0。

LLaVA的原始项目页面(与GitHub仓库不同的网站)添加了一项更严格、更古老的声明: 它将"数据、代码和检查点"描述为"仅供研究使用并据此授权",并另外指出训练数据集的CC BY-NC 4.0(非商业性)标注。这早于且比GitHub上现在展示的Apache-2.0代码许可证更为严格——这是同一项目在两个不同页面上真正令人困惑的声明组合,值得指出而非挑选最方便的一个来采信。

以上均不构成法律建议。在将LLaVA——或基于它微调的任何检查点——投入商业产品前,请阅读GitHub的LICENSE文件、项目页面上列出的条款、Llama 2社区许可证,并就你的具体基础模型和部署方式咨询律师。

LLaVA采用什么许可证?

LLaVA在GitHub上的代码采用Apache-2.0许可证,该许可证允许商业使用。然而,其官方发布的预训练检查点是从Vicuna(构建于Meta的Llama 2之上)微调而来,因此其使用也受Llama 2社区许可证条款的约束。项目一个独立的主页还将数据、代码和检查点描述为仅供研究使用,将训练数据描述为非商业性质(CC BY-NC 4.0)——这是比GitHub许可证更古老、更严格的声明。这不构成法律建议;在商业使用特定检查点之前,请自行阅读以上全部内容。

LLaVA不适合做什么

LLaVA仍然是一个真正有用、文档完善的模型,但在2026年它已不再是每一项视觉任务的最强选择。以下情况不适合使用它:

  • 纯文本任务。 LLaVA是一个视觉语言模型;对于不涉及图像的纯文本对话,请使用专用的文本LLM(通过Ollama或其他方式)——运行多模态模型进行纯文本聊天会浪费其视觉编码器占用的VRAM,却没有任何好处。
  • 需要现有最强的本地OCR或文档理解能力。 截至2026年,根据PromptQuorum的本地视觉模型比较,LLaVA-NeXT之后发布的模型——MiniCPM-V、Qwen2.5-VL和Llama 3.2 Vision——在文档OCR、表格和结构化提取方面已超越LLaVA。LLaVA的视觉编码器是在这一代高分辨率、以文档为重点的训练数据出现之前设计和训练的。
  • 读取图像中的非英语文本。 LLaVA-Instruct-150K以及该模型的核心训练数据主要为英语。对于中文、日文、韩文或其他非拉丁文字的文档OCR,专门在多语言文档语料库上训练的模型(Qwen2.5-VL)将明显优于它。
  • 从图表和图形中精确提取数字。 与2026年几乎所有本地视觉语言模型一样,LLaVA在从复杂图表中读取精确数值方面并不可靠——无论使用哪个模型,都应将提取的任何数字与源数据进行核对。
  • 假设持续的积极开发。 由于官方仓库自2024年5月11日起没有任何提交,不要指望原始项目会提供新功能、错误修复或更新的检查点——Ollama自身的多模态引擎更新和更新的模型系列实际上已将其取代为积极开发的选项。
  • 单一、简单的许可证说法。 由于代码(Apache-2.0)和官方发布的检查点(Apache-2.0加继承的Llama 2社区许可证条款,再加上项目独立主页上更严格的仅限研究声明)受三项重叠但不完全一致的声明约束,LLaVA无法提供像Bark(完全MIT,无额外条件)那样一行即可说清的许可证清晰度。

LLaVA的替代方案

Llama 3.2 Vision(通过Ollama)

最适合:
最佳的通用本地图像问答质量;11B和90B两种尺寸
许可证:
Llama 3.2社区许可证

Qwen2.5-VL(通过Ollama)

最适合:
最强的本地OCR和多语言文档理解
许可证:
Qwen许可证(较小尺寸为Apache-2.0)

MiniCPM-V(通过Ollama)

最适合:
在低VRAM(约6 GB)下实现高文档OCR精度
许可证:
衍生自Apache-2.0(OpenBMB)

Idefics3(Hugging Face)

最适合:
拥有强大文档/OCR基准的开放研究型VLM,尚未打包用于Ollama
许可证:
Apache-2.0(Llama3变体适用基础模型条款)

云端VLM API(GPT-4o、Claude、Gemini Vision)

最适合:
可用的最高多模态能力,无需本地硬件
许可证:
专有(付费API)

常见问题

LLaVA是什么?

LLaVA(Large Language and Vision Assistant)是一个开源视觉语言模型,由威斯康星大学麦迪逊分校、微软研究院和哥伦比亚大学的研究人员创建,结合视觉编码器与大型语言模型来回答关于图像的问题,发表于2023年论文《Visual Instruction Tuning》。

我可以将LLaVA用于商业用途吗?

LLaVA在GitHub上的代码采用Apache-2.0许可证,允许商业使用。然而,其官方发布的预训练检查点是从Vicuna(构建于Meta的Llama 2之上)微调而来,因此其使用也受Llama 2社区许可证条款的约束。项目一个独立的主页还将数据、代码和检查点描述为仅供研究使用,将训练数据描述为非商业性质(CC BY-NC 4.0)——这是比GitHub许可证更古老、更严格的声明。这不构成法律建议;在商业部署特定检查点之前,请阅读所有适用的许可证。

如何运行LLaVA?

最常见的方式是通过Ollama:安装Ollama,运行ollama pull llava,然后运行ollama run llava "describe this image: ./photo.jpg"。原始仓库也提供了自己的Python推理脚本和Gradio演示,以实现研究级控制。

LLaVA、LLaVA-1.5和LLaVA-NeXT(LLaVA-1.6)之间有什么区别?

LLaVA(2023年)是最初的架构。LLaVA-1.5(2023年10月)通过更高容量的连接器和更好的训练数据改进了基准测试结果。LLaVA-NeXT,也称LLaVA-1.6(2024年1月),通过动态分块增加了更高分辨率的图像输入,并改进了OCR和视觉推理。通过Ollama和当前GitHub仓库分发的版本反映了LLaVA-1.6/NeXT的改进。

LLaVA仍在积极维护吗?

官方GitHub仓库未被标记为归档,但PromptQuorum没有发现自2024年5月11日以来的任何提交。请将其视为已完成的研究成果,而非积极开发的软件——更新的模型以及Ollama自身多模态引擎的更新,已在很大程度上取代了它,成为新项目的选择。

LLaVA与Qwen2.5-VL或Llama 3.2 Vision等更新模型相比如何?

LLaVA确立了这些更新模型也在遵循的架构,但根据PromptQuorum的本地视觉模型比较,截至2026年,它在文档OCR、图表阅读方面已被Qwen2.5-VL和Llama 3.2 Vision超越,(特别是针对Qwen2.5-VL)在非英语文本方面也是如此。LLaVA因其易于安装、庞大的社区和广泛的教程覆盖而仍然具有相关性。

Ollama真的支持运行LLaVA吗?

是的——ollama run llavaOllama库中官方列出的模型,提供7B、13B和34B三种尺寸,是如今运行LLaVA最常见的方式之一,与原始仓库自身的推理脚本并存。

运行LLaVA需要什么硬件?

7B模型大约需要4.7 GB的磁盘空间,可在6-8 GB VRAM的GPU上运行(或在CPU上运行,速度较慢);13B和34B模型需要相应更多的VRAM和磁盘空间,以获得更好的描述质量。

结论

LLaVA在本地AI历史上赢得了自己的一席之地:它证明了一个连接到开源LLM的适度视觉编码器,在GPT-4生成的指令数据上进行微调后,能够在没有专有训练预算的情况下提供真正有用的图像理解——而它所确立的视觉编码器加LLM模式,至今仍是大多数本地多模态模型的运作基础。其代码许可证(Apache-2.0)是宽松的,但其官方发布的检查点通过其Vicuna基础携带了源自Llama 2的条款,再加上项目独立主页上更古老、更严格的仅限研究声明——在任何商业使用前请阅读全部三者。就2026年的原始能力而言,LLaVA已不再是最强的本地视觉模型:自2024年5月以来没有任何提交,而Qwen2.5-VL、Llama 3.2 Vision和MiniCPM-V等更新的选项在OCR、图表和多语言文档方面已超越它。如果你想要最简单的安装、最大的社区以及最多的现有教程,ollama run llava仍然是一个真正不错的起点。如果文档准确性或非英语文本很重要,请在选择模型前,将本评测与PromptQuorum的本地视觉模型比较和Ollama视觉模型指南结合参考。

来源

← 返回 本地LLM进阶