Principais conclusões
- Licença MIT — o framework Python principal é gratuito, com licença permissiva, e mantido ativamente
- Componentes essenciais: Documents/Nodes alimentam um Index (geralmente um VectorStoreIndex), um Retriever busca os nós relevantes, um Query Engine responde à pergunta
- Gratuito para instalar e hospedar por conta própria: pip install llama-index, com seu próprio provedor de LLM e banco vetorial
- O LlamaCloud é uma plataforma separada, paga por uso, para análise automatizada de documentos (LlamaParse) e extração — não é necessária para usar o framework de código aberto
- Code-first: não há tela visual — é uma biblioteca Python que você importa e sobre a qual escreve código
- O SDK TypeScript, LlamaIndex.TS, foi arquivado e marcado como descontinuado em 30 de abril de 2026 — Python é a implementação ativamente mantida
- Ideal para: desenvolvedores que constroem sistemas RAG em produção e querem controle programático sobre indexação e lógica de recuperação
📍 Em uma frase
LlamaIndex é um framework Python gratuito e de código aberto (MIT) que conecta grandes modelos de linguagem aos seus próprios dados por meio de indexação, recuperação e mecanismos de consulta — feito para desenvolvedores que escrevem código, não para construtores visuais sem código.
💬 Em termos simples
Em vez de arrastar blocos em uma tela, o LlamaIndex fornece classes Python: carregar seus documentos, construir um índice e depois consultá-lo — cada etapa é código que você pode versionar, testar e personalizar.
📌Note: Se você quer construir um pipeline RAG conectando blocos em vez de escrever Python, o LlamaIndex não é a ferramenta certa — considere um construtor visual como Flowise, Langflow ou Dify.
O que é o LlamaIndex?
LlamaIndex (github.com/run-llama/llama_index) é um framework Python de código aberto, com licença MIT, para construir aplicações que conectam grandes modelos de linguagem aos seus próprios dados. É antes de tudo um framework de dados: a biblioteca é organizada em torno da ingestão de documentos, sua estruturação para recuperação e a resposta a perguntas sobre eles — não em torno da orquestração geral de agentes.
- Conectores de dados: SimpleDirectoryReader para arquivos locais, além de mais de 300 integrações da comunidade e próprias no LlamaHub para PDFs, APIs, bancos SQL e outras fontes
- Índices: estruturas que organizam os dados ingeridos para recuperação por um LLM — VectorStoreIndex (busca semântica baseada em embeddings) é o mais comum
- Retrievers: buscam os nós relevantes para uma consulta a partir de um índice
- Query Engines: combinam um retriever com uma chamada ao LLM para responder a uma pergunta sobre seus dados — o núcleo do ciclo de geração aumentada por recuperação (RAG)
- Workflows: um sistema orientado a eventos para orquestrar agentes e pipelines de múltiplas etapas além de uma única consulta
- O repositório Python principal registra mais de 50.000 estrelas no GitHub
Quais são os componentes essenciais do LlamaIndex?
O LlamaIndex organiza um pipeline RAG em cinco componentes: Document/Node, Index, Retriever, Query Engine e Workflow. Cada um corresponde a uma etapa para transformar arquivos brutos em um LLM capaz de responder perguntas sobre eles.
Document / Node
- O que faz:
- Dado bruto, depois os fragmentos estruturados que vêm dele
Index
- O que faz:
- Organiza os nós para recuperação (ex.: VectorStoreIndex)
Retriever
- O que faz:
- Busca os nós relevantes para uma consulta
Query Engine
- O que faz:
- Combina recuperação + chamada ao LLM para responder
Workflow
- O que faz:
- Orquestração de agentes de múltiplas etapas por eventos
Em que o LlamaIndex se diferencia do LangChain e dos construtores visuais?
O LlamaIndex é antes de tudo um framework de dados, o LangChain é um framework de orquestração de propósito geral, e ferramentas como Flowise, Langflow e Dify são construtores visuais sem código — os três resolvem problemas diferentes, mesmo quando se sobrepõem em RAG. Escolher entre eles depende do que você está priorizando, não de qual é "melhor".
O LlamaIndex é gratuito, ou é preciso pagar pelo LlamaCloud?
O framework principal do LlamaIndex é gratuito para sempre sob a licença MIT — você pode hospedá-lo por conta própria com seu próprio LLM e banco de dados vetorial, sem custo para o LlamaIndex. O LlamaCloud, uma plataforma hospedada separada para análise e extração automatizada de documentos (LlamaParse, LlamaExtract), cobra créditos por uso além disso: US$ 1,25 por 1.000 créditos, com a análise custando de 1 a 45 créditos por página e a extração de 5 a 60 créditos por página, dependendo do nível escolhido.
- Framework de código aberto (pip install llama-index): gratuito, com licença MIT, hospedado por conta própria — sem necessidade de conta ou créditos
- LlamaCloud / LlamaParse: análise de documentos paga, cobrada por créditos, para PDFs com layout complexo, documentos escaneados, tabelas e gráficos
- Você não precisa de uma conta do LlamaCloud para construir ou executar um pipeline RAG com o framework de código aberto — o SimpleDirectoryReader e outros carregadores gratuitos cobrem texto simples, Markdown e PDFs padrão
- O LlamaCloud se torna relevante quando os documentos são complexos o suficiente (layouts de múltiplas colunas, tabelas incorporadas, texto manuscrito) para que um analisador gratuito produza fragmentos de baixa qualidade
Como construir um pipeline RAG mínimo com o LlamaIndex?
Um pipeline RAG funcional com o LlamaIndex são cinco linhas de Python: carregar documentos, construir um índice, criar um mecanismo de consulta e consultá-lo. Este exemplo usa o banco vetorial em memória padrão e um LLM compatível com a OpenAI; para um provedor local (Ollama, por exemplo), instale o pacote de integração dele e defina Settings.llm antes de construir o índice.
- 1Instale o framework: pip install llama-index (adicione um pacote de provedor como llama-index-llms-ollama para usar um modelo local em vez de uma API hospedada).
- 2Defina as credenciais do seu provedor de LLM — por exemplo export OPENAI_API_KEY=... — ou configure Settings.llm para um provedor local antes da próxima etapa.
- 3Coloque seus arquivos de origem em uma pasta (por exemplo, data/) e carregue-os: documents = SimpleDirectoryReader("data").load_data().
- 4Construa um índice a partir dos documentos carregados: index = VectorStoreIndex.from_documents(documents). Isso divide cada documento em Nodes e os incorpora.
- 5Crie um mecanismo de consulta a partir do índice: query_engine = index.as_query_engine().
- 6Consulte seus dados e imprima a resposta: response = query_engine.query("Sua pergunta aqui"); print(response).
from llama_index.core import VectorStoreIndex, SimpleDirectoryReader
# Load documents from a folder
documents = SimpleDirectoryReader("data").load_data()
# Build an index from documents
index = VectorStoreIndex.from_documents(documents)
# Create a query engine
query_engine = index.as_query_engine()
# Query your data
response = query_engine.query("Your question here")
print(response)Esse índice é reconstruído toda vez que o script é executado?
Sim, por padrão. Para qualquer uso além de um script pontual, chame index.storage_context.persist() depois de construir o índice, e recarregue-o com load_index_from_storage() nas execuções seguintes, em vez de reincorporar todos os documentos a cada vez.
Posso usar um LLM e um banco vetorial locais em vez da OpenAI?
Sim. Instale o pacote de integração correspondente (por exemplo, llama-index-llms-ollama para um modelo local, ou um pacote de banco vetorial como llama-index-vector-stores-chroma), e então defina Settings.llm e Settings.embed_model, ou passe o banco vetorial para VectorStoreIndex.from_documents(), antes de executar o mesmo código do mecanismo de consulta.
A versão TypeScript do LlamaIndex ainda é mantida?
Não. O LlamaIndex.TS (run-llama/LlamaIndexTS no GitHub) foi arquivado por seus mantenedores e marcado como descontinuado em 30 de abril de 2026. O próprio aviso do repositório declara que o projeto "is deprecated and no longer maintained" e direciona os usuários para a documentação do LlamaCloud/LlamaParse em vez do SDK TypeScript.
- O framework Python (llama_index) é a implementação ativamente mantida — este artigo cobre essa versão
- Projetos TypeScript existentes baseados no LlamaIndex.TS continuarão funcionando, mas não receberão mais atualizações, correções de bugs ou patches de segurança
- Para um novo projeto em TypeScript ou JavaScript, avalie o LangChain.js (ativamente mantido, com licença MIT) em vez de começar sobre uma biblioteca arquivada
Para quem o LlamaIndex é indicado?
O LlamaIndex ocupa uma posição específica no cenário de ferramentas RAG: desenvolvedores que querem controle no nível do código sobre indexação e recuperação, não o caminho mais rápido para um protótipo visual.
LlamaIndex vs. alternativas
A escolha certa depende de você querer controle no nível do código (LlamaIndex, LangChain, Haystack) ou uma tela visual (Flowise e ferramentas semelhantes).
| Ferramenta | Interface | Licença | Ideal para | Manutenção |
|---|---|---|---|---|
| LlamaIndex | Código Python | MIT | Pipelines RAG sob medida e intensivos em dados | Ativa |
| LangChain | Código Python / JS | MIT | Orquestração de LLM de propósito geral | Ativa |
| Haystack | Código Python | Apache 2.0 | Busca empresarial + pipelines RAG | Ativa |
| Flowise | Visual, arrastar e soltar | Apache 2.0 | Prototipagem sem código (sem manutenção) | Arquivado / nenhuma |
Erros comuns ao avaliar o LlamaIndex
Esses erros vêm de tratar o LlamaIndex como uma categoria de ferramenta diferente do que ele realmente é.
Perguntas frequentes
O LlamaIndex é gratuito?
Sim. O framework Python principal é de código aberto e gratuito sob a licença MIT. O LlamaCloud, uma plataforma hospedada separada para análise e extração de documentos, cobra créditos por uso (US$ 1,25 por 1.000 créditos), mas é opcional e não é necessário para construir ou executar um pipeline RAG.
Sob qual licença o LlamaIndex é distribuído?
Licença MIT, tanto para o framework Python (llama_index) quanto, enquanto foi mantido, para o SDK TypeScript (LlamaIndex.TS). A MIT permite uso comercial, modificação e redistribuição.
Em que o LlamaIndex se diferencia do LangChain?
O LlamaIndex é um framework de dados construído especificamente em torno de indexação e recuperação — Documents, Nodes, Índices, Retrievers e Query Engines. O LangChain é um framework de orquestração de propósito geral que cobre chains, agentes e chamadas de ferramentas, onde a recuperação é apenas uma capacidade entre várias. Ambos têm licença MIT, são Python-first e mantidos ativamente; muitos sistemas em produção usam os dois juntos.
O LlamaIndex é um construtor visual sem código?
Não. O LlamaIndex é uma biblioteca Python (e antes também TypeScript) que você importa e sobre a qual escreve código — não há tela de arrastar e soltar. Para uma abordagem visual e sem código para RAG ou pipelines de agentes, avalie Flowise, Langflow ou Dify.
O que é o LlamaCloud, e eu preciso dele?
O LlamaCloud é uma plataforma separada, paga por uso, da mesma empresa, que oferece LlamaParse (análise de documentos) e LlamaExtract (extração estruturada) para documentos complexos. Você não precisa dele para usar o framework de código aberto LlamaIndex — ele só se torna útil quando carregadores de documentos gratuitos produzem resultados ruins em PDFs complexos, páginas escaneadas ou tabelas densas.
A versão TypeScript do LlamaIndex ainda é mantida?
Não. O LlamaIndex.TS foi arquivado por seus mantenedores e marcado como descontinuado em 30 de abril de 2026. O framework Python continua sendo a implementação ativamente mantida. Para um novo projeto TypeScript/JavaScript, avalie o LangChain.js.
O que é um Query Engine no LlamaIndex?
Um Query Engine combina um Retriever com uma chamada ao LLM em uma única chamada de método. Chamar index.as_query_engine().query("sua pergunta") busca os nós relevantes no índice, monta um prompt que os contém, e retorna a resposta do modelo — o núcleo do ciclo de geração aumentada por recuperação (RAG).
Quantas integrações o LlamaIndex suporta?
O LlamaHub hospeda mais de 300 pacotes de integração da comunidade e próprios, cobrindo carregadores de dados (PDFs, APIs, bancos SQL e mais), provedores de LLM e bancos vetoriais, além do SimpleDirectoryReader embutido para arquivos locais.
Posso usar um LLM local com o LlamaIndex em vez de uma API na nuvem?
Sim. Instale a integração de provedor correspondente (por exemplo, llama-index-llms-ollama para o Ollama), e defina-a como padrão via Settings.llm antes de construir seu índice — o restante do pipeline Document/Index/Retriever/Query Engine funciona da mesma forma, independentemente do provedor de LLM usado.
Preciso escrever Python para usar o LlamaIndex?
Sim, para a versão atualmente mantida. O LlamaIndex é um framework code-first sem interface visual. Não desenvolvedores ou equipes que queiram uma abordagem sem código devem avaliar um construtor visual como Flowise, Langflow ou Dify.
