Ollama
Ollama Inc. · Rodar IA no seu computador
Baixa e roda modelos de linguagem abertos no computador, por app, terminal ou API local
- 182,4 mil no GitHub
Motor em C/C++ para rodar LLMs localmente, com CLI e servidor compatível com a OpenAI
por ggml-org (ggml.ai / Hugging Face)
Última versão: v0.6.0, de 5 de outubro de 2026
O llama.cpp é um motor de inferência em C/C++ para rodar modelos de linguagem no formato GGUF, mantido pela comunidade ggml-org com apoio da ggml.ai, empresa comprada pela Hugging Face em 2026. É a base de vários apps de IA local.
O comando llama cli conversa com modelos baixados do Hugging Face, e o llama serve sobe uma API compatível com a OpenAI e uma interface web. O site llama.app instala a CLI e oferece o app Llama para macOS e Windows 11.
Overview
llama.cpp v0.6.0 introduces the new llama_batch_ext extended batch API (with llama_process) for mixed token/embedding inputs and MTP/deepstack state embeddings, adds support for the GLM-5.3-Flash (GLM5-Next) 320B hybrid model, the Clef decision model (text and vision) and MTP speculative decoding for Qwen4Exp, ships a new /v1/systemone server API for decision models (laya, julia-1, lev, openjev, kev, nimble), overhauls the Web UI with a Hugging Face Hub data layer and model download pipeline, adds a Metal tensor-API flash attention kernel for F16 KV, sparse flash attention for quantized K/V on Vulkan, and updates ggml to v0.26.0.
Highlights
llama_batch_ext extended batch API with llama_process(), supporting mixed token/embedding batches and per-token "state" embeddings for MTP and deepstack models #24669/v1/systemone API supporting five decision models - laya, julia-1, lev, openjev (+vision), kev #29818llama_prefetch_rows() using MADVISE-based prefetching of PLE tensors in Qwen4Exp and Gemma4 #29599API changes
include/llama.h: new llama_batch_ext batch API with llama_embd, llama_process() and llama_process_type #24669, new llama_get_causal_attn() #28876, session formats bumped to LLAMA_SESSION_VERSION 11 and LLAMA_STATE_SEQ_VERSION 4include/llama-cpp.h: added llama_batch_ext_ptr and deleter for the new extended batch API #24669tools/mtmd/mtmd.h: mtmd_get_memory_usage() now returns an mtmd_memory_usage struct with image_max_tokens and use_non_causal #29773tools/server: new /v1/systemone endpoint for decision models #29818 and /v1/embeddings now accepts typed vision/audio/video content #29556New models
Lfm2BidirectionalForMaskedLM for LFM2.5-Encoder-230M/350M #29862classifier_pooling support for rerankers #29627Core changes
Ainda sem avaliações
Usou o llama.cpp? Conte para quem está escolhendo.
Ollama Inc. · Rodar IA no seu computador
Baixa e roda modelos de linguagem abertos no computador, por app, terminal ou API local
Ettore Di Giacinto e equipe LocalAI · Rodar IA no seu computador
Servidor de IA local com API compatível com a OpenAI para texto, voz, imagem e vídeo
Element Labs, Inc. · Rodar IA no seu computador
App de desktop para baixar e rodar modelos de linguagem no PC, com chat e API local
Ficha escrita pela redação do Flipters a partir das fontes acima, revisada em 6 de outubro de 2026. Preços e versões mudam: confira no site oficial antes de comprar. Como trabalhamos.