rendeia/Arandu-Nano-1.1-GGUF overview
Arandu Mirim 1.1 GGUF, Q4 K M + imatrix pt BR Primeiro modelo da família Arandu G1 — Eficiência da plataforma Rendeia https://github.com/rendeia/Arandu — uma I…
Runs locally from ~1.03 GB disk (4 GB VRAM class GPUs with llama.cpp / guIDE).
Repository Files & Downloads
| File | Type | Quantization | Size | Link |
|---|---|---|---|---|
| Qwen_Qwen3-1.7B-Q4_K_M.gguf | GGUF | Q4_K_M | 1.03 GB | Download |
Model Details
| Model ID | rendeia/Arandu-Nano-1.1-GGUF |
|---|---|
| Author | rendeia |
| Pipeline | text-generation |
| License | apache-2.0 |
| Base model | Qwen/Qwen3-1.7B |
| Last modified | 2026-07-06T20:48:28.000Z |
Model README
---
license: apache-2.0
language:
- pt
- en
- es
- fr
- de
base_model:
- Qwen/Qwen3-1.7B
pipeline_tag: text-generation
tags:
- gguf
- llama.cpp
- llamafile
- portuguese
- pt-br
- multilingual
- offline
- cpu
- imatrix
- quantized
- rendeia
- arandu
library_name: llama.cpp
---
Arandu Mirim 1.1 (GGUF, Q4_K_M + imatrix pt-BR)
Primeiro modelo da família Arandu (G1 — Eficiência) da plataforma
Rendeia — uma IA que roda
100% local e offline, na CPU, portátil em pendrive. Otimizado para
português do Brasil, com suporte nativo a outros idiomas (en/es/fr/de)
herdado da base Qwen3.
> Rendeia une renda (tradição artesã brasileira de tecer) e ideia.
> A marca abriga famílias de modelos com nomes em tupi-guarani —
> Arandu (sabedoria), Katu (bom/justo), Vera (verdadeiro),
> Taba (aldeia) — e tiers consistentes por tamanho: Mirim (pequeno),
> Eté (médio), Guaçu (grande).
✨ Novidades da plataforma v1.3 (junho/2026)
Os pesos deste modelo são os mesmos da versão anterior; o que evoluiu foi
a plataforma em volta e a nomenclatura:
- 🕸️ Nova marca: Rendeia (era "Arandu IA"). Repo migrado para
- 🏷️ Nova nomenclatura: este modelo agora é Arandu Mirim 1.1
(era "Arandu Nano 1.1"). Tiers em tupi-guarani consistentes entre famílias
(Mirim / Eté / Guaçu).
- 🧠 Família Katu (G2 — Raciocínio) disponível em repo próprio
rendeia/Katu — modelos que **pensam
antes de responder** (DeepSeek R1 Distill). Roda no navegador via
WebGPU (paradigma browser-native, sem servidor).
- ⚡ Prompt caching (
--cache-reuse 256 --slot-save-path cache/) — o
time-to-first-token cai 1–3s a partir da 2ª pergunta, sobrevive ao
--sleep-idle-seconds.
- 🚀 Variante Q4_0 com repack AVX-512/AVX2 — em CPUs modernos (Intel
11ª gen+, Zen4+), 15–25% mais tok/s que Q4_K_M. Trade-off: qualidade
~3-5% pior.
- 🧠 Memória em camadas no USB — perfil + índice de itens + detalhes
sob demanda. Cabe nos 2048 tokens sem depender do RAG por embedding.
- 📎 Upload de documentos — PDF (pdf.js offline), imagens/PDF escaneado
via OCR (Tesseract portátil), .txt/.md/.csv/.json/.log.
- 🌐 Multilíngue — seletor
auto/pt/en/es/fr/de; o Qwen3 já é multilíngue. - 🏢 Windows corporativo — fallback automático para
llama-server.exe
quando o AppLocker bloqueia o llamafile.exe.
O que é
Este é o Qwen3-1.7B quantizado em Q4_K_M, porém **re-quantizado com
uma matriz de importância (imatrix) calibrada em português do Brasil**. A
imatrix preserva com mais precisão os pesos mais ativados ao processar texto
em pt-BR, melhorando um pouco a qualidade **sem custo adicional de RAM ou
velocidade**.
Não é um fine-tune: é o Qwen3-1.7B com uma receita de quantização orientada
ao português. O ganho vem da calibração + da camada de produto da Rendeia
(prompt de identidade, memória em camadas, RAG opcional estrito
anti-alucinação).
Especificações
| | |
|---|---|
| Base | Qwen/Qwen3-1.7B |
| Quantização | Q4_K_M com imatrix pt-BR |
| Tamanho | ~1,05 GB |
| RAM em uso | ~1,2 GB (contexto 2048, KV q8_0) |
| Velocidade | ~14 tok/s em CPU modesta (i5 11ª gen) |
| Modo | non-thinking (/no_think) por padrão, para CPU |
| Idiomas | pt-BR (otimizado) · en/es/fr/de (suportados pela base) |
| Família | Arandu (G1 — Eficiência) |
| Tier | Mirim (pequeno / rápido) |
| Plataforma | Rendeia |
Como usar
Com llamafile (recomendado)
ou llama.cpp:
# llamafile — flags recomendadas (v1.3+)
llamafile.exe -m Qwen_Qwen3-1.7B-Q4_K_M.gguf --server \
-c 2048 -t 3 -fa on -ctk q8_0 -ctv q8_0 \
--sleep-idle-seconds 180 \
--cache-reuse 256 --slot-save-path cache
# llama.cpp
llama-server -m Qwen_Qwen3-1.7B-Q4_K_M.gguf -c 2048 -fa on \
--cache-reuse 256 --slot-save-path cache
Para a experiência completa (interface pt-BR, memória no USB, **upload
com OCR, multilíngue**, RAG offline, voz, lançadores clica-e-roda), use
o pacote da Rendeia:
👉 <https://github.com/rendeia/Arandu/releases>
📖 Manual completo (pt-BR + EN):
instalação, configuração, todas as funções (memória, upload, RAG, voz,
multilíngue, modo pensador, OCR) e solução de problemas.
Como foi gerado (reprodutível)
A imatrix foi calculada com llama-imatrix sobre um corpus de calibração
em português (IA, fatos do Brasil, ciência, história, linguagem cotidiana)
e aplicada com llama-quantize --imatrix. Passo a passo e o corpus estão
no repositório.
Outras famílias da Rendeia
- Katu (G2 — Raciocínio) — modelos
que pensam antes de responder, rodando no navegador via WebGPU (não
usa GGUF; usa MLC pré-compilado).
- Vera (G3 — Multimodal) — planejado.
- Taba (G4 — Agentes) — planejado.
Limitações
- Modelo pequeno (1,7B): pode errar fatos e raciocínios complexos.
- Conhecimento factual é reforçado pela camada de memória/RAG no
produto, não no peso do modelo.
- Otimizado para pt-BR e uso geral (conversa/redação/resumo) — não para
tarefas especializadas (código avançado, matemática pesada). Para
raciocínio, use a família Katu.
- Multilíngue: qualidade é forte nos idiomas principais (pt, en, es, fr,
de) e decai em idiomas de poucos recursos.
Licença e créditos
- Licença: Apache-2.0
- Modelo base: Qwen3-1.7B (Alibaba Cloud), Apache-2.0
- Motor: llamafile / llama.cpp (Mozilla / ggml-org), Apache-2.0
- Plataforma Rendeia: <https://github.com/rendeia/Arandu>
Run rendeia/Arandu-Nano-1.1-GGUF with guIDE
Download guIDE — the AI-native code editor with local LLM inference and 69 built-in tools.
Source: Hugging Face · Compare models