GraySoft
Projects Models Compare Cloud benchmarks FAQ Download guIDE →
Model Intelligence Sheet

rendeia/Arandu-Nano-1.1-GGUF overview

Arandu Mirim 1.1 GGUF, Q4 K M + imatrix pt BR Primeiro modelo da família Arandu G1 — Eficiência da plataforma Rendeia https://github.com/rendeia/Arandu — uma I…

llama.cppggufllamafileportuguesept-brmultilingualofflinecpuimatrixquantizedrendeiaarandutext-generationptenesfrdebase_model:Qwen/Qwen3-1.7Bbase_model:quantized:Qwen/Qwen3-1.7Blicense:apache-2.0endpoints_compatibleregion:usconversational

Runs locally from ~1.03 GB disk (4 GB VRAM class GPUs with llama.cpp / guIDE).

Downloads
267
Likes
1
Pipeline
text-generation
Author

Repository Files & Downloads

1 GGUF files detected
Direct downloads for local inference
FileTypeQuantizationSizeLink
Qwen_Qwen3-1.7B-Q4_K_M.ggufGGUFQ4_K_M1.03 GBDownload

Model Details

Model IDrendeia/Arandu-Nano-1.1-GGUF
Authorrendeia
Pipelinetext-generation
Licenseapache-2.0
Base modelQwen/Qwen3-1.7B
Last modified2026-07-06T20:48:28.000Z

Model README

---

license: apache-2.0

language:

  • pt
  • en
  • es
  • fr
  • de

base_model:

  • Qwen/Qwen3-1.7B

pipeline_tag: text-generation

tags:

  • gguf
  • llama.cpp
  • llamafile
  • portuguese
  • pt-br
  • multilingual
  • offline
  • cpu
  • imatrix
  • quantized
  • rendeia
  • arandu

library_name: llama.cpp

---

Arandu Mirim 1.1 (GGUF, Q4_K_M + imatrix pt-BR)

Primeiro modelo da família Arandu (G1 — Eficiência) da plataforma

Rendeia — uma IA que roda

100% local e offline, na CPU, portátil em pendrive. Otimizado para

português do Brasil, com suporte nativo a outros idiomas (en/es/fr/de)

herdado da base Qwen3.

> Rendeia une renda (tradição artesã brasileira de tecer) e ideia.

> A marca abriga famílias de modelos com nomes em tupi-guarani —

> Arandu (sabedoria), Katu (bom/justo), Vera (verdadeiro),

> Taba (aldeia) — e tiers consistentes por tamanho: Mirim (pequeno),

> Eté (médio), Guaçu (grande).

✨ Novidades da plataforma v1.3 (junho/2026)

Os pesos deste modelo são os mesmos da versão anterior; o que evoluiu foi

a plataforma em volta e a nomenclatura:

  • 🕸️ Nova marca: Rendeia (era "Arandu IA"). Repo migrado para

rendeia/Arandu.

  • 🏷️ Nova nomenclatura: este modelo agora é Arandu Mirim 1.1

(era "Arandu Nano 1.1"). Tiers em tupi-guarani consistentes entre famílias

(Mirim / Eté / Guaçu).

  • 🧠 Família Katu (G2 — Raciocínio) disponível em repo próprio

rendeia/Katu — modelos que **pensam

antes de responder** (DeepSeek R1 Distill). Roda no navegador via

WebGPU (paradigma browser-native, sem servidor).

  • Prompt caching (--cache-reuse 256 --slot-save-path cache/) — o

time-to-first-token cai 1–3s a partir da 2ª pergunta, sobrevive ao

--sleep-idle-seconds.

  • 🚀 Variante Q4_0 com repack AVX-512/AVX2 — em CPUs modernos (Intel

11ª gen+, Zen4+), 15–25% mais tok/s que Q4_K_M. Trade-off: qualidade

~3-5% pior.

  • 🧠 Memória em camadas no USB — perfil + índice de itens + detalhes

sob demanda. Cabe nos 2048 tokens sem depender do RAG por embedding.

  • 📎 Upload de documentos — PDF (pdf.js offline), imagens/PDF escaneado

via OCR (Tesseract portátil), .txt/.md/.csv/.json/.log.

  • 🌐 Multilíngue — seletor auto/pt/en/es/fr/de; o Qwen3 já é multilíngue.
  • 🏢 Windows corporativo — fallback automático para llama-server.exe

quando o AppLocker bloqueia o llamafile.exe.

O que é

Este é o Qwen3-1.7B quantizado em Q4_K_M, porém **re-quantizado com

uma matriz de importância (imatrix) calibrada em português do Brasil**. A

imatrix preserva com mais precisão os pesos mais ativados ao processar texto

em pt-BR, melhorando um pouco a qualidade **sem custo adicional de RAM ou

velocidade**.

Não é um fine-tune: é o Qwen3-1.7B com uma receita de quantização orientada

ao português. O ganho vem da calibração + da camada de produto da Rendeia

(prompt de identidade, memória em camadas, RAG opcional estrito

anti-alucinação).

Especificações

| | |

|---|---|

| Base | Qwen/Qwen3-1.7B |

| Quantização | Q4_K_M com imatrix pt-BR |

| Tamanho | ~1,05 GB |

| RAM em uso | ~1,2 GB (contexto 2048, KV q8_0) |

| Velocidade | ~14 tok/s em CPU modesta (i5 11ª gen) |

| Modo | non-thinking (/no_think) por padrão, para CPU |

| Idiomas | pt-BR (otimizado) · en/es/fr/de (suportados pela base) |

| Família | Arandu (G1 — Eficiência) |

| Tier | Mirim (pequeno / rápido) |

| Plataforma | Rendeia |

Como usar

Com llamafile (recomendado)

ou llama.cpp:

# llamafile — flags recomendadas (v1.3+)
llamafile.exe -m Qwen_Qwen3-1.7B-Q4_K_M.gguf --server \
  -c 2048 -t 3 -fa on -ctk q8_0 -ctv q8_0 \
  --sleep-idle-seconds 180 \
  --cache-reuse 256 --slot-save-path cache

# llama.cpp
llama-server -m Qwen_Qwen3-1.7B-Q4_K_M.gguf -c 2048 -fa on \
  --cache-reuse 256 --slot-save-path cache

Para a experiência completa (interface pt-BR, memória no USB, **upload

com OCR, multilíngue**, RAG offline, voz, lançadores clica-e-roda), use

o pacote da Rendeia:

👉 <https://github.com/rendeia/Arandu/releases>

📖 Manual completo (pt-BR + EN):

docs/MANUAL.md

instalação, configuração, todas as funções (memória, upload, RAG, voz,

multilíngue, modo pensador, OCR) e solução de problemas.

Como foi gerado (reprodutível)

A imatrix foi calculada com llama-imatrix sobre um corpus de calibração

em português (IA, fatos do Brasil, ciência, história, linguagem cotidiana)

e aplicada com llama-quantize --imatrix. Passo a passo e o corpus estão

em treino/imatrix/

no repositório.

Outras famílias da Rendeia

  • Katu (G2 — Raciocínio) — modelos

que pensam antes de responder, rodando no navegador via WebGPU (não

usa GGUF; usa MLC pré-compilado).

  • Vera (G3 — Multimodal) — planejado.
  • Taba (G4 — Agentes) — planejado.

Limitações

  • Modelo pequeno (1,7B): pode errar fatos e raciocínios complexos.
  • Conhecimento factual é reforçado pela camada de memória/RAG no

produto, não no peso do modelo.

  • Otimizado para pt-BR e uso geral (conversa/redação/resumo) — não para

tarefas especializadas (código avançado, matemática pesada). Para

raciocínio, use a família Katu.

  • Multilíngue: qualidade é forte nos idiomas principais (pt, en, es, fr,

de) e decai em idiomas de poucos recursos.

Licença e créditos

  • Licença: Apache-2.0
  • Modelo base: Qwen3-1.7B (Alibaba Cloud), Apache-2.0
  • Motor: llamafile / llama.cpp (Mozilla / ggml-org), Apache-2.0
  • Plataforma Rendeia: <https://github.com/rendeia/Arandu>

Run rendeia/Arandu-Nano-1.1-GGUF with guIDE

Download guIDE — the AI-native code editor with local LLM inference and 69 built-in tools.

Download guIDE → · Browse 524k+ models · Compare models

Source: Hugging Face · Compare models