NeveAI/Neve-Echo-S3-4B-QAT-GGUF overview
<div align="center" <img src="https://cdn uploads.huggingface.co/production/uploads/68a3ba234a7dfca33d72eee2/uEgq1cKh6eWYsyWKbcqch.png" width="50%" </div <h1 a…
Runs locally from ~944.5 MB disk (4 GB VRAM class GPUs with llama.cpp / guIDE).
Repository Files & Downloads
Model Details
| Model ID | NeveAI/Neve-Echo-S3-4B-QAT-GGUF |
|---|---|
| Author | NeveAI |
| Pipeline | image-text-to-text |
| License | apache-2.0 |
| Base model | google/gemma-4-E4B-it-qat-q4_0-unquantized |
| Last modified | 2026-07-18T05:41:27.000Z |
Model README
---
library_name: transformers
license: apache-2.0
license_link: https://ai.google.dev/gemma/docs/gemma_4_license
pipeline_tag: image-text-to-text
base_model: google/gemma-4-E4B-it-qat-q4_0-unquantized
tags:
- NeveAI
- Neve
- EchoS
---
<div align="center">
<img src="https://cdn-uploads.huggingface.co/production/uploads/68a3ba234a7dfca33d72eee2/uEgq1cKh6eWYsyWKbcqch.png" width="50%">
</div>
<h1 align="center">Neve-Echo-S3-4B-QAT-GGUF</h1>
<div align="center">
<a href="https://github.com/NeveIA">
<img src="https://cdn-uploads.huggingface.co/production/uploads/68a3ba234a7dfca33d72eee2/KQa7-ajynUAhTS-kxNtYT.png" width="20%" alt="NeveAI GitHub">
</a>
</div>
---
> [!Note]
> Esse model card é para as novas versões da família Neve Echo otimizadas com Treinamento Consciente de Quantização (QAT), que permite preservar uma qualidade semelhante à bfloat16 enquanto reduz drasticamente os requisitos de memória para carregar o modelo.
> Quatro versões dos checkpoints QAT estão disponíveis:
> * Checkpoints QAT não quantizados (Q4_0): Pesos de meia precisão extraídos do pipeline QAT, ideais para compilação downstream personalizada e pesquisa.
> * GGUF (Q4_0): Formatos prontos para implantação, com ampla compatibilidade no ecossistema.
> * Otimizado para dispositivos móveis (wNa8o8): Um esquema personalizado projetado explicitamente para eficiência em hardware móvel. Ele apresenta camadas de decodificação direcionadas de 2 bits, caches KV otimizados e ativações estáticas para maximizar a economia de VRAM.
> * Tensores Comprimidos (w4a16): Checkpoints QAT serializados no formato compressed-tensors para inferência nativa e otimizada com vLLM.
---
Introdução
O Neve Echo S é um modelo de linguagem de última geração focado em uso geral e raciocínio para tarefas imediatas. Esta versão em formato GGUF foi otimizada pela NeveAI para oferecer o equilíbrio ideal entre precisão lógica e eficiência computacional.
---
Destaques do Modelo
Este modelo foi desenvolvido para uso geral e execução de tarefas diversas, focando em:
- Raciocínio Avançado (Thinking): Projetado como um modelo altamente capaz de raciocínio, com suporte a modos de pensamento estruturado para tarefas complexas.
- Uso Geral e Produtividade: Otimizado para uma ampla variedade de tarefas como geração de texto, assistência, explicações, planejamento e automação.
- Multimodalidade (Texto + Imagem): Capaz de processar entradas multimodais com suporte a diferentes resoluções e proporções.
- Tool Calling e System Prompt: Suporte nativo a chamadas de função e ao papel
system, permitindo maior controle e integração com ferramentas externas.
Benchmark de Performance
O Neve Echo S demonstra desempenho alinhado a modelos de ponta em múltiplas categorias:
| Categoria | Benchmark | Gemma 4 31B | Gemma 4 26B A4B | Neve Echo S |
| :--- | :--- | :---: | :---: | :---: |
| Knowledge | MMLU Pro | 85.2% | 82.6% | 69.4% |
| Reasoning | GPQA Diamond | 84.3% | 82.3% | 58.6% |
| Math | AIME 2026 | 89.2% | 88.3% | 42.5% |
| General | BigBench Extra Hard | 74.4% | 64.8% | 33.1% |
---
Detalhes da Arquitetura
- Arquitetura: Mixture of Experts (MoE) com atenção híbrida (local + global intercalado).
- Parâmetros: ~5B totais (com subset ativo por token para eficiência).
- Janela de Contexto: Até 256K tokens.
- Camadas: Arquitetura profunda com atenção global na camada final.
- MoE: Roteamento dinâmico de experts (subset ativo por inferência), otimizando performance e uso de memória.
Como utilizar (GGUF)
Este modelo é compatível com llama.cpp, Ollama, LM Studio e outras ferramentas que suportam o formato GGUF.
Foco direcionado ao uso do modelo na plataforma autoral da organização NeveAI
Licença
Este repositório e os pesos do modelo estão licenciados sob a Licença Apache 2.0.
Contato
Se tiver qualquer dúvida, por favor, levante um issue ou entre em contato conosco em NeveIA.
Run NeveAI/Neve-Echo-S3-4B-QAT-GGUF with guIDE
Download guIDE — the AI-native code editor with local LLM inference and 69 built-in tools.
Source: Hugging Face · Compare models