GraySoft
Projects Models Compare Cloud benchmarks FAQ Download guIDE →
Model Intelligence Sheet

KikoCis/salamandra-7b-instruct-2606-GGUF overview

<div align="center" ╔══════════════════════════════════════════════════════════════╗ ║ S A L A M A N D R A · 7 B · I N S T R U C T · 2 6 0 6 ║ ║ ──────────────…

ggufllama.cppquantizedimatrixspanishsalamandrabsctext-generationescagleuenbase_model:BSC-LT/salamandra-7b-instruct-2606base_model:quantized:BSC-LT/salamandra-7b-instruct-2606license:apache-2.0endpoints_compatibleregion:usconversational

Runs locally from ~3.77 GB disk (4 GB VRAM class GPUs with llama.cpp / guIDE).

Downloads
0
Likes
0
Pipeline
text-generation
Author

Repository Files & Downloads

6 GGUF files detected
Direct downloads for local inference
FileTypeQuantizationSizeLink
salamandra-7b-IQ4_XS.ggufGGUFIQ4_XS4.15 GBDownload
salamandra-7b-Q3_K_M.ggufGGUFQ3_K_M3.77 GBDownload
salamandra-7b-Q4_K_M.ggufGGUFQ4_K_M4.52 GBDownload
salamandra-7b-Q5_K_M.ggufGGUFQ5_K_M5.21 GBDownload
salamandra-7b-Q6_K.ggufGGUFQ6_K5.94 GBDownload
salamandra-7b-Q8_0.ggufGGUFQ8_07.69 GBDownload

Model Details

Model IDKikoCis/salamandra-7b-instruct-2606-GGUF
AuthorKikoCis
Pipelinetext-generation
Licenseapache-2.0
Base modelBSC-LT/salamandra-7b-instruct-2606
Last modified2026-07-10T05:41:07.000Z

Model README

---

license: apache-2.0

base_model: BSC-LT/salamandra-7b-instruct-2606

base_model_relation: quantized

language:

- es

- ca

- gl

- eu

- en

pipeline_tag: text-generation

tags:

- gguf

- llama.cpp

- quantized

- imatrix

- spanish

- salamandra

- bsc

library_name: gguf

---

<div align="center">

╔══════════════════════════════════════════════════════════════╗
║   S A L A M A N D R A · 7 B · I N S T R U C T · 2 6 0 6       ║
║   ───────────────────────────────────────────────────────    ║
║   GGUF quant ladder · imatrix (calibrado en español)          ║
║   Q3 ▸ IQ4 ▸ Q4 ▸ Q5 ▸ Q6 ▸ Q8   ·   fidelidad medida (KLD)   ║
╚══════════════════════════════════════════════════════════════╝

Salamandra-7B-Instruct-2606 · GGUF

Cuantizaciones GGUF con imatrix del modelo soberano español/europeo de BSC-LT.

Escalera completa Q3→Q8 · matriz de importancia calibrada en español · fidelidad objetiva medida contra el BF16 (KLD + PPL + Top-1).

</div>

> Qué es esto: BSC-LT/salamandra-7b-instruct-2606

> el modelo multilingüe (ES · CA · GL · EU · EN…) del Barcelona Supercomputing Center— empaquetado en GGUF para

> correr en local con llama.cpp / Ollama. No es un modelo de código: su valor es lingüístico y de soberanía,

> así que aquí lo importante es que la cuantización no rompa el modelo — y eso se demuestra con la tabla de fidelidad de abajo, no con un benchmark de programación.

✅ Qué archivo elegir

| Si quieres… | Usa | Por qué |

|---|---|---|

| Lo mejor equilibrado | Q4_K_M (4.5 GB) | el estándar seguro — cabe en 8 GB, buena fidelidad |

| Máxima calidad práctica | Q6_K (6.0 GB) | KLD 0.004, casi indistinguible del original |

| Fidelidad de archivo | Q8_0 (7.7 GB) | prácticamente sin pérdida (Top-1 98.9%) |

| Lo más pequeño usable | Q3_K_M (3.8 GB) | para RAM muy justa; algo de deriva |

| Compacto con imatrix | IQ4_XS (4.2 GB) | más pequeño que Q4_K_M, fidelidad parecida |

📦 Archivos

| Quant | Bits (aprox) | Tamaño |

|---|---|---|

| salamandra-7b-Q3_K_M.gguf | ~3.9 | 3.8 GB |

| salamandra-7b-IQ4_XS.gguf | ~4.25 | 4.2 GB |

| salamandra-7b-Q4_K_M.gguf | ~4.8 | 4.5 GB |

| salamandra-7b-Q5_K_M.gguf | ~5.6 | 5.2 GB |

| salamandra-7b-Q6_K.gguf | ~6.5 | 6.0 GB |

| salamandra-7b-Q8_0.gguf | ~8.5 | 7.7 GB |

📊 Fidelidad medida (vs BF16 · corpus español)

KLD (divergencia Kullback–Leibler) mide cuánto se aleja la distribución de salida de cada cuantización respecto al modelo original en BF16 — es el patrón oro de fidelidad de cuantización, más fino que la perplejidad sola. Top-1 = con qué frecuencia el token más probable coincide con el del BF16.

| Quant | Tamaño | PPL (es) | PPL Δ vs BF16 | KLD media | Top-1 vs BF16 |

|---|---|---|---|---|---|

| BF16 (ref) | 14.8 GB | 7.437 | — | 0 | 100% |

| Q8_0 | 7.7 GB | 7.437 | +0.0002 | 0.00043 | 98.9% |

| Q6_K | 6.0 GB | 7.460 | +0.023 | 0.00376 | 96.8% |

| Q5_K_M | 5.2 GB | 7.485 | +0.048 | 0.00865 | 95.3% |

| Q4_K_M | 4.5 GB | 7.611 | +0.174 | 0.02808 | 91.9% |

| IQ4_XS | 4.2 GB | 7.705 | +0.268 | 0.03421 | 91.3% |

| Q3_K_M | 3.8 GB | 8.117 | +0.680 | 0.08682 | 86.1% |

📈 Gráficas

!fidelidad vs tamaño

!PPL delta

!Top-1 match

🧮 ¿Me cabe? (RAM aproximada, contexto 8K)

| Quant | RAM mínima |

|---|---|

| Q3_K_M / IQ4_XS | ~6 GB |

| Q4_K_M / Q5_K_M | ~7–8 GB |

| Q6_K / Q8_0 | ~8–10 GB |

🚀 Cómo ejecutarlo

Ollama (usa la plantilla ChatML que ya trae el GGUF):

ollama create salamandra7b -f Modelfile.8192
ollama run salamandra7b "Explica la fotosíntesis en una frase."

llama.cpp:

llama-cli -m salamandra-7b-Q4_K_M.gguf -ngl 99 -c 8192 \
  -p "<|im_start|>user\n¿Cuál es la capital de Galicia?<|im_end|>\n<|im_start|>assistant\n"

Muestreo recomendado: temp 0.7 · top_p 0.95 · top_k 40. Contexto nativo 8192.

⚠️ Bueno saber

  • Es un modelo lingüístico, no de código. Brilla en español y lenguas cooficiales (catalán, gallego, euskera) y multilingüe; no esperes rendimiento de un modelo especializado en programación.
  • Gate de calidad = fidelidad, no SWE. Para una cuantización de un modelo así, lo que importa es que se parezca al original (KLD arriba), no un test de coding que sería ~0 por diseño del modelo base.
  • imatrix en español: la matriz de importancia se calibró con prosa española, no inglesa — evita la deriva que introduce calibrar en el idioma equivocado.

🔁 Procedencia y reproducibilidad

  • Base: BSC-LT/salamandra-7b-instruct-2606 · arquitectura Llama · licencia Apache-2.0.
  • imatrix: corpus en español, -c 512, sobre el BF16.
  • Ladder: llama-quantize --imatrix para cada tier. Magic verificado en cada .gguf.
  • Fidelidad: llama-perplexity --kl-divergence contra base BF16 (kld.dat) + PPL en español.
  • Comandos exactos en scripts/reproduce.sh; métricas en metrics/quant-summary-with-kld.{json,csv}; checksums en reports/artifact-sha256sums.txt.

Evaluation methodology

  • Métrica: KLD (mean/max) + Top-1 match + PPL, cada cuantización vs la referencia BF16, sobre un corpus español. Sin gate SWE — no aplica a un modelo lingüístico no-coder (sería 0 por diseño, no por la cuantización).
  • Herramientas: llama.cpp (llama-imatrix, llama-quantize, llama-perplexity --kl-divergence).
  • Fecha: 2026-07. Caveat: PPL/KLD sobre un corpus acotado; comparativa relativa entre tiers, no un ranking absoluto.

🗒️ Changelog

  • 2026-07 — release inicial: escalera Q3→Q8 + IQ4_XS, imatrix español, tabla KLD/PPL/Top-1 + gráficas.

---

Cuantizado por KikoCis. Modelo base © Barcelona Supercomputing Center (BSC-LT), Apache-2.0. Todo el mérito del modelo es de BSC-LT; aquí solo se empaqueta y se mide la fidelidad de las cuantizaciones.

Run KikoCis/salamandra-7b-instruct-2606-GGUF with guIDE

Download guIDE — the AI-native code editor with local LLM inference and 69 built-in tools.

Download guIDE → · Browse 524k+ models · Compare models

Source: Hugging Face · Compare models