GraySoft
Projects Models Compare Cloud benchmarks FAQ Download guIDE →
Model Intelligence Sheet

tepirale/Laguna-S-2.1-DFLASH-GGUF overview

Base models Model: https://huggingface.co/unsloth/Laguna S 2.1 GGUF Dflash model: https://huggingface.co/poolside/Laguna S 2.1 GGUF chat template: https://hugg…

transformersgguflaguna-xs-2.1llama.cpptext-generationconversationalbase_model:poolside/Laguna-XS-2.1base_model:quantized:poolside/Laguna-XS-2.1license:openmdw-1.1region:usimatrix

Runs locally from ~2.08 GB disk (4 GB VRAM class GPUs with llama.cpp / guIDE).

Downloads
0
Likes
1
Pipeline
text-generation
Author

Repository Files & Downloads

3 GGUF files detected
Direct downloads for local inference
FileTypeQuantizationSizeLink
Laguna-S-2.1-UD-IQ1_M.ggufGGUFIQ1_M33.19 GBDownload
Laguna-S-2.1-UD-IQ2_XXS.ggufGGUFIQ2_XXS34.64 GBDownload
laguna-s-2.1-DFlash-BF16.ggufGGUFBF162.08 GBDownload

Model Details

Model IDtepirale/Laguna-S-2.1-DFLASH-GGUF
Authortepirale
Pipelinetext-generation
Licenseopenmdw-1.1
Base modelpoolside/Laguna-XS-2.1
Last modified2026-07-24T09:24:04.000Z

Model README

---

library_name: transformers

inference: false

extra_gated_description: To learn more about how we process your personal data, please

read our <a href="https://poolside.ai/legal/privacy">Privacy Policy</a>.

tags:

  • laguna-xs-2.1
  • gguf
  • llama.cpp

license: openmdw-1.1

pipeline_tag: text-generation

base_model_relation: quantized

base_model:

  • poolside/Laguna-XS-2.1

---

Base models

Model:
https://huggingface.co/unsloth/Laguna-S-2.1-GGUF

Dflash model:
https://huggingface.co/poolside/Laguna-S-2.1-GGUF

chat_template:
https://huggingface.co/poolside/Laguna-S-2.1-GGUF/raw/main/chat_template.jinja

Files

File manager:
https://huggingface.co/tepirale/Laguna-S-2.1-DFLASH-GGUF/blob/main/laguna_manager.sh

Config models:
https://huggingface.co/tepirale/Laguna-S-2.1-DFLASH-GGUF/blob/main/models.json

Auto model | GPU L40 '38 GiB / 45 GiB' V-Ram


!chmod +x laguna_manager.sh

# install llama.cpp or vllm
./laguna_manager.sh install llamacpp


# download Laguna-S-2.1-GGUF
hf download unsloth/Laguna-S-2.1-GGUF \
  --include "Laguna-S-2.1-UD-IQ1_M.gguf" \
  --local-dir ~/.laguna_manager/models/laguna-s-2.1-GGUF


# download Laguna-S-2.1-DFlash-GGUF
hf download poolside/Laguna-S-2.1-GGUF \
  --include "*DFlash*.gguf" \
  --local-dir ~/.laguna_manager/models/laguna-s-2.1-DFlash


# config
./laguna_manager.sh config set '.model="laguna-s-2.1" | .backend="llamacpp" | .quant="UD-IQ1_M" | .server.llamacpp.ctx_size=32768 | .server.llamacpp.spec_decoding=true'

# return config
'''
Actualizado.
{
  "backend": "llamacpp",
  "model": "laguna-s-2.1",
  "quant": "UD-IQ1_M",
  "vllm_variant": "fp8",
  "server": {
    "port": 8000,
    "host": "0.0.0.0",
    "llamacpp": {
      "ctx_size": 32768,
      "n_gpu_layers": 999,
      "flash_attn": "on",
      "jinja": true,
      "fit": "on",
      "parallel": 1,
      "threads": -1,
      "cache_type_k": "f16",
      "cache_type_v": "f16",
      "spec_decoding": true,
      "spec_type": "draft-dflash",
      "spec_draft_n_max": 15,
      "extra_args": ""
    },
    "vllm": {
      "max_model_len": 32768,
      "gpu_memory_utilization": 0.92,
      "tensor_parallel_size": "auto",
      "enable_thinking": true,
      "enable_auto_tool_choice": true,
      "served_model_name": "laguna",
      "speculative_dflash": false,
      "num_speculative_tokens": 7,
      "extra_args": ""
    }
  }
}
'''


# run
./laguna_manager.sh start

# return start
'''
== Montando servidor ==
  Modelo  : laguna-s-2.1
  Backend : llamacpp
  GPUs    : 1 (cuda, 44 GB)
  Puerto  : 8000
Comando:
  /root/.laguna_manager/llama.cpp/build/bin/llama-server   -m   /root/.laguna_manager/models/laguna-s-2.1-GGUF/Laguna-S-2.1-UD-IQ1_M.gguf   --host   0.0.0.0   --port   8000   --ctx-size   32768   -ngl   999   -fa   on   --parallel   1   --jinja   --fit   on   --cache-type-k   f16   --cache-type-v   f16 

Servidor lanzado (PID 415). Logs: ./laguna_manager.sh logs -f
Esperando a que el servidor esté listo...
✔ Servidor listo en http://0.0.0.0:8000/v1  (OpenAI-compatible)
'''

# restart
./laguna_manager.sh restart

# return restart
'''
Deteniendo servidor (PID 866)...
Servidor detenido.
== Montando servidor ==
  Modelo  : laguna-s-2.1
  Backend : llamacpp
  GPUs    : 1 (cuda, 44 GB)
  Puerto  : 8000
Comando:
  /root/.laguna_manager/llama.cpp/build/bin/llama-server   -m   /root/.laguna_manager/models/laguna-s-2.1-GGUF/Laguna-S-2.1-UD-IQ1_M.gguf   --host   0.0.0.0   --port   8000   --ctx-size   32768   -ngl   999   -fa   on   --parallel   1   --jinja   --fit   on   --cache-type-k   f16   --cache-type-v   f16   -md   /root/.laguna_manager/models/laguna-s-2.1-DFlash/laguna-s-2.1-DFlash-BF16.gguf   --spec-type   draft-dflash   --spec-draft-n-max   15 

Servidor lanzado (PID 1783). Logs: ./laguna_manager.sh logs -f
Esperando a que el servidor esté listo...
✔ Servidor listo en http://0.0.0.0:8000/v1  (OpenAI-compatible)
'''



'''
./laguna_manager.sh gpu        # detecta GPUs (nvidia-smi/rocm-smi), VRAM total, RAM, disco
./laguna_manager.sh install    # auto-elige backend e instala lo que falte
./laguna_manager.sh download   # menú interactivo: modelo → backend → quant
./laguna_manager.sh start      # monta el servidor con tus hiperparámetros
./laguna_manager.sh stop       # lo detiene (con limpieza de workers de vLLM)
./laguna_manager.sh status     # PID, URL, modelos servidos, uso de VRAM
./laguna_manager.sh logs -f    # sigue los logs en vivo
'''

Run tepirale/Laguna-S-2.1-DFLASH-GGUF with guIDE

Download guIDE — the AI-native code editor with local LLM inference and 69 built-in tools.

Download guIDE → · Browse 524k+ models · Compare models

Source: Hugging Face · Compare models