kdqemre/Qwen3.6-27B-Omnimerge-v4-MTP-Q4_K_L-GGUF overview
Qwen3.6 27B Omnimerge v4 MTP Q4 K L GGUF This is a Q4 K L quantized GGUF version of ManniX ITA/Qwen3.6 27B Omnimerge v4 https://huggingface.co/ManniX ITA/Qwen3…
Runs locally from ~16.19 GB disk (24 GB VRAM class GPUs with llama.cpp / guIDE).
Repository Files & Downloads
| File | Type | Quantization | Size | Link |
|---|---|---|---|---|
| Qwen3.6-27B-Omnimerge-v4-MTP-Q4_K_L.gguf | GGUF | Q4_K_L | 16.19 GB | Download |
Model Details
Model README
---
license: apache-2.0
library_name: transformers
tags:
- qwen
- qwen3_6
- merge
- mergekit
- reasoning
- code
- vision
- conversational
- gguf
base_model: ManniX-ITA/Qwen3.6-27B-Omnimerge-v4
---
Qwen3.6-27B-Omnimerge-v4-MTP-Q4_K_L-GGUF
This is a Q4_K_L quantized GGUF version of ManniX-ITA/Qwen3.6-27B-Omnimerge-v4.
Why this quantization exists?
Based on my tests if you are a personal AI person with 24GB Vram, best quant is not Q4_K_M versions. Q4_K_L quantization is offers better
performance-size-speed trio. I think this model is performing better among other Qwen3.6 27B versions for general purpose agentic AI use case.
Original Model
- Base: ManniX-ITA/Qwen3.6-27B-Omnimerge-v4
- Architecture: qwen3_5
- Parameters: 27B
- Task: Image-Text-to-Text
Quantization
- Format: GGUF
- Quantization: Q4_K_L
- Quantized by: kdqemre
Usage with llama.cpp (Optimized Params for 24GB VRAM- You can try longer context length)
llama-server -m Qwen3.6-27B-Omnimerge-v4-MTP-Q4_K_L.gguf \
-ngl 99 \
-c 16384 \
-fa 1 \
-np 1 --cache-type-k q8_0 --cache-type-v q5_1 --reasoning-format deepseek --reasoning-budget 2048 \
--spec-type draft-mtp --spec-draft-n-max 3 --cache-type-k-draft q5_1 --cache-type-v-draft q5_1 --kv-unified \
--port 8088
License
Original model licensed under Apache-2.0. This quantized version preserves the original license.
Run kdqemre/Qwen3.6-27B-Omnimerge-v4-MTP-Q4_K_L-GGUF with guIDE
Download guIDE — the AI-native code editor with local LLM inference and 69 built-in tools.
Source: Hugging Face · Compare models