grapeV-ai/Qwen3.8-27B-GGUF overview
What is this? Qwen3.8 27B https://huggingface.co/Qwen/Qwen3.8 27B をMTP(=マルチトークン予測)レイヤーを含めてGGUFフォーマットに変換したものです。 Note mm mmproj Qwen3.8 27b BF16.gguf でビジョンエンコーダー…
Runs locally from ~13.0 MB disk (4 GB VRAM class GPUs with llama.cpp / guIDE).
Repository Files & Downloads
| File | Type | Quantization | Size | Link |
|---|---|---|---|---|
| Qwen3.8-27B-BF16.gguf | GGUF | BF16 | 50.90 GB | Download |
| Qwen3.8-27B-IQ4_XS.gguf | GGUF | IQ4_XS | 14.26 GB | Download |
| Qwen3.8-27B-Q4_K_M.gguf | GGUF | Q4_K_M | 15.66 GB | Download |
| Qwen3.8-27B-Q5_K_M.gguf | GGUF | Q5_K_M | 18.19 GB | Download |
| Qwen3.8-27B-Q6_K.gguf | GGUF | Q6_K | 20.89 GB | Download |
| imatrix.gguf | GGUF | GGUF | 13.0 MB | Download |
| mmproj-Qwen3.8-27b-BF16.gguf | GGUF | BF16 | 888.0 MB | Download |
| mmproj-Qwen3.8-27b-Q8_0.gguf | GGUF | Q8_0 | 600.1 MB | Download |
| mtp-Qwen3.8-27b-BF16.gguf | GGUF | BF16 | 5.54 GB | Download |
Model Details
Model README
---
license: apache-2.0
---
What is this?
Qwen3.8-27BをMTP(=マルチトークン予測)レイヤーを含めてGGUFフォーマットに変換したものです。
Note
-mm mmproj-Qwen3.8-27b-BF16.ggufでビジョンエンコーダーをロードし、Vision対応モデルとして使用することができます。
推論努力(Reasoning effort)はlow / medium / xhighから選択可能で、デフォルトはxhighです。<br>
llama.cppのserverの場合は起動時に以下の引数を追加することで変更可能です。
--chat-template-kwargs '{\"reasoning_effort\":\"xhigh\"}'
引数に--spec-type draft-mtp --spec-draft-n-max 2と追加することでMTPが有効化されます。<br>
なお、--spec-draft-n-maxの値については、日本語では2がスイートスポットのようです。
License
Apache 2.0
Developer
Alibaba Cloud
Run grapeV-ai/Qwen3.8-27B-GGUF with guIDE
Download guIDE — the AI-native code editor with local LLM inference and 69 built-in tools.
Source: Hugging Face · Compare models