Model Intelligence Sheet
mmnga-o/llm-jp-4-33b-thinking-gguf overview
llm jp 4 33b thinking GGUF llm jp https://huggingface.co/llm jp さんが公開している llm jp 4 33b thinking https://huggingface.co/llm jp/llm jp 4 33b thinking のGGUFフォーマット…
Runs locally from ~12.19 GB disk (16 GB VRAM class GPUs with llama.cpp / guIDE).
Repository Files & Downloads
16 GGUF files detected
Direct downloads for local inference
| File | Type | Quantization | Size | Link |
|---|---|---|---|---|
| llm-jp-4-33b-thinking-IQ3_M.gguf | GGUF | IQ3_M | 14.06 GB | Download |
| llm-jp-4-33b-thinking-IQ3_S.gguf | GGUF | IQ3_S | 13.71 GB | Download |
| llm-jp-4-33b-thinking-IQ3_XXS.gguf | GGUF | IQ3_XXS | 12.19 GB | Download |
| llm-jp-4-33b-thinking-IQ4_NL.gguf | GGUF | IQ4_NL | 17.69 GB | Download |
| llm-jp-4-33b-thinking-IQ4_XS.gguf | GGUF | IQ4_XS | 16.76 GB | Download |
| llm-jp-4-33b-thinking-MXFP4_MOE.gguf | GGUF | GGUF | 32.88 GB | Download |
| llm-jp-4-33b-thinking-Q3_K_L.gguf | GGUF | Q3_K_L | 16.33 GB | Download |
| llm-jp-4-33b-thinking-Q3_K_M.gguf | GGUF | Q3_K_M | 15.10 GB | Download |
| llm-jp-4-33b-thinking-Q4_0.gguf | GGUF | Q4_0 | 17.65 GB | Download |
| llm-jp-4-33b-thinking-Q4_K_M.gguf | GGUF | Q4_K_M | 18.78 GB | Download |
| llm-jp-4-33b-thinking-Q4_K_S.gguf | GGUF | Q4_K_S | 17.79 GB | Download |
| llm-jp-4-33b-thinking-Q5_0.gguf | GGUF | Q5_0 | 21.40 GB | Download |
| llm-jp-4-33b-thinking-Q5_K_M.gguf | GGUF | Q5_K_M | 21.98 GB | Download |
| llm-jp-4-33b-thinking-Q5_K_S.gguf | GGUF | Q5_K_S | 21.40 GB | Download |
| llm-jp-4-33b-thinking-Q6_K.gguf | GGUF | Q6_K | 25.39 GB | Download |
| llm-jp-4-33b-thinking-Q8_0.gguf | GGUF | Q8_0 | 32.88 GB | Download |
Model Details
Model README
---
base_model: llm-jp/llm-jp-4-33b-thinking
language:
- ja
tags:
- gguf
- llama.cpp
---
llm-jp-4-33b-thinking-GGUF
llm-jpさんが公開しているllm-jp-4-33b-thinkingのGGUFフォーマット変換版です。
imatrixのデータはTFMC/imatrix-dataset-for-japanese-llmを使用して作成しました。
llama.cpp
このモデルを使用するには、llm-jp版のllama.cppが必要です。
git clone https://github.com/llm-jp/llama.cpp
cd llama.cpp
cmake -B build -DGGML_CUDA=ON
cmake --build build --config Release -j
Usage
hf download mmnga-o/llm-jp-4-33b-thinking-gguf \
llm-jp-4-33b-thinking-Q4_K_M.gguf \
--local-dir .
./build/bin/llama-server \
--model ./llm-jp-4-33b-thinking-Q4_K_M.gguf \
--jinja \
-rea on \
--flash-attn on \
-ngl 99 \
--ctx-size 8192 \
--port 8080
-nglは使用するGPUのVRAM容量に合わせて調整してください。
Run mmnga-o/llm-jp-4-33b-thinking-gguf with guIDE
Download guIDE — the AI-native code editor with local LLM inference and 69 built-in tools.
Source: Hugging Face · Compare models