hiratagoh/llm-jp-4-32b-a3b-thinking-GGUF overview
hiratagoh/llm jp 4 32b a3b thinking GGUF LLM jp4 Thinking MoEモデルをGGUF化 LLM jpチームにて開発された llm jp/llm jp 4 32b a3b thinking https://huggingface.co/llm jp/llm jp 4…
Runs locally from ~16.37 GB disk (24 GB VRAM class GPUs with llama.cpp / guIDE).
Repository Files & Downloads
| File | Type | Quantization | Size | Link |
|---|---|---|---|---|
| llm-jp-4-32b-a3b-thinking-IQ4_XS.gguf | GGUF | IQ4_XS | 16.37 GB | Download |
| llm-jp-4-32b-a3b-thinking-MXFP4_MOE.gguf | GGUF | GGUF | 16.89 GB | Download |
| llm-jp-4-32b-a3b-thinking-Q4_K_M.gguf | GGUF | Q4_K_M | 19.93 GB | Download |
| llm-jp-4-32b-a3b-thinking-Q5_K_M.gguf | GGUF | Q5_K_M | 22.73 GB | Download |
| llm-jp-4-32b-a3b-thinking-Q6_K.gguf | GGUF | Q6_K | 26.86 GB | Download |
| llm-jp-4-32b-a3b-thinking-Q8_0.gguf | GGUF | Q8_0 | 31.84 GB | Download |
| llm-jp-4-32b-a3b-thinking-bf16.gguf | GGUF | BF16 | 59.89 GB | Download |
Model Details
| Model ID | hiratagoh/llm-jp-4-32b-a3b-thinking-GGUF |
|---|---|
| Author | hiratagoh |
| Pipeline | text-generation |
| License | apache-2.0 |
| Base model | llm-jp/llm-jp-4-32b-a3b-thinking |
| Last modified | 2026-07-19T13:31:51.000Z |
Model README
---
license: apache-2.0
language:
- ja
- en
base_model:
- llm-jp/llm-jp-4-32b-a3b-thinking
pipeline_tag: text-generation
---
hiratagoh/llm-jp-4-32b-a3b-thinking-GGUF
LLM-jp4 Thinking MoEモデルをGGUF化
LLM-jpチームにて開発された
llm-jp/llm-jp-4-32b-a3b-thinking
をGGUF変換して量子化しました。
GGUF変換にあたって
「LLM-jp-4 Thinking モデルの量子化版の公開」
の記載と
「正規GGUF版」のダンプ内容を参考にしました。
実際のGGUF変換の手順は
[記事:LLM-jp-4 Thinking MoEモデルのGGUF変換
[bone.jp]](https://bone.jp/articles/2026/260625_llmjp4_quantize.html)
をご覧ください。
~~このモデルはGGUF変換技術の検証目的で作成したものであり、現時点では性能評価は行っておりません。~~
ベンチマークの結果を追加しました。(2026-07-15)
利用上の注意
使用に当たっては下記情報もご参照ください。
- 元モデル HF版 【このモデルをGGUF化しました】
- LLM-jpチームによる正規GGUF・量子化モデル 【GGUF化のお手本としました】
- LLM-jp-4 Thinking モデルの量子化版の公開 【GGUF変換のハマリどころ解説あります】
- LLM-jp-4 Cookbook 【脱トークン時の問題への対応、入力にはHarmonyテンプレートなど性能劣化防止には必読です】
- the LLM-jp fork of llama.cpp 【本家llama.cpp修正まではコチラを利用しましょう】
- LLM-jp Tokenizer 【tokenizer.modelはこちらのver4.0_alpha1.0を使用しました】
※このGGUF版Thinkingモデルは現状のllama-cpp系(Ollamaを含む)では
トークナイザの仕様のため特殊トークンの直後に不要な空白が生成され、
Chat Tenplateの動作等に影響が出る可能性がります。回避策として
「修正版のllama-cpp (the LLM-jp fork of llama.cpp)」
の利用ができます。
量子化
量子化のキャリブレーションにはLLM-jp提供のiMatrixを使用しました。
ベンチマーク
llmjp/llm-jp-4-32b-a3b-thinking:GGUF変換、量子化モデルの性能評価
|Org.|Format / Quant.|MT-Bench (JA) |MT-Bench (EN)|
|:---|:---|---:|---:|
|LLM-jp|HF BF16|7.78<br>7.69<br>7.70<br>Ave. 7.72|8.00<br>7.98<br>7.97<br>Ave. 7.98|
||GGUF BF16|7.69<br>7.68<br>Ave. 7.69|8.06<br>7.96<br>Ave. 8.01|
||GGUF Q4_K_M|7.51<br>7.61<br>7.67<br>Ave. 7.60|7.92<br>7.89<br>7.88<br>Ave.7.90|
|hiratagoh|GGUF BF16|7.82<br>7.75<br>Ave. 7.79|7.91<br>7.98<br>Ave. 7.95|
||GGUF Q8_0|7.58<br>7.80<br>Ave. 7.69|7.96<br>8.07<br>Ave. 8.02|
||GGUF Q6_K|7.53<br>7.66<br>Ave. 7.60|7.85<br>7.75<br>Ave. 7.80|
||GGUF Q5_K_M|7.76<br>7.58<br>Ave.7.67|7.94<br>7.91<br>Ave.7.93|
||GGUF Q4_K_M|7.53<br>7.86<br>7.71<br>Ave. 7.70|7.97<br>7.89<br>7.92<br>Ave. 7.93|
||GGUF IQ4_XS|7.36|7.87|
||GGUF MXFP4_MOE|7.49|7.75|
Reasoning EffortはすべてMediumです。
- 生成・評価にはllm-jp-judgeを使用しました。LLM-jpさんのモデルも同じ条件で計測しています。
- 生成時のmax_tokenは16384で、評価にはgpt-5.4-2026-03-05を使用しました。
- ~~生成・評価は予算(gpt-5.4のAPI利用料)の関係ですべて1回です。~~
* 当初予算からAPI利用料を倍増して、一部のモデルの生成・評価回数を増やしました。
- Inference Engines
* vLLM 0.19.0+cu130 with LLM-jp-4 parser
* llama-server version 9376 (26b0e874a) for llmjp4
---
(2026-06-28 README.md 修正)
(2026-07-15 README.md ベンチマーク追加)
(2026-07-17 README.md ベンチマークの評価回数を増加)
Run hiratagoh/llm-jp-4-32b-a3b-thinking-GGUF with guIDE
Download guIDE — the AI-native code editor with local LLM inference and 69 built-in tools.
Source: Hugging Face · Compare models