GraySoft
Projects Models Compare Cloud benchmarks FAQ Download guIDE →
Model Intelligence Sheet

hiratagoh/llm-jp-4-32b-a3b-thinking-GGUF overview

hiratagoh/llm jp 4 32b a3b thinking GGUF LLM jp4 Thinking MoEモデルをGGUF化 LLM jpチームにて開発された llm jp/llm jp 4 32b a3b thinking https://huggingface.co/llm jp/llm jp 4…

gguftext-generationjaenbase_model:llm-jp/llm-jp-4-32b-a3b-thinkingbase_model:quantized:llm-jp/llm-jp-4-32b-a3b-thinkinglicense:apache-2.0endpoints_compatibleregion:usconversational

Runs locally from ~16.37 GB disk (24 GB VRAM class GPUs with llama.cpp / guIDE).

Downloads
2,186
Likes
0
Pipeline
text-generation
Author

Repository Files & Downloads

7 GGUF files detected
Direct downloads for local inference
FileTypeQuantizationSizeLink
llm-jp-4-32b-a3b-thinking-IQ4_XS.ggufGGUFIQ4_XS16.37 GBDownload
llm-jp-4-32b-a3b-thinking-MXFP4_MOE.ggufGGUFGGUF16.89 GBDownload
llm-jp-4-32b-a3b-thinking-Q4_K_M.ggufGGUFQ4_K_M19.93 GBDownload
llm-jp-4-32b-a3b-thinking-Q5_K_M.ggufGGUFQ5_K_M22.73 GBDownload
llm-jp-4-32b-a3b-thinking-Q6_K.ggufGGUFQ6_K26.86 GBDownload
llm-jp-4-32b-a3b-thinking-Q8_0.ggufGGUFQ8_031.84 GBDownload
llm-jp-4-32b-a3b-thinking-bf16.ggufGGUFBF1659.89 GBDownload

Model Details

Model IDhiratagoh/llm-jp-4-32b-a3b-thinking-GGUF
Authorhiratagoh
Pipelinetext-generation
Licenseapache-2.0
Base modelllm-jp/llm-jp-4-32b-a3b-thinking
Last modified2026-07-19T13:31:51.000Z

Model README

---

license: apache-2.0

language:

  • ja
  • en

base_model:

  • llm-jp/llm-jp-4-32b-a3b-thinking

pipeline_tag: text-generation

---

hiratagoh/llm-jp-4-32b-a3b-thinking-GGUF

LLM-jp4 Thinking MoEモデルをGGUF化

LLM-jpチームにて開発された

llm-jp/llm-jp-4-32b-a3b-thinking

をGGUF変換して量子化しました。

GGUF変換にあたって

「LLM-jp-4 Thinking モデルの量子化版の公開」

の記載と

「正規GGUF版」のダンプ内容を参考にしました。

実際のGGUF変換の手順は

[記事:LLM-jp-4 Thinking MoEモデルのGGUF変換

[bone.jp]](https://bone.jp/articles/2026/260625_llmjp4_quantize.html)

をご覧ください。

~~このモデルはGGUF変換技術の検証目的で作成したものであり、現時点では性能評価は行っておりません。~~

ベンチマークの結果を追加しました。(2026-07-15)

利用上の注意

使用に当たっては下記情報もご参照ください。

- LLM-jpチームによる正規GGUF・量子化モデル 【GGUF化のお手本としました】

- LLM-jp-4 Thinking モデルの量子化版の公開 【GGUF変換のハマリどころ解説あります】

  • LLM-jp-4 Cookbook 【脱トークン時の問題への対応、入力にはHarmonyテンプレートなど性能劣化防止には必読です】

- the LLM-jp fork of llama.cpp 【本家llama.cpp修正まではコチラを利用しましょう】

  • LLM-jp Tokenizer 【tokenizer.modelはこちらのver4.0_alpha1.0を使用しました】

※このGGUF版Thinkingモデルは現状のllama-cpp系(Ollamaを含む)では

トークナイザの仕様のため特殊トークンの直後に不要な空白が生成され、

Chat Tenplateの動作等に影響が出る可能性がります。回避策として

「修正版のllama-cpp (the LLM-jp fork of llama.cpp)」

の利用ができます。

量子化

量子化のキャリブレーションにはLLM-jp提供のiMatrixを使用しました。

ベンチマーク

llmjp/llm-jp-4-32b-a3b-thinking:GGUF変換、量子化モデルの性能評価

|Org.|Format / Quant.|MT-Bench (JA) |MT-Bench (EN)|

|:---|:---|---:|---:|

|LLM-jp|HF BF16|7.78<br>7.69<br>7.70<br>Ave. 7.72|8.00<br>7.98<br>7.97<br>Ave. 7.98|

||GGUF BF16|7.69<br>7.68<br>Ave. 7.69|8.06<br>7.96<br>Ave. 8.01|

||GGUF Q4_K_M|7.51<br>7.61<br>7.67<br>Ave. 7.60|7.92<br>7.89<br>7.88<br>Ave.7.90|

|hiratagoh|GGUF BF16|7.82<br>7.75<br>Ave. 7.79|7.91<br>7.98<br>Ave. 7.95|

||GGUF Q8_0|7.58<br>7.80<br>Ave. 7.69|7.96<br>8.07<br>Ave. 8.02|

||GGUF Q6_K|7.53<br>7.66<br>Ave. 7.60|7.85<br>7.75<br>Ave. 7.80|

||GGUF Q5_K_M|7.76<br>7.58<br>Ave.7.67|7.94<br>7.91<br>Ave.7.93|

||GGUF Q4_K_M|7.53<br>7.86<br>7.71<br>Ave. 7.70|7.97<br>7.89<br>7.92<br>Ave. 7.93|

||GGUF IQ4_XS|7.36|7.87|

||GGUF MXFP4_MOE|7.49|7.75|

Reasoning EffortはすべてMediumです。

  • 生成・評価にはllm-jp-judgeを使用しました。LLM-jpさんのモデルも同じ条件で計測しています。
  • 生成時のmax_tokenは16384で、評価にはgpt-5.4-2026-03-05を使用しました。
  • ~~生成・評価は予算(gpt-5.4のAPI利用料)の関係ですべて1回です。~~

* 当初予算からAPI利用料を倍増して、一部のモデルの生成・評価回数を増やしました。

  • Inference Engines

* vLLM 0.19.0+cu130 with LLM-jp-4 parser

* llama-server version 9376 (26b0e874a) for llmjp4

---

(2026-06-28 README.md 修正)

(2026-07-15 README.md ベンチマーク追加)

(2026-07-17 README.md ベンチマークの評価回数を増加)

Run hiratagoh/llm-jp-4-32b-a3b-thinking-GGUF with guIDE

Download guIDE — the AI-native code editor with local LLM inference and 69 built-in tools.

Download guIDE → · Browse 524k+ models · Compare models

Source: Hugging Face · Compare models