GraySoft
Projects Models Compare Cloud benchmarks FAQ Download guIDE →
Model Intelligence Sheet

WariHima/drafters-gemma4-v2-gguf overview

drafters gemma4 v2 gguf gemma4モデル用の、ドラフトモデル専用のモデルです。そのため単体での生成は不可能です 総パラメータ数と保存サイズが下がっただけで、 drafters gemma4 ja v2 ggufとあがる速度はあまり変わらないです。 上流のllama.cppで使えます。 それ以…

ggufjabase_model:WariHima/drafters-gemma4-v2base_model:quantized:WariHima/drafters-gemma4-v2license:apache-2.0endpoints_compatibleregion:us

Runs locally from ~48.4 MB disk (4 GB VRAM class GPUs with llama.cpp / guIDE).

Downloads
0
Likes
0
Pipeline
Author

Repository Files & Downloads

2 GGUF files detected
Direct downloads for local inference
FileTypeQuantizationSizeLink
drafters-gemma4-v2-TQ1_0.ggufGGUFGGUF48.4 MBDownload
drafters-gemma4-v2.ggufGGUFGGUF79.3 MBDownload

Model Details

Model IDWariHima/drafters-gemma4-v2-gguf
AuthorWariHima
Pipeline
Licenseapache-2.0
Base modelWariHima/drafters-gemma4-v2
Last modified2026-08-01T13:50:28.000Z

Model README

---

license: apache-2.0

language:

  • ja

base_model:

  • WariHima/drafters-gemma4-v2

---

drafters gemma4 v2 gguf

gemma4モデル用の、ドラフトモデル専用のモデルです。そのため単体での生成は不可能です

総パラメータ数と保存サイズが下がっただけで、

drafters gemma4 ja v2 ggufとあがる速度はあまり変わらないです。

上流のllama.cppで使えます。(それ以外の環境は試していない)

量子化形式

bf16モデル

tq1_0モデル (おすすめ)

解説

gemma4トークナイザは語彙が約260kあり、その中で日本語に相当するものはごくわずかです。

gemma4トークナイザを使用して日本語トークンを出力し、

ターゲットモデルの出力時間のなかで、

ドラフト出力トークン数 > (ドラフトモデルのtoken/s) / (ターゲットモデルのtoken/s)

が成り立てば理論上速度が向上します。

ので、128dim、総パラメータ70mのqwen3nextアーキテクチャで作成し、ggufファイルはtq1_0を使用しました。

性能

rtx3060 faあり、gemma4-it-12b(q4_k_m) ドラフトモデルはtq1_0

の環境で軽く試したかぎりは26tk/sから31tk/sまで上がりました。

他のgemma4モデルでも多分動く、はず?

---

architecture

lfm2moe model

tokenizer from google/gemma-4-12B

train

training code in ./training_codes

少量のwikipediaデータでフルスクラッチ学習しました。

学習にかかった時間はrtx3060一枚で10分ほど。

Run WariHima/drafters-gemma4-v2-gguf with guIDE

Download guIDE — the AI-native code editor with local LLM inference and 69 built-in tools.

Download guIDE → · Browse 524k+ models · Compare models

Source: Hugging Face · Compare models