GraySoft
Projects Models Compare Cloud benchmarks FAQ Download guIDE →
Model Intelligence Sheet

WariHima/drafters-gemma4-ja-v1-gguf overview

drafters gemma4 ja v1 gguf gemma4モデル用の、ドラフトモデル専用のモデルです。そのため単体での生成は不可能です 上流のllama.cppで使えます。 それ以外の環境は試していない 量子化形式 bf16モデル tq1 0モデル おすすめ 解説 gemma4トークナイザは語彙が約260kあ…

ggufjabase_model:WariHima/drafters-gemma4-ja-v1base_model:quantized:WariHima/drafters-gemma4-ja-v1license:apache-2.0endpoints_compatibleregion:us

Runs locally from ~73.4 MB disk (4 GB VRAM class GPUs with llama.cpp / guIDE).

Downloads
0
Likes
0
Pipeline
Author

Repository Files & Downloads

2 GGUF files detected
Direct downloads for local inference
FileTypeQuantizationSizeLink
drafters-gemma4-v1-TQ1_0.ggufGGUFGGUF73.4 MBDownload
drafters-gemma4-v1.ggufGGUFGGUF152.0 MBDownload

Model Details

Model IDWariHima/drafters-gemma4-ja-v1-gguf
AuthorWariHima
Pipeline
Licenseapache-2.0
Base modelWariHima/drafters-gemma4-ja-v1
Last modified2026-07-30T14:28:59.000Z

Model README

---

license: apache-2.0

language:

  • ja

base_model:

  • WariHima/drafters-gemma4-ja-v1

---

drafters gemma4 ja v1 gguf

gemma4モデル用の、ドラフトモデル専用のモデルです。そのため単体での生成は不可能です

上流のllama.cppで使えます。(それ以外の環境は試していない)

量子化形式

bf16モデル

tq1_0モデル (おすすめ)

解説

gemma4トークナイザは語彙が約260kあり、その中で日本語に相当するものはごくわずかです。

gemma4トークナイザを使用して日本語トークンを出力し、

ターゲットモデルの出力時間のなかで、

ドラフト出力トークン数 > (ドラフトモデルのtoken/s) / (ターゲットモデルのtoken/s)

が成り立てば理論上速度が向上します。

ので、128dim、総パラメータ70mのqwen3nextアーキテクチャで作成し、ggufファイルはtq1_0を使用しました。

性能

rtx3060 faあり、gemma4-it-12b(q4_k_m) ドラフトモデルはtq1_0

の環境で軽く試したかぎりは26tk/sから31tk/sまで上がりました。

他のgemma4モデルでも多分動く、はず?

---

architecture

qwen3next model

tokenizer from google/gemma-4-12B

train

training code in ./training_codes

少量のwikipediaデータでフルスクラッチ学習しました。

学習にかかった時間はrtx3060一枚で約3時間ほど。

Run WariHima/drafters-gemma4-ja-v1-gguf with guIDE

Download guIDE — the AI-native code editor with local LLM inference and 69 built-in tools.

Download guIDE → · Browse 524k+ models · Compare models

Source: Hugging Face · Compare models