WariHima/drafters-gemma4-ja-v1-gguf overview
drafters gemma4 ja v1 gguf gemma4モデル用の、ドラフトモデル専用のモデルです。そのため単体での生成は不可能です 上流のllama.cppで使えます。 それ以外の環境は試していない 量子化形式 bf16モデル tq1 0モデル おすすめ 解説 gemma4トークナイザは語彙が約260kあ…
Runs locally from ~73.4 MB disk (4 GB VRAM class GPUs with llama.cpp / guIDE).
Repository Files & Downloads
Model Details
Model README
---
license: apache-2.0
language:
- ja
base_model:
- WariHima/drafters-gemma4-ja-v1
---
drafters gemma4 ja v1 gguf
gemma4モデル用の、ドラフトモデル専用のモデルです。そのため単体での生成は不可能です
上流のllama.cppで使えます。(それ以外の環境は試していない)
量子化形式
bf16モデル
tq1_0モデル (おすすめ)
解説
gemma4トークナイザは語彙が約260kあり、その中で日本語に相当するものはごくわずかです。
gemma4トークナイザを使用して日本語トークンを出力し、
ターゲットモデルの出力時間のなかで、
ドラフト出力トークン数 > (ドラフトモデルのtoken/s) / (ターゲットモデルのtoken/s)
が成り立てば理論上速度が向上します。
ので、128dim、総パラメータ70mのqwen3nextアーキテクチャで作成し、ggufファイルはtq1_0を使用しました。
性能
rtx3060 faあり、gemma4-it-12b(q4_k_m) ドラフトモデルはtq1_0
の環境で軽く試したかぎりは26tk/sから31tk/sまで上がりました。
他のgemma4モデルでも多分動く、はず?
---
architecture
qwen3next model
tokenizer from google/gemma-4-12B
train
training code in ./training_codes
少量のwikipediaデータでフルスクラッチ学習しました。
学習にかかった時間はrtx3060一枚で約3時間ほど。
Run WariHima/drafters-gemma4-ja-v1-gguf with guIDE
Download guIDE — the AI-native code editor with local LLM inference and 69 built-in tools.
Source: Hugging Face · Compare models