GraySoft
Projects Models Compare Cloud benchmarks FAQ Download guIDE →
Model Intelligence Sheet

tokimoa/Stockmark-DocReasoner-Qwen2.5-VL-32B-GGUF overview

Stockmark DocReasoner Qwen2.5 VL 32B GGUF ストックマーク社の日本語文書読解VLM Stockmark DocReasoner Qwen2.5 VL 32B https://huggingface.co/stockmark/Stockmark DocReasoner Qwen2…

ggufllama.cppjapanesedocument-understandingvision-languageimage-text-to-textjabase_model:stockmark/Stockmark-DocReasoner-Qwen2.5-VL-32Bbase_model:quantized:stockmark/Stockmark-DocReasoner-Qwen2.5-VL-32Blicense:apache-2.0endpoints_compatibleregion:usconversational

Runs locally from ~1.28 GB disk (4 GB VRAM class GPUs with llama.cpp / guIDE).

Downloads
0
Likes
0
Pipeline
image-text-to-text
Author

Repository Files & Downloads

3 GGUF files detected
Direct downloads for local inference
FileTypeQuantizationSizeLink
Stockmark-DocReasoner-Qwen2.5-VL-32B-Q4_K_M.ggufGGUFQ4_K_M18.49 GBDownload
Stockmark-DocReasoner-Qwen2.5-VL-32B-Q5_K_M.ggufGGUFQ5_K_M21.66 GBDownload
mmproj-Stockmark-DocReasoner-Qwen2.5-VL-32B-f16.ggufGGUFF161.28 GBDownload

Model Details

Model IDtokimoa/Stockmark-DocReasoner-Qwen2.5-VL-32B-GGUF
Authortokimoa
Pipelineimage-text-to-text
Licenseapache-2.0
Base modelstockmark/Stockmark-DocReasoner-Qwen2.5-VL-32B
Last modified2026-08-05T13:37:22.000Z

Model README

---

license: apache-2.0

base_model: stockmark/Stockmark-DocReasoner-Qwen2.5-VL-32B

language:

- ja

pipeline_tag: image-text-to-text

tags:

- gguf

- llama.cpp

- japanese

- document-understanding

- vision-language

---

Stockmark-DocReasoner-Qwen2.5-VL-32B-GGUF

ストックマーク社の日本語文書読解VLM Stockmark-DocReasoner-Qwen2.5-VL-32B のGGUF版です。llama.cppでWindows/Linux/MacのCPU・GPUで動きます。推論過程を書いてから <answer> タグで結論を返す、文書読解に特化した32Bモデルです。

Apple Silicon(MLX)で使う場合は MLX 4bit版 もあります。

ファイル

| ファイル | サイズ | 目安 |

|---|---|---|

| Q4_K_M | 18GB | 推奨。RAM 32GBまたはVRAM 24GB級 |

| Q5_K_M | 22GB | 品質重視。RAM 32GB以上 |

| mmproj-f16 | 1.3GB | 視覚エンコーダ(必須・どの量子化とも組み合わせ可) |

検証

正解既知の日本語文書QA 6問(請求書・議事録・契約書・チェックシート等)で確認しています(temperature 0・M4 Max実測)。

  • Q4_K_M: 6問すべて内容正解(合計金額880,000円・「Recall@5で0.92」等。推論過程→<answer>880,000円</answer> の形式も維持)
  • Q5_K_M: スポット2問正解
  • 生成速度は両量子化とも約13 tok/s(M4 Max・Metal)

使い方

llama-server -m Stockmark-DocReasoner-Qwen2.5-VL-32B-Q4_K_M.gguf \
  --mmproj mmproj-Stockmark-DocReasoner-Qwen2.5-VL-32B-f16.gguf \
  --port 8080 --jinja -c 8192 --image-min-tokens 64 --image-max-tokens 4096

運用上の注意(いずれも実測に基づく):

  1. APIでは画像をテキストより先に置いてください(contentの並びを[image_url, text]にする)。
  2. -c 8192等でコンテキスト長を指定してください。 無指定はモデル宣言の最大長で確保しようとしてメモリ不足になります。推論過程が長いモデルなのでmax_tokensは1024以上を推奨します。
  3. --image-max-tokens 4096を推奨します。 文書画像は高解像度のため、既定では過剰に縮小され読み取りが落ちます。
  4. 出力は「推論過程 → <answer>結論</answer>」の形式です。機械処理では<answer>タグを抽出してください(--reasoning-format noneを付けると過程もcontentに含まれ確認しやすくなります)。

ライセンスと帰属

---

Converted by tokimoa — データを外に出さないAI活用を支援しています

Run tokimoa/Stockmark-DocReasoner-Qwen2.5-VL-32B-GGUF with guIDE

Download guIDE — the AI-native code editor with local LLM inference and 69 built-in tools.

Download guIDE → · Browse 524k+ models · Compare models

Source: Hugging Face · Compare models