GraySoft
Projects Models Compare Cloud benchmarks FAQ Download guIDE →
Model Intelligence Sheet

BahamutRU/DeepSeek-V4-Flash-Vision-Exp-Q8_0-MXFP4-Q3_K-Q2_K-mixed-GGUF overview

Обзор Этот файл GGUF вдохновлен APEX и базовыми знаниями о MoE. Основная идея — сохранить максимальную точность на критически важных для MoE архитектуры компон…

ggufbase_model:deepseek-ai/DeepSeek-V4-Flash-Vision-Expbase_model:quantized:deepseek-ai/DeepSeek-V4-Flash-Vision-Explicense:mitendpoints_compatibleregion:usconversational

Runs locally from ~890.0 MB disk (4 GB VRAM class GPUs with llama.cpp / guIDE).

Downloads
0
Likes
1
Pipeline
Author

Repository Files & Downloads

3 GGUF files detected
Direct downloads for local inference
FileTypeQuantizationSizeLink
DeepSeek-V4-Flash-Vision-Exp-Q8_0-MXFP4-Q3_K-Q2_K-mixed.ggufGGUFQ8_0119.24 GBDownload
DeepSeek-V4-Flash-Vision-Exp-mmproj-BF16.ggufGGUFBF16891.2 MBDownload
DeepSeek-V4-Flash-Vision-Exp-mmproj-F16.ggufGGUFF16890.0 MBDownload

Model Details

Model IDBahamutRU/DeepSeek-V4-Flash-Vision-Exp-Q8_0-MXFP4-Q3_K-Q2_K-mixed-GGUF
AuthorBahamutRU
Pipeline
Licensemit
Base modeldeepseek-ai/DeepSeek-V4-Flash-Vision-Exp
Last modified2026-09-02T23:49:11.000Z

Model README

---

license: mit

base_model:

  • deepseek-ai/DeepSeek-V4-Flash-Vision-Exp

base_model_relation: quantized

---

Обзор

Этот файл GGUF вдохновлен APEX и базовыми знаниями о MoE.

Основная идея — сохранить максимальную точность на критически важных для MoE-архитектуры компонентах (особенно down_exps) и на граничных слоях, одновременно агрессивно квантуя середину модели, где ошибки меньше влияют на общее качество, при этом используя лишь стандартные Q-кванты для максимальной скорости на процессорах и старых видеокартах.

Схема квантования

Модель условно разделена на три зоны:

| Зона | Слои (blk.) | Тензоры | Тип квантования |

|--------------------|-------------|----------------------------------|-----------------|

| Начало | 0–4 | Все ffn_*_exps.weight | mxfp4 |

| Позднее начало | 5–9 | ffn_down_exps.weight | mxfp4 |

| Позднее начало | 5–9 | ffn_gate_exps, ffn_up_exps | q3_K |

| Середина | 10–32 | ffn_down_exps.weight | q3_K |

| Середина | 10–32 | ffn_gate_exps, ffn_up_exps | q2_K |

| Ранний конец | 33–37 | ffn_gate_exps, ffn_up_exps | q3_K |

| Ранний конец | 33–37 | ffn_down_exps.weight | mxfp4 |

| Конец | 38–42 | Все ffn_*_exps.weight | mxfp4 |

Логика выбора

down_exps — это ключевой компонент в MoE: он агрегирует информацию от экспертов. Потеря точности здесь приводит к заметной деградации логики. Поэтому я дал ему приоритет — mxfp4 на краях и q3_K в середине (вместо q2_K).

Первые и последние слои (0–4 и 38–42) обычно критичны для входной/выходной эмбеддинговой обработки и финального представления. Здесь — mxfp4 (полная точность).

Середина (10–32) — самая многочисленная часть. Здесь допустимо более сильное квантование q2_K для gate/up, так как ошибки усредняются через множество слоёв.

Скрипт квантования

^blk\.[0-4]\.ffn_(gate|up|down)_exps\.weight$=mxfp4
^blk\.[5-9]\.ffn_down_exps\.weight$=mxfp4
^blk\.[5-9]\.ffn_(gate|up)_exps\.weight$=q3_K
^blk\.3[3-7]\.ffn_down_exps\.weight$=mxfp4
^blk\.3[3-7]\.ffn_(gate|up)_exps\.weight$=q3_K
^blk\.(3[89]|4[0-2])\.ffn_(gate|up|down)_exps\.weight$=mxfp4
ffn_down_exps.weight=q3_K
ffn_(gate|up)_exps.weight=q2_K

Послесловие

Обновленная модель получилась больше, потому что за основу взят квант UD_Q8_K_XL от Unsloth, который, по их утверждениям, байт-в-байт повторяет оригинальные веса.

Некоторые тензоры (attn_kv, attn_output_a/_b, attn_q_a/_b, ffn_down_shexp, ffn_gate_shexp, ffn_up_shexp) там оказались в FP16, из них только attn_output_a/_b и attn_q_a/_b я квантовал в q8_0, остальные оставил в bf16, что добавило два гига.

Но все еще -c 262144 -b 2048 -ub 2048 --mmproj … влезает в 16 гигабайт видеопамяти, поэтому в целом я остался доволен.

Если вдруг у кого-то что-то куда-то не поместится — пишите, пожмем еще чутка.

Run BahamutRU/DeepSeek-V4-Flash-Vision-Exp-Q8_0-MXFP4-Q3_K-Q2_K-mixed-GGUF with guIDE

Download guIDE — the AI-native code editor with local LLM inference and 69 built-in tools.

Download guIDE → · Browse 524k+ models · Compare models

Source: Hugging Face · Compare models