BahamutRU/DeepSeek-V4-Flash-Vision-Exp-Q8_0-MXFP4-Q3_K-Q2_K-mixed-GGUF overview
Обзор Этот файл GGUF вдохновлен APEX и базовыми знаниями о MoE. Основная идея — сохранить максимальную точность на критически важных для MoE архитектуры компон…
Runs locally from ~890.0 MB disk (4 GB VRAM class GPUs with llama.cpp / guIDE).
Repository Files & Downloads
Model Details
Model README
---
license: mit
base_model:
- deepseek-ai/DeepSeek-V4-Flash-Vision-Exp
base_model_relation: quantized
---
Обзор
Этот файл GGUF вдохновлен APEX и базовыми знаниями о MoE.
Основная идея — сохранить максимальную точность на критически важных для MoE-архитектуры компонентах (особенно down_exps) и на граничных слоях, одновременно агрессивно квантуя середину модели, где ошибки меньше влияют на общее качество, при этом используя лишь стандартные Q-кванты для максимальной скорости на процессорах и старых видеокартах.
Схема квантования
Модель условно разделена на три зоны:
| Зона | Слои (blk.) | Тензоры | Тип квантования |
|--------------------|-------------|----------------------------------|-----------------|
| Начало | 0–4 | Все ffn_*_exps.weight | mxfp4 |
| Позднее начало | 5–9 | ffn_down_exps.weight | mxfp4 |
| Позднее начало | 5–9 | ffn_gate_exps, ffn_up_exps | q3_K |
| Середина | 10–32 | ffn_down_exps.weight | q3_K |
| Середина | 10–32 | ffn_gate_exps, ffn_up_exps | q2_K |
| Ранний конец | 33–37 | ffn_gate_exps, ffn_up_exps | q3_K |
| Ранний конец | 33–37 | ffn_down_exps.weight | mxfp4 |
| Конец | 38–42 | Все ffn_*_exps.weight | mxfp4 |
Логика выбора
down_exps — это ключевой компонент в MoE: он агрегирует информацию от экспертов. Потеря точности здесь приводит к заметной деградации логики. Поэтому я дал ему приоритет — mxfp4 на краях и q3_K в середине (вместо q2_K).
Первые и последние слои (0–4 и 38–42) обычно критичны для входной/выходной эмбеддинговой обработки и финального представления. Здесь — mxfp4 (полная точность).
Середина (10–32) — самая многочисленная часть. Здесь допустимо более сильное квантование q2_K для gate/up, так как ошибки усредняются через множество слоёв.
Скрипт квантования
^blk\.[0-4]\.ffn_(gate|up|down)_exps\.weight$=mxfp4
^blk\.[5-9]\.ffn_down_exps\.weight$=mxfp4
^blk\.[5-9]\.ffn_(gate|up)_exps\.weight$=q3_K
^blk\.3[3-7]\.ffn_down_exps\.weight$=mxfp4
^blk\.3[3-7]\.ffn_(gate|up)_exps\.weight$=q3_K
^blk\.(3[89]|4[0-2])\.ffn_(gate|up|down)_exps\.weight$=mxfp4
ffn_down_exps.weight=q3_K
ffn_(gate|up)_exps.weight=q2_K
Послесловие
Обновленная модель получилась больше, потому что за основу взят квант UD_Q8_K_XL от Unsloth, который, по их утверждениям, байт-в-байт повторяет оригинальные веса.
Некоторые тензоры (attn_kv, attn_output_a/_b, attn_q_a/_b, ffn_down_shexp, ffn_gate_shexp, ffn_up_shexp) там оказались в FP16, из них только attn_output_a/_b и attn_q_a/_b я квантовал в q8_0, остальные оставил в bf16, что добавило два гига.
Но все еще -c 262144 -b 2048 -ub 2048 --mmproj … влезает в 16 гигабайт видеопамяти, поэтому в целом я остался доволен.
Если вдруг у кого-то что-то куда-то не поместится — пишите, пожмем еще чутка.
Run BahamutRU/DeepSeek-V4-Flash-Vision-Exp-Q8_0-MXFP4-Q3_K-Q2_K-mixed-GGUF with guIDE
Download guIDE — the AI-native code editor with local LLM inference and 69 built-in tools.
Source: Hugging Face · Compare models