GraySoft
Projects Models Compare Cloud benchmarks FAQ Download guIDE →
Model Intelligence Sheet

AesSedai/GLM-5.3-Flash-GGUF overview

Notes WIP, requires this PR https://github.com/ggml org/llama.cpp/pull/27773 to run This repo contains specialized MoE quants for zai org/GLM 5.3 Flash BF16. T…

ggufbase_model:zai-org/GLM-5.3-Flash-BF16base_model:quantized:zai-org/GLM-5.3-Flash-BF16endpoints_compatibleregion:usimatrixconversational

Runs locally from ~9.0 MB disk (4 GB VRAM class GPUs with llama.cpp / guIDE).

Downloads
0
Likes
3
Pipeline
Author

Repository Files & Downloads

30 GGUF files detected
Direct downloads for local inference
FileTypeQuantizationSizeLink
IQ2_S/GLM-5.3-Flash-IQ2_S-00001-of-00004.ggufGGUFIQ2_S9.0 MBDownload
IQ2_S/GLM-5.3-Flash-IQ2_S-00002-of-00004.ggufGGUFIQ2_S46.40 GBDownload
IQ2_S/GLM-5.3-Flash-IQ2_S-00003-of-00004.ggufGGUFIQ2_S46.08 GBDownload
IQ2_S/GLM-5.3-Flash-IQ2_S-00004-of-00004.ggufGGUFIQ2_S13.33 GBDownload
IQ3_S/GLM-5.3-Flash-IQ3_S-00001-of-00004.ggufGGUFIQ3_S9.0 MBDownload
IQ3_S/GLM-5.3-Flash-IQ3_S-00002-of-00004.ggufGGUFIQ3_S46.09 GBDownload
IQ3_S/GLM-5.3-Flash-IQ3_S-00003-of-00004.ggufGGUFIQ3_S45.89 GBDownload
IQ3_S/GLM-5.3-Flash-IQ3_S-00004-of-00004.ggufGGUFIQ3_S24.16 GBDownload
IQ4_XS/GLM-5.3-Flash-IQ4_XS-00001-of-00005.ggufGGUFIQ4_XS9.0 MBDownload
IQ4_XS/GLM-5.3-Flash-IQ4_XS-00002-of-00005.ggufGGUFIQ4_XS46.41 GBDownload
IQ4_XS/GLM-5.3-Flash-IQ4_XS-00003-of-00005.ggufGGUFIQ4_XS46.23 GBDownload
IQ4_XS/GLM-5.3-Flash-IQ4_XS-00004-of-00005.ggufGGUFIQ4_XS46.24 GBDownload
IQ4_XS/GLM-5.3-Flash-IQ4_XS-00005-of-00005.ggufGGUFIQ4_XS9.35 GBDownload
Q4_K_M/GLM-5.3-Flash-Q4_K_M-00001-of-00006.ggufGGUFQ4_K_M9.0 MBDownload
Q4_K_M/GLM-5.3-Flash-Q4_K_M-00002-of-00006.ggufGGUFQ4_K_M46.34 GBDownload
Q4_K_M/GLM-5.3-Flash-Q4_K_M-00003-of-00006.ggufGGUFQ4_K_M45.22 GBDownload
Q4_K_M/GLM-5.3-Flash-Q4_K_M-00004-of-00006.ggufGGUFQ4_K_M45.35 GBDownload
Q4_K_M/GLM-5.3-Flash-Q4_K_M-00005-of-00006.ggufGGUFQ4_K_M46.34 GBDownload
Q4_K_M/GLM-5.3-Flash-Q4_K_M-00006-of-00006.ggufGGUFQ4_K_M4.85 GBDownload
Q5_K_M/GLM-5.3-Flash-Q5_K_M-00001-of-00006.ggufGGUFQ5_K_M9.0 MBDownload
Q5_K_M/GLM-5.3-Flash-Q5_K_M-00002-of-00006.ggufGGUFQ5_K_M45.02 GBDownload
Q5_K_M/GLM-5.3-Flash-Q5_K_M-00003-of-00006.ggufGGUFQ5_K_M46.03 GBDownload
Q5_K_M/GLM-5.3-Flash-Q5_K_M-00004-of-00006.ggufGGUFQ5_K_M46.02 GBDownload
Q5_K_M/GLM-5.3-Flash-Q5_K_M-00005-of-00006.ggufGGUFQ5_K_M46.02 GBDownload
Q5_K_M/GLM-5.3-Flash-Q5_K_M-00006-of-00006.ggufGGUFQ5_K_M41.19 GBDownload
imatrix.ggufGGUFGGUF488.9 MBDownload
mmproj-GLM-5.3-Flash-BF16.ggufGGUFBF161.08 GBDownload
mmproj-GLM-5.3-Flash-F16.ggufGGUFF161.05 GBDownload
mmproj-GLM-5.3-Flash-F32.ggufGGUFF322.10 GBDownload
mmproj-GLM-5.3-Flash-Q8_0.ggufGGUFQ8_0622.6 MBDownload

Model Details

Model IDAesSedai/GLM-5.3-Flash-GGUF
AuthorAesSedai
Pipeline
License
Base modelzai-org/GLM-5.3-Flash-BF16
Last modified2026-08-30T10:13:20.000Z

Model README

---

base_model:

  • zai-org/GLM-5.3-Flash-BF16

---

Notes

This repo contains specialized MoE-quants for zai-org/GLM-5.3-Flash-BF16. The idea being that given the huge size of the FFN tensors compared to the rest of the tensors in the model, it should be possible to achieve a better quality while keeping the overall size of the entire model smaller compared to a similar naive quantization. To that end, the quantization type default is kept in high quality and the FFN UP + FFN GATE tensors are quanted down along with the FFN DOWN tensors.

| Quant | Size | Mixture | PPL | 1-(Mean PPL(Q)/PPL(base)) | KLD |

| :----- | :-------------------- | :------------------------------- | :------------------ | :------------------------ | :------------------ |

| Q5_K_M | 224.28 GiB (6.01 BPW) | Q8_0 / Q5_K / Q5_K / Q6_K | 3.589877 ± 0.019865 | +0.5529% | 0.027859 ± 0.000207 |

| Q4_K_M | 188.10 GiB (5.04 BPW) | Q8_0 / Q4_K / Q4_K / Q5_K | 3.635356 ± 0.020204 | +1.8267% | 0.050181 ± 0.000333 |

| IQ4_XS | 148.24 GiB (3.97 BPW) | Q8_0 / IQ3_S / IQ3_S / IQ4_XS | 3.819227 ± 0.021423 | +6.9770% | 0.117358 ± 0.000727 |

| IQ3_S | 116.14 GiB (3.11 BPW) | Q6_K / IQ2_S / IQ2_S / IQ3_S | 4.387061 ± 0.025595 | +22.8821% | 0.283438 ± 0.001596 |

| IQ2_S | 105.81 GiB (2.83 BPW) | Q6_K / IQ2_XS / IQ2_XS / IQ3_XXS | 4.761384 ± 0.028305 | +33.3669% | 0.375406 ± 0.001984 |

!kld_graph

!ppl_graph

Run AesSedai/GLM-5.3-Flash-GGUF with guIDE

Download guIDE — the AI-native code editor with local LLM inference and 69 built-in tools.

Download guIDE → · Browse 524k+ models · Compare models

Source: Hugging Face · Compare models