GraySoft
Projects Models Compare Cloud benchmarks FAQ Download guIDE →
Model Intelligence Sheet

WaveCut/Qwen3.6-35B-A3B-REAM-160-ru-agent-GGUF overview

Qwen3.6 35B A3B REAM 160 ru agent GGUF GGUF quantizations of WaveCut/Qwen3.6 35B A3B REAM 160 ru agent https://huggingface.co/WaveCut/Qwen3.6 35B A3B REAM 160 …

llama.cppggufqwen3.6moereammtpimatrixmixed-precisionbase_model:WaveCut/Qwen3.6-35B-A3B-REAM-160-ru-agentbase_model:quantized:WaveCut/Qwen3.6-35B-A3B-REAM-160-ru-agentendpoints_compatibleregion:usconversational

Runs locally from ~3.88 GB disk (4 GB VRAM class GPUs with llama.cpp / guIDE).

Downloads
0
Likes
1
Pipeline
Author

Repository Files & Downloads

34 GGUF files detected
Direct downloads for local inference
FileTypeQuantizationSizeLink
Qwen3.6-35B-A3B-REAM-160-ru-agent-BF16.ggufGGUFBF1643.09 GBDownload
Qwen3.6-35B-A3B-REAM-160-ru-agent-IQ1_M.ggufGGUFIQ1_M5.69 GBDownload
Qwen3.6-35B-A3B-REAM-160-ru-agent-IQ1_S.ggufGGUFIQ1_S5.24 GBDownload
Qwen3.6-35B-A3B-REAM-160-ru-agent-IQ2_M.ggufGGUFIQ2_M7.73 GBDownload
Qwen3.6-35B-A3B-REAM-160-ru-agent-IQ2_S.ggufGGUFIQ2_S7.14 GBDownload
Qwen3.6-35B-A3B-REAM-160-ru-agent-IQ2_XS.ggufGGUFIQ2_XS7.03 GBDownload
Qwen3.6-35B-A3B-REAM-160-ru-agent-IQ2_XXS.ggufGGUFIQ2_XXS6.43 GBDownload
Qwen3.6-35B-A3B-REAM-160-ru-agent-IQ3_M.ggufGGUFIQ3_M9.99 GBDownload
Qwen3.6-35B-A3B-REAM-160-ru-agent-IQ3_S.ggufGGUFIQ3_S9.88 GBDownload
Qwen3.6-35B-A3B-REAM-160-ru-agent-IQ3_XS.ggufGGUFIQ3_XS9.43 GBDownload
Qwen3.6-35B-A3B-REAM-160-ru-agent-IQ3_XXS.ggufGGUFIQ3_XXS8.89 GBDownload
Qwen3.6-35B-A3B-REAM-160-ru-agent-IQ4_NL.ggufGGUFIQ4_NL12.60 GBDownload
Qwen3.6-35B-A3B-REAM-160-ru-agent-IQ4_XS.ggufGGUFIQ4_XS11.97 GBDownload
Qwen3.6-35B-A3B-REAM-160-ru-agent-MXFP4_MOE.ggufGGUFGGUF12.96 GBDownload
Qwen3.6-35B-A3B-REAM-160-ru-agent-Q1_0.ggufGGUFQ1_03.88 GBDownload
Qwen3.6-35B-A3B-REAM-160-ru-agent-Q2_K.ggufGGUFQ2_K8.49 GBDownload
Qwen3.6-35B-A3B-REAM-160-ru-agent-Q2_K_S.ggufGGUFQ2_K_S8.02 GBDownload
Qwen3.6-35B-A3B-REAM-160-ru-agent-Q3_K_L.ggufGGUFQ3_K_L11.58 GBDownload
Qwen3.6-35B-A3B-REAM-160-ru-agent-Q3_K_M.ggufGGUFQ3_K_M10.77 GBDownload
Qwen3.6-35B-A3B-REAM-160-ru-agent-Q3_K_S.ggufGGUFQ3_K_S9.81 GBDownload
Qwen3.6-35B-A3B-REAM-160-ru-agent-Q4_0.ggufGGUFQ4_012.59 GBDownload
Qwen3.6-35B-A3B-REAM-160-ru-agent-Q4_1.ggufGGUFQ4_113.82 GBDownload
Qwen3.6-35B-A3B-REAM-160-ru-agent-Q4_K_M.ggufGGUFQ4_K_M13.41 GBDownload
Qwen3.6-35B-A3B-REAM-160-ru-agent-Q4_K_S.ggufGGUFQ4_K_S12.65 GBDownload
Qwen3.6-35B-A3B-REAM-160-ru-agent-Q5_0.ggufGGUFQ5_015.16 GBDownload
Qwen3.6-35B-A3B-REAM-160-ru-agent-Q5_1.ggufGGUFQ5_116.39 GBDownload
Qwen3.6-35B-A3B-REAM-160-ru-agent-Q5_K_M.ggufGGUFQ5_K_M15.56 GBDownload
Qwen3.6-35B-A3B-REAM-160-ru-agent-Q5_K_S.ggufGGUFQ5_K_S15.11 GBDownload
Qwen3.6-35B-A3B-REAM-160-ru-agent-Q6_K.ggufGGUFQ6_K17.84 GBDownload
Qwen3.6-35B-A3B-REAM-160-ru-agent-Q8_0.ggufGGUFQ8_022.92 GBDownload
Qwen3.6-35B-A3B-REAM-160-ru-agent-WC-Q3_K_XL.ggufGGUFQ3_K_XL11.29 GBDownload
Qwen3.6-35B-A3B-REAM-160-ru-agent-WC-Q4_K_XL.ggufGGUFQ4_K_XL13.84 GBDownload
Qwen3.6-35B-A3B-REAM-160-ru-agent-WC-Q5_K_XL.ggufGGUFQ5_K_XL15.90 GBDownload
Qwen3.6-35B-A3B-REAM-160-ru-agent-WC-Q6_K_XL.ggufGGUFQ6_K_XL18.08 GBDownload

Model Details

Model IDWaveCut/Qwen3.6-35B-A3B-REAM-160-ru-agent-GGUF
AuthorWaveCut
Pipeline
License
Base modelWaveCut/Qwen3.6-35B-A3B-REAM-160-ru-agent
Last modified2026-06-21T00:14:32.000Z

Model README

---

library_name: llama.cpp

base_model: WaveCut/Qwen3.6-35B-A3B-REAM-160-ru-agent

tags:

- gguf

- qwen3.6

- moe

- ream

- mtp

- imatrix

- mixed-precision

---

Qwen3.6-35B-A3B-REAM-160-ru-agent-GGUF

GGUF quantizations of

WaveCut/Qwen3.6-35B-A3B-REAM-160-ru-agent.

All release GGUF files are produced and smoke-tested with clean upstream

ggml-org/llama.cpp at commit

8452824611be321246f33339727f60a90c02c277 (b9739-845282461). Runtime forks

are not required.

Source

  • Source checkpoint dtype: BF16
  • Full precision GGUF baseline: BF16 only
  • Source parameters: 23,562,176,368 BF16 parameters
  • Main MoE experts: 160
  • MTP/NextN MoE experts: 160

Release Files

Release candidates that passed upstream llama-cli smoke:

  • Standard: Q1_0, IQ1_S, IQ1_M, Q2_K, Q2_K_S, IQ2_XXS,

IQ2_XS, IQ2_S, IQ2_M, Q3_K_S, Q3_K_M, Q3_K_L, IQ3_XXS,

IQ3_XS, IQ3_S, IQ3_M, Q4_0, Q4_1, Q4_K_S, Q4_K_M,

IQ4_NL, IQ4_XS, MXFP4_MOE, Q5_0, Q5_1, Q5_K_S, Q5_K_M,

Q6_K, Q8_0.

  • Mixed precision: WC-Q3_K_XL, WC-Q4_K_XL, WC-Q5_K_XL,

WC-Q6_K_XL.

Excluded: TQ1_0 and TQ2_0 were generated but failed upstream smoke and are

not release files.

Per-file size and SHA256 are recorded in manifests/gguf-*.json.

Mixed Precision Recipe

WC-Q*_K_XL files are upstream-compatible GGUF files produced with

llama-quantize --tensor-type-file masks/wc-xl.txt.

The mask keeps sensitive tensors at higher precision:

  • token_embd, output, ffn_gate_inp: q8_0
  • attn_q, attn_k, attn_v, ffn_down: q6_K
  • MTP/NextN tensors and blk.40.*: q8_0

The base quant type remains standard upstream (Q3_K_M, Q4_K_M, Q5_K_M,

or Q6_K), so no custom runtime is required.

Quality

Primary metric: KL divergence against the BF16 GGUF baseline using

llama-perplexity --kl-divergence. The raw llama.cpp logs report values very

close to zero for this short held-out run, so the table below shows the more

interpretable same_top percentage from the same logs. Full logs and parsed

rows are in quality/ and stats/quality_summary.json.

| quant | RU same_top | agent same_top | code same_top | math same_top | mixed same_top |

| --- | ---: | ---: | ---: | ---: | ---: |

| Q3_K_M | 86.561 | 87.194 | 96.250 | 95.711 | 90.809 |

| WC-Q3_K_XL | 87.632 | 88.039 | 96.275 | 96.066 | 91.275 |

| Q4_K_M | 92.323 | 92.267 | 97.451 | 97.365 | 94.338 |

| WC-Q4_K_XL | 92.881 | 93.309 | 97.880 | 97.684 | 94.926 |

| MXFP4_MOE | 91.041 | 92.463 | 97.500 | 97.537 | 94.203 |

| Q5_K_M | 93.801 | 93.958 | 98.100 | 97.929 | 95.539 |

| WC-Q5_K_XL | 94.284 | 94.154 | 98.113 | 98.407 | 96.054 |

| Q6_K | 95.566 | 95.429 | 98.517 | 98.407 | 96.507 |

| WC-Q6_K_XL | 95.566 | 95.527 | 98.689 | 98.358 | 96.728 |

| Q8_0 | 96.259 | 96.311 | 98.799 | 98.738 | 97.353 |

Practical starting points:

  • Lowest size: Q3_K_M or WC-Q3_K_XL.
  • Balanced RU/agent quality: WC-Q4_K_XL or WC-Q5_K_XL.
  • Conservative high quality: Q6_K, WC-Q6_K_XL, or Q8_0.

MTP / NextN Status

MTP/NextN tensors are structurally preserved in the combined GGUF files, and

manifests/gguf-*.json confirms the Qwen35MoE/NextN metadata.

Runtime MTP/speculative support is not claimed for this release. Upstream

llama-speculative smoke failed for both split draft and combined self-draft

forms:

  • split trunk/draft exit code: 139
  • combined self-draft exit code: 139

The exact result is recorded in stats/mtp_smoke.json.

Reproducibility

The build used:

  • llama.cpp commit 8452824611be321246f33339727f60a90c02c277
  • BF16 combined GGUF with MTP preserved
  • agent/RU/code/math calibration and imatrix
  • masks/mtp-q8.txt for standard quantization
  • masks/wc-xl.txt for mixed precision candidates

See RECIPE.md, manifests/, stats/, quality/, and logs/ for the full

audit trail.

Run WaveCut/Qwen3.6-35B-A3B-REAM-160-ru-agent-GGUF with guIDE

Download guIDE — the AI-native code editor with local LLM inference and 69 built-in tools.

Download guIDE → · Browse 524k+ models · Compare models

Source: Hugging Face · Compare models