GraySoft
Projects Models Compare Cloud benchmarks FAQ Download guIDE →
Model Intelligence Sheet

ermiaazarkhalili/reasoning-gym-chain-sum-qwen3-0-6b-grpo-model-GGUF overview

reasoning gym chain sum qwen3 0.6b grpo — GGUF GGUF quantizations of ermiaazarkhalili/reasoning gym chain sum qwen3 0 6b grpo model https://huggingface.co/ermi…

ggufllama.cppquantizedgrporeasoningtext-generationenbase_model:ermiaazarkhalili/reasoning-gym-chain-sum-qwen3-0-6b-grpo-modelbase_model:quantized:ermiaazarkhalili/reasoning-gym-chain-sum-qwen3-0-6b-grpo-modellicense:apache-2.0endpoints_compatibleregion:us

Runs locally from ~378.3 MB disk (4 GB VRAM class GPUs with llama.cpp / guIDE).

Downloads
0
Likes
0
Pipeline
text-generation

Repository Files & Downloads

3 GGUF files detected
Direct downloads for local inference
FileTypeQuantizationSizeLink
reasoning-gym-chain-sum-qwen3-0-6b-grpo-model.q4_k_m.ggufGGUFGGUF378.3 MBDownload
reasoning-gym-chain-sum-qwen3-0-6b-grpo-model.q5_k_m.ggufGGUFGGUF423.8 MBDownload
reasoning-gym-chain-sum-qwen3-0-6b-grpo-model.q8_0.ggufGGUFGGUF609.8 MBDownload

Model Details

Model IDermiaazarkhalili/reasoning-gym-chain-sum-qwen3-0-6b-grpo-model-GGUF
Authorermiaazarkhalili
Pipelinetext-generation
Licenseapache-2.0
Base modelermiaazarkhalili/reasoning-gym-chain-sum-qwen3-0-6b-grpo-model
Last modified2026-06-29T04:18:07.000Z

Model README

---

base_model: ermiaazarkhalili/reasoning-gym-chain-sum-qwen3-0-6b-grpo-model

tags:

  • gguf
  • llama.cpp
  • quantized
  • grpo
  • reasoning

license: apache-2.0

language:

  • en

pipeline_tag: text-generation

---

reasoning-gym-chain-sum-qwen3-0.6b-grpo — GGUF

GGUF quantizations of ermiaazarkhalili/reasoning-gym-chain-sum-qwen3-0-6b-grpo-model,

a GRPO (Group Relative Policy Optimization) reinforcement-learning fine-tune, converted

with llama.cpp.

| Field | Value |

|---|---|

| Source checkpoint | ermiaazarkhalili/reasoning-gym-chain-sum-qwen3-0-6b-grpo-model |

| Base model | Qwen/Qwen3-0.6B |

| Training | GRPO (group-relative RL) on the chain_sum arithmetic-reasoning task |

| Dataset / environment | OpenEnv reasoning_gymchain_sum (agentic env) |

| Quantization tool | llama.cpp convert_hf_to_gguf.py + llama-quantize |

Available quantizations

| File | Size | Notes |

|---|---|---|

| reasoning-gym-chain-sum-qwen3-0-6b-grpo-model.q4_k_m.gguf | 397 MB (recommended) | 4-bit K-quant medium; best size/quality balance |

| reasoning-gym-chain-sum-qwen3-0-6b-grpo-model.q5_k_m.gguf | 444 MB (balanced) | 5-bit K-quant medium; near-full quality |

| reasoning-gym-chain-sum-qwen3-0-6b-grpo-model.q8_0.gguf | 639 MB (largest) | 8-bit; closest to the source precision |

Recommended default: Q4_K_M. For maximum fidelity use Q8_0.

Usage

llama.cpp

# One-shot
llama-cli -hf ermiaazarkhalili/reasoning-gym-chain-sum-qwen3-0-6b-grpo-model-GGUF --jinja -p "Your prompt here" -n 256

# Interactive chat
llama-cli -hf ermiaazarkhalili/reasoning-gym-chain-sum-qwen3-0-6b-grpo-model-GGUF --jinja -cnv

Ollama

ollama run hf.co/ermiaazarkhalili/reasoning-gym-chain-sum-qwen3-0-6b-grpo-model-GGUF:Q4_K_M

llama-cpp-python

from llama_cpp import Llama

llm = Llama.from_pretrained(
    repo_id="ermiaazarkhalili/reasoning-gym-chain-sum-qwen3-0-6b-grpo-model-GGUF",
    filename="*q4_k_m.gguf",
    n_ctx=4096,
)
out = llm.create_chat_completion(
    messages=[{"role": "user", "content": "Your prompt here"}],
    max_tokens=256,
)
print(out["choices"][0]["message"]["content"])

Intended use

Research and non-commercial experimentation. This model was RL-tuned on the chain_sum arithmetic-reasoning task;

it is a reasoning demonstrator, not a general-purpose assistant. Verify outputs before

any downstream use.

Limitations

  • GGUF quantizations carry unavoidable quality loss relative to the source weights;

prefer Q8_0 when fidelity matters.

  • Inherits every limitation of the source checkpoint

(ermiaazarkhalili/reasoning-gym-chain-sum-qwen3-0-6b-grpo-model).

  • Optimized for the chain_sum arithmetic-reasoning task; capability on unrelated tasks is not guaranteed.

Citation

@misc{reasoning_gym_chain_sum_qwen3_0_6b_grpo_gguf,
  author       = {Ermia Azarkhalili},
  title        = {reasoning-gym-chain-sum-qwen3-0.6b-grpo — GGUF quantized},
  year         = {2026},
  publisher    = {Hugging Face},
  howpublished = {\url{https://huggingface.co/ermiaazarkhalili/reasoning-gym-chain-sum-qwen3-0-6b-grpo-model-GGUF}}
}

Run ermiaazarkhalili/reasoning-gym-chain-sum-qwen3-0-6b-grpo-model-GGUF with guIDE

Download guIDE — the AI-native code editor with local LLM inference and 69 built-in tools.

Download guIDE → · Browse 524k+ models · Compare models

Source: Hugging Face · Compare models