ermiaazarkhalili/reasoning-gym-chain-sum-qwen3-1-7b-grpo-GGUF overview
reasoning gym chain sum qwen3 1.7b grpo — GGUF GGUF quantizations of ermiaazarkhalili/reasoning gym chain sum qwen3 1 7b grpo https://huggingface.co/ermiaazark…
Runs locally from ~1.03 GB disk (4 GB VRAM class GPUs with llama.cpp / guIDE).
Repository Files & Downloads
Model Details
| Model ID | ermiaazarkhalili/reasoning-gym-chain-sum-qwen3-1-7b-grpo-GGUF |
|---|---|
| Author | ermiaazarkhalili |
| Pipeline | text-generation |
| License | apache-2.0 |
| Base model | ermiaazarkhalili/reasoning-gym-chain-sum-qwen3-1-7b-grpo |
| Last modified | 2026-06-29T04:18:10.000Z |
Model README
---
base_model: ermiaazarkhalili/reasoning-gym-chain-sum-qwen3-1-7b-grpo
tags:
- gguf
- llama.cpp
- quantized
- grpo
- reasoning
license: apache-2.0
language:
- en
pipeline_tag: text-generation
---
reasoning-gym-chain-sum-qwen3-1.7b-grpo — GGUF
GGUF quantizations of ermiaazarkhalili/reasoning-gym-chain-sum-qwen3-1-7b-grpo,
a GRPO (Group Relative Policy Optimization) reinforcement-learning fine-tune, converted
with llama.cpp.
| Field | Value |
|---|---|
| Source checkpoint | ermiaazarkhalili/reasoning-gym-chain-sum-qwen3-1-7b-grpo |
| Base model | Qwen/Qwen3-1.7B |
| Training | GRPO (group-relative RL) on the chain_sum arithmetic-reasoning task |
| Dataset / environment | OpenEnv reasoning_gym — chain_sum (agentic env) |
| Quantization tool | llama.cpp convert_hf_to_gguf.py + llama-quantize |
Available quantizations
| File | Size | Notes |
|---|---|---|
| reasoning-gym-chain-sum-qwen3-1-7b-grpo.q4_k_m.gguf | 1.11 GB (recommended) | 4-bit K-quant medium; best size/quality balance |
| reasoning-gym-chain-sum-qwen3-1-7b-grpo.q5_k_m.gguf | 1.26 GB (balanced) | 5-bit K-quant medium; near-full quality |
| reasoning-gym-chain-sum-qwen3-1-7b-grpo.q8_0.gguf | 1.83 GB (largest) | 8-bit; closest to the source precision |
Recommended default: Q4_K_M. For maximum fidelity use Q8_0.
Usage
llama.cpp
# One-shot
llama-cli -hf ermiaazarkhalili/reasoning-gym-chain-sum-qwen3-1-7b-grpo-GGUF --jinja -p "Your prompt here" -n 256
# Interactive chat
llama-cli -hf ermiaazarkhalili/reasoning-gym-chain-sum-qwen3-1-7b-grpo-GGUF --jinja -cnv
Ollama
ollama run hf.co/ermiaazarkhalili/reasoning-gym-chain-sum-qwen3-1-7b-grpo-GGUF:Q4_K_M
llama-cpp-python
from llama_cpp import Llama
llm = Llama.from_pretrained(
repo_id="ermiaazarkhalili/reasoning-gym-chain-sum-qwen3-1-7b-grpo-GGUF",
filename="*q4_k_m.gguf",
n_ctx=4096,
)
out = llm.create_chat_completion(
messages=[{"role": "user", "content": "Your prompt here"}],
max_tokens=256,
)
print(out["choices"][0]["message"]["content"])
Intended use
Research and non-commercial experimentation. This model was RL-tuned on the chain_sum arithmetic-reasoning task;
it is a reasoning demonstrator, not a general-purpose assistant. Verify outputs before
any downstream use.
Limitations
- GGUF quantizations carry unavoidable quality loss relative to the source weights;
prefer Q8_0 when fidelity matters.
- Inherits every limitation of the source checkpoint
(ermiaazarkhalili/reasoning-gym-chain-sum-qwen3-1-7b-grpo).
- Optimized for the
chain_sumarithmetic-reasoning task; capability on unrelated tasks is not guaranteed.
Citation
@misc{reasoning_gym_chain_sum_qwen3_1_7b_grpo_gguf,
author = {Ermia Azarkhalili},
title = {reasoning-gym-chain-sum-qwen3-1.7b-grpo — GGUF quantized},
year = {2026},
publisher = {Hugging Face},
howpublished = {\url{https://huggingface.co/ermiaazarkhalili/reasoning-gym-chain-sum-qwen3-1-7b-grpo-GGUF}}
}Run ermiaazarkhalili/reasoning-gym-chain-sum-qwen3-1-7b-grpo-GGUF with guIDE
Download guIDE — the AI-native code editor with local LLM inference and 69 built-in tools.
Source: Hugging Face · Compare models