HTPQoo/Sinythos-5.5-Mini-GGUF overview
Sinythos 5.5 Mini 709 MB. Un file. Gira sul telefono. Stesse sei leggi del modello grande, incise nel chat template — valgono anche senza system prompt. Instal…
Runs locally from ~675.9 MB disk (4 GB VRAM class GPUs with llama.cpp / guIDE).
Repository Files & Downloads
| File | Type | Quantization | Size | Link |
|---|---|---|---|---|
| Sinythos-5.5-Mini.gguf | GGUF | GGUF | 675.9 MB | Download |
Model Details
| Model ID | HTPQoo/Sinythos-5.5-Mini-GGUF |
|---|---|
| Author | HTPQoo |
| Pipeline | text-generation |
| License | apache-2.0 |
| Base model | Qwen/Qwen3-1.7B |
| Last modified | 2026-08-10T19:07:30.000Z |
Model README
---
license: apache-2.0
base_model: Qwen/Qwen3-1.7B
tags: [gguf, llama.cpp, lm-studio, pocketpal, mobile, reasoning, small]
language: [it, en, multilingual]
pipeline_tag: text-generation
---
Sinythos 5.5 Mini
709 MB. Un file. Gira sul telefono. Stesse sei leggi del modello grande,
incise nel chat template — valgono anche senza system prompt.
Installazione
LM Studio — scarica il .gguf e trascinalo, oppure cercalo dall'app.
Il chat template è dentro al file: niente da configurare.
PocketPal (Android/iOS) — Models → + → Add from Hugging Face e incolla
HTPQoo/Sinythos-5.5-Mini-GGUF. Oppure scarica il file e usa Add Local Model.
llama.cpp
llama-server -hf HTPQoo/Sinythos-5.5-Mini-GGUF --jinja -c 8192
--jinja serve solo a llama.cpp; LM Studio e PocketPal leggono il template da soli.
Impostazioni consigliate
| | |
|---|---|
| Temperature | 0.6 |
| Top-P | 0.95 |
| Top-K | 20 |
| Max tokens | 2048 o più |
| Contesto | 8192 (fino a 32768) |
Il max-tokens alto non è opzionale. È un modello thinking: apre <think>
e ragiona prima di rispondere. Con un limite basso esaurisce i token mentre sta
ancora pensando e sembra che non risponda.
Cosa aspettarsi, onestamente
| | Sinythos 5.5 | Mini |
|---|---|---|
| Dimensione | 17,7 GB | 709 MB (25× più piccolo) |
| Parametri | 30B (3,3B attivi) | 1,7B |
| Gira su | PC con 24 GB RAM | telefono |
Il Mini non è più potente del modello grande — ha 1/18 dei parametri, e
nessuna quantizzazione o fusione può cambiarlo. Quello che è: il massimo
ottenibile in 709 MB, con lo stesso comportamento — ragiona prima di rispondere,
ammette quando non sa, verifica invece di inventare.
Dove rende meglio: domande dirette, riformulazioni, estrazione da testo, script
brevi, conversazione multilingue. Dove serve il grande: codice complesso,
conoscenza specialistica, testi lunghi curati.
E c'è un vantaggio che il grande non ha: funziona offline in tasca.
Le sei leggi
- Ragiona, poi rispondi — nella lingua di chi scrive
- Se non sai, vai a scoprirlo
- I giochi hanno geometria vera
- Il software si consegna animato e con i suoi asset
- Verifica prima di affermare
- Seconda passata, avversariale
Runtime agentico completo: <https://github.com/baccarossa2-ai/BaccaMalware>
Verifica
sha256 7a9e9cf20103fb628aac838c185fcfa15d3a8d09f4d8fe72d40529fee7474a1b
bytes 708721824
I 310 tensori sono byte-identici alla quantizzazione base di Qwen3-1.7B,
verificati singolarmente. Nessun training, nessuna distillazione: cambiano solo
i metadati.
Licenza
Pesi Apache 2.0 (opera derivata di Qwen3-1.7B) — vedi LICENSE e NOTICE.
Runtime MIT.
Run HTPQoo/Sinythos-5.5-Mini-GGUF with guIDE
Download guIDE — the AI-native code editor with local LLM inference and 69 built-in tools.
Source: Hugging Face · Compare models