TristanQUINTARD/Gemma-4-Agentic-E2B-GGUF overview
gemma 4 E2B it uncensored agentic gguf Développé et entraîné par Treestan325 https://huggingface.co/Treestan325 Version quantifiée en GGUF Q4 K M de gemma 4 E2…
Runs locally from ~3.19 GB disk (4 GB VRAM class GPUs with llama.cpp / guIDE).
Repository Files & Downloads
| File | Type | Quantization | Size | Link |
|---|---|---|---|---|
| gemma-4-agentic-e2b-q4_k_m.gguf | GGUF | Q4_K_M | 3.19 GB | Download |
Model Details
| Model ID | TristanQUINTARD/Gemma-4-Agentic-E2B-GGUF |
|---|---|
| Author | TristanQUINTARD |
| Pipeline | text-generation |
| License | other |
| Base model | TrevorJS/gemma-4-E2B-it-uncensored |
| Last modified | 2026-06-28T13:35:14.000Z |
Model README
---
license: other
base_model: TrevorJS/gemma-4-E2B-it-uncensored
base_model_relation: quantized
language:
- en
- fr
pipeline_tag: text-generation
library_name: gguf
tags:
- unsloth
- gemma
- gemma-4
- agentic
- tool-use
- reasoning
- thinking-mode
- uncensored
- gguf
- llama.cpp
---
gemma-4-E2B-it-uncensored-agentic-gguf
Développé et entraîné par Treestan325
Version quantifiée en GGUF (Q4_K_M) de gemma-4-E2B-it-uncensored-agentic, un modèle ajusté spécifiquement pour les tâches agentiques complexes, l'utilisation d'outils (tool-use) et le raisonnement par étapes (Chain-of-Thought). Ce modèle est basé sur TrevorJS/gemma-4-E2B-it-uncensored, fine-tuné à l'aide d'Unsloth sur Google Colab.
Le modèle intègre le support natif des blocs de réflexion (<think>...</think>) avant la génération de code ou l'appel de fonctions, permettant une intégration propre dans des boucles d'agents autonomes (ex. OpenCode, E2B executor).
---
⚡ Caractéristiques techniques de l'entraînement
Le modèle a été entraîné selon une configuration hautement spécialisée pour les agents :
- Base de départ : TrevorJS/gemma-4-E2B-it-uncensored (chargé en précision 4-bit QLoRA).
- LoRA étendu (Focus Agentic) : Application de LoRA sur l'intégralité des modules de projection (
q_proj,k_proj,v_proj,o_proj,gate_proj,up_proj,down_proj) avec un rang élevé $r = 32$ et un $\alpha = 64$ pour capturer la syntaxe complexe des appels de fonctions et du code. - Pas de packing de contexte (
packing = False) : Choix essentiel lors du SFT pour préserver l'intégrité logique des limites de sessions d'agents et éviter d'interférer avec le comportement de tool-calling. - Longueur de contexte maximale (
max_seq_length) : 4096 tokens (optimisé pour stocker les longues traces d'exécution et les historiques de conversation d'agents). - Taux d'apprentissage doux (
learning_rate = 2e-5) : Configuration mesurée pour préserver les poids uncensored du modèle d'origine tout en affinant ses capacités logiques.
---
📊 Données d'entraînement et fusion
Le modèle a été entraîné en fusionnant plusieurs jeu de données de traces de raisonnement brutes sans modification de texte (pour préserver la pureté des chemins logiques) :
- Traces Hermes Agentic (
lambda/hermes-agent-reasoning-traces, sous-ensembleskimietglm-5.1). - Traces Qwen Pi (
armand0e/qwen3.7-max-pi-traces).
La standardisation et la tokenisation ont été réalisées via la bibliothèque Teich avec l'option enable_thinking: True activée pour forcer le comportement d'analyse pas-à-pas.
---
🚀 Guide de démarrage rapide
Le fichier quantifié model_gguf/gemma-4-E2B-it-uncensored-agentic-Q4_K_M.gguf contient déjà le gabarit d'invite (chat template) natif configuré avec le support des outils.
Option 1 : Utilisation avec Ollama
- Créez un fichier nommé
Modelfile:
FROM ./model_gguf/gemma-4-E2B-it-uncensored-agentic-Q4_K_M.gguf
# Paramètres optimaux d'inférence
PARAMETER temperature 0.6
PARAMETER top_p 0.95
PARAMETER num_ctx 4096
# Template de discussion natif avec mode de réflexion activé
TEMPLATE """{{ if .System }}<|im_start|>system
{{ .System }}<|im_end|>
{{ end }}{{ if .Prompt }}<|im_start|>user
{{ .Prompt }}<|im_end|>
{{ end }}<|im_start|>assistant
{{ .Response }}<|im_end|>"""
- Créez et lancez le modèle :
ollama create gemma4-agentic -f Modelfile
ollama run gemma4-agentic
Option 2 : Llama.cpp (llama-cli)
Pour exécuter le modèle en ligne de commande locale :
llama-cli \
-m model_gguf/gemma-4-E2B-it-uncensored-agentic-Q4_K_M.gguf \
-p "<|im_start|>user\nWrite a python script to run a binary search over a sorted list and explain its complexity.<|im_end|>\n<|im_start|>assistant\n<think>\n" \
-n 1024 \
--temp 0.6 --top-p 0.95 \
-c 4096
---
🛠️ Recommandations d'échantillonnage (Sampling)
Pour exploiter le raisonnement de l'agent sans causer de boucles répétitives :
| Paramètre | Valeur recommandée | Justification |
|---|---|---|
| temperature | 0.6 | Laisse une flexibilité suffisante pour la génération de code sans halluciner. |
| top_p | 0.95 | Concentre la probabilité sur les sorties les plus propres. |
| max_new_tokens | 1024 / 2048 | Budget généreux nécessaire pour le <think> et le code de sortie. |
---
⚠️ Limites et Avertissements
- Modèle Uncensored : Ce modèle n'a pas subi l'alignement de sécurité classique. Il est capable de traiter des sujets techniques de cybersécurité ou d'ingénierie système sans refus. Il incombe à l'intégrateur d'ajouter une couche de filtrage applicatif si le modèle est exposé à des utilisateurs finaux.
- Formatage
<think>: Les réponses s'ouvrent généralement par une balise<think>et se referment par</think>avant d'apporter la réponse ou d'appeler un outil. Assurez-vous que vos scripts de parsing d'agents en tiennent compte.
---
📜 Licence et Remerciements
- Licence : Google Gemma License Agreement.
- Modèle de base : TrevorJS/gemma-4-E2B-it-uncensored.
- Entraînement : Unsloth Unsloth et préparation des données Teich.
Run TristanQUINTARD/Gemma-4-Agentic-E2B-GGUF with guIDE
Download guIDE — the AI-native code editor with local LLM inference and 69 built-in tools.
Source: Hugging Face · Compare models