TristanQUINTARD/claude-oss-9b-juriste-gguf overview
claude oss 9b juriste gguf Développé et entraîné par Treestan325 https://huggingface.co/Treestan325 Version quantifiée en GGUF multi formats de claude oss 9b j…
Runs locally from ~4.59 GB disk (8 GB VRAM class GPUs with llama.cpp / guIDE).
Repository Files & Downloads
Model Details
| Model ID | TristanQUINTARD/claude-oss-9b-juriste-gguf |
|---|---|
| Author | TristanQUINTARD |
| Pipeline | text-generation |
| License | apache-2.0 |
| Base model | squ11z1/claude-oss |
| Last modified | 2026-06-28T13:32:07.000Z |
Model README
---
license: apache-2.0
base_model: squ11z1/claude-oss
base_model_relation: quantized
language:
- fr
pipeline_tag: text-generation
library_name: gguf
tags:
- gguf
- llama.cpp
- quantized
- claude-oss
- juriste
- droit-francais
- droit-numerique
- legal-tech
---
claude-oss-9b-juriste-gguf
Développé et entraîné par Treestan325
Version quantifiée en GGUF multi-formats de claude-oss-9b-juriste, un modèle de 9 milliards de paramètres spécialisé en droit des contrats français. Ce modèle est un ajustement fin (fine-tuning) du modèle de base squ11z1/claude-oss (9B), configuré pour fonctionner de manière fluide sur du matériel grand public grâce à llama.cpp, Ollama, LM Studio ou KoboldCpp.
Le modèle a été entraîné avec le jeu de données dataset_sft.jsonl en utilisant la plateforme Unsloth pour effectuer un entraînement en 16-bit natif (bfloat16) sur GPU NVIDIA H100 (80 Go) ou A100 (40 Go). Il adopte le style de réflexion signature de Claude : analytique, prévenant, courtois et structure ses pensées de façon limpide et élégante, tout en agissant en tant que juriste expert du droit.
---
⚡ Caractéristiques techniques de l'entraînement
Le modèle a été entraîné selon un protocole d'élite conçu pour préserver l'intégrité cognitive du modèle d'origine :
- Précision native 16-bit (
bfloat16) : Pas de quantification QLoRA 4-bit à l'entraînement. Le modèle conserve 100 % de ses poids d'origine et de ses capacités pour une précision de raisonnement juridique maximale. - LoRA étendu (Full-target) : Application de LoRA sur l'intégralité des modules de projection (
q_proj,k_proj,v_proj,o_proj,gate_proj,up_proj,down_proj) pour intégrer profondément les nuances du droit dans la structure synaptique. - Ajustement VRAM pour vocabulaire géant : Claude-OSS possède un vocabulaire étendu de 248 320 tokens, ce qui engendre d'immenses matrices de logits en 16-bit. L'entraînement a été calibré avec une longueur de contexte maximale (
max_seq_length) de 512 tokens (les blocs de texte faisant en moyenne 450 tokens) pour garantir une stabilité totale de la VRAM. - Hyperparamètres de haute rigueur : Taux d'apprentissage réduit à
2e-5avec un ordonnanceur (lr_scheduler_type)cosinepour préserver la structure cognitive et le raisonnement du modèle.
---
📁 Fichiers disponibles (Quantifications GGUF)
Nous proposons 5 formats de quantification GGUF différents téléversés via Unsloth pour s'adapter à toutes les configurations de mémoire VRAM/RAM :
| Fichier / Format | Quant | Taille indicative | Description |
|---|---|---|---|
| *f16.gguf | F16 | ~18 Go | Précision maximale — Aucun compromis sur les poids d'origine. Nécessite une carte avec >20 Go de VRAM (ex. RTX 3090/4090 ou Mac Studio). |
| *q8_0.gguf | Q8_0 | ~9.5 Go | Qualité quasi-parfaite (near-lossless) — Recommandé pour des machines puissantes avec au moins 16 Go de RAM/VRAM. |
| *q5_k_m.gguf | Q5_K_M | ~6.5 Go | Excellent compromis — Très haute qualité avec une consommation modérée de RAM/VRAM. |
| *q4_k_m.gguf | Q4_K_M | ~5.6 Go | Recommandé par défaut — Excellent compromis entre vitesse d'inférence, préservation de l'intelligence et empreinte mémoire. |
| *q3_k_l.gguf | Q3_K_L | ~4.8 Go | Le plus léger — Idéal pour les configurations avec des ressources matérielles limitées. |
---
🚀 Guide de démarrage rapide
Option 1 : Llama.cpp (llama-cli)
Vous pouvez lancer le modèle en ligne de commande locale avec llama.cpp en utilisant la commande suivante.
Note : Il est fortement recommandé d'utiliser une pénalité de répétition de 1.15 pour éviter toute boucle de répétition dans les raisonnements longs.
llama-cli \
-m claude-oss-9b-juriste-q4_k_m.gguf \
-p "<|im_start|>system\nTu es Claude-OSS-Juriste. Tu adoptes le style de réflexion signature de Claude : analytique, prévenant, courtois et tu structures tes pensées de façon limpide et élégante. Tu es un juriste expert spécialisé en droit français.<|im_end|>\n<|im_start|>user\nBonjour. Quelle est la différence fondamentale entre l'exigence d'écrit ad probationem et ad validitatem en droit des contrats électroniques ?<|im_end|>\n<|im_start|>assistant\n" \
-n 512 \
--temp 0.6 --top-p 0.95 --repeat-penalty 1.15 \
-c 512
Option 2 : Ollama
- Créez un fichier nommé
Modelfile:
FROM ./claude-oss-9b-juriste-q4_k_m.gguf
# Paramètres recommandés basés sur l'entraînement
PARAMETER temperature 0.6
PARAMETER top_p 0.95
PARAMETER repeat_penalty 1.15
PARAMETER num_ctx 512
# Invite système par défaut
SYSTEM "Tu es Claude-OSS-Juriste. Tu adoptes le style de réflexion signature de Claude : analytique, prévenant, courtois et tu structures tes pensées de façon limpide et élégante. Tu es un juriste expert spécialisé en droit français."
TEMPLATE """{{ if .System }}<|im_start|>system
{{ .System }}<|im_end|>
{{ end }}{{ if .Prompt }}<|im_start|>user
{{ .Prompt }}<|im_end|>
{{ end }}<|im_start|>assistant
{{ .Response }}<|im_end|>"""
- Créez le modèle dans Ollama :
ollama create claude-oss-juriste -f Modelfile
- Exécutez le modèle :
ollama run claude-oss-juriste
Option 3 : LM Studio / Jan / KoboldCpp
Glissez-déposez le fichier .gguf de votre choix dans le dossier de modèles de votre logiciel. Le modèle utilise la structure d'invite standard ChatML (ou Qwen). Sélectionnez le modèle d'invite (Chat Template) ChatML ou laissez la détection automatique lire les métadonnées intégrées par llama.cpp.
---
🛠️ Recommandations d'échantillonnage (Sampling)
Pour obtenir des réponses juridiques fluides et de haute qualité :
| Paramètre | Valeur recommandée | Justification |
|---|---|---|
| temperature | 0.6 | Équilibre la créativité et la rigueur logique. |
| top_p | 0.95 | Concentre la génération sur les tokens les plus probables. |
| repeat_penalty | 1.15 | Crucial pour supprimer les répétitions en boucle du modèle. |
| max_new_tokens | 512 | Calibré selon la longueur maximale définie lors de la phase de SFT. |
> [!WARNING]
> Évitez le décodage glouton (greedy decoding) ou les températures trop basses (T ≤ 0.3), car elles peuvent induire des boucles de répétition infinies sur ce modèle.
---
🎯 Capacités et domaines d'expertise
- Style Signature "Claude" : Le modèle adopte une posture polie, humble, structurée et hautement analytique dans ses explications juridiques.
- Raisonnement pas-à-pas : Capacité à décomposer des situations de fait complexes pour en extraire des qualifications juridiques rigoureuses.
---
⚠️ Limites et Avertissements
- Contexte limité à 512 tokens : Le modèle a été entraîné avec un contexte maximal de 512 tokens. L'utilisation de contextes beaucoup plus larges à l'inférence peut réduire la qualité de la génération.
- Information non juridique officielle : Ce modèle est partagé à des fins de recherche et d'expérimentation. Il ne remplace en aucun cas les conseils d'un avocat ou d'un professionnel du droit.
- Pénalité de répétition indispensable : Veillez à appliquer
repetition_penalty = 1.15lors de l'inférence sous peine d'avoir des comportements répétitifs.
---
📜 Licence et Remerciements
- Licence : Apache-2.0 (héritée de la base Claude-OSS 9B).
- Modèle de base : squ11z1/claude-oss.
- Outils d'entraînement : Développé à l'aide de la bibliothèque Unsloth.
- Quantification : Réalisée via la suite llama.cpp et déclinée en 5 formats avec Unsloth.
Run TristanQUINTARD/claude-oss-9b-juriste-gguf with guIDE
Download guIDE — the AI-native code editor with local LLM inference and 69 built-in tools.
Source: Hugging Face · Compare models