naimulislam999/vMAX-Bangla-Gemma3-270m-GGUF overview
<div align="center" đ§đŠ vMAX â Bangla AI Assistant gemma 3 270m it ¡ Fine Tuned ¡ GGUF Model https://img.shields.io/badge/Model Gemma 3 270M 4285F4?style=for âĻ
Runs locally from ~241.4 MB disk (4 GB VRAM class GPUs with llama.cpp / guIDE).
Repository Files & Downloads
Model Details
| Model ID | naimulislam999/vMAX-Bangla-Gemma3-270m-GGUF |
|---|---|
| Author | naimulislam999 |
| Pipeline | text-generation |
| License | gemma |
| Base model | google/gemma-3-270m-it |
| Last modified | 2026-08-21T17:24:52.000Z |
Model README
---
language:
- bn
- en
license: gemma
library_name: gguf
tags:
- gguf
- llama.cpp
- ollama
- unsloth
- gemma3
- bangla
- bengali
- conversational
- function-calling
- lora
- fine-tuned
base_model: google/gemma-3-270m-it
model_name: vMAX-Bangla-Gemma3-270m-GGUF
pipeline_tag: text-generation
quantized_by: naimulislam999
datasets:
- custom
---
<div align="center">
đ§đŠ vMAX â Bangla AI Assistant
gemma-3-270m-it ¡ Fine-Tuned ¡ GGUF




<br/>
vMAX is a Bangla-first conversational AI fine-tuned to speak naturally in authentic Bangladeshi Bengali â
no robotic formality, just warm, relatable, and intelligent conversation.
Built by Naimul Islam Nahid
---
</div>
⨠Highlights
- đŖī¸ Native Bangla Fluency â Understands idioms, slang, humor, and cultural nuances of Bangladeshi Bengali
- đ ī¸ Function Calling â Trained on 304 tool-use examples with structured
<tool_call>/<tool_response>format - ⥠Lightweight â 270M parameters, runs on CPU / mobile / edge devices
- đĻ Multiple Quantizations â Q4_K_M, Q8_0, and F16 GGUF variants included
- đĻ Ollama Ready â Drop-in Modelfile included for instant local deployment
---
đĨ Available Files
| Filename | Quant | Size | Use Case |
|:---------|:-----:|-----:|:---------|
| gemma-3-270m-it.Q4_K_M.gguf | Q4_K_M | ~170 MB | đĸ Best for mobile / edge â great balance of speed & quality |
| gemma-3-270m-it.Q8_0.gguf | Q8_0 | ~290 MB | đĩ Higher quality, still very fast on CPU |
| gemma-3-270m-it.F16.gguf | F16 | ~540 MB | đŖ Full precision â maximum quality |
---
đ Quick Start
llama.cpp
# Text-only inference
llama-cli -hf naimulislam999/vMAX-Bangla-Gemma3-270m-GGUF --jinja
# Multimodal (if applicable)
llama-mtmd-cli -hf naimulislam999/vMAX-Bangla-Gemma3-270m-GGUF --jinja
Ollama
# Create from the included Modelfile
ollama create vmax -f Modelfile
# Or directly from Hugging Face
echo 'FROM hf.co/naimulislam999/vMAX-Bangla-Gemma3-270m-GGUF:Q4_K_M' > Modelfile
echo 'SYSTEM "āϤā§āĻŽāĻŋ vMAX, āύāĻžāĻāĻŽā§āϞ āĻāϏāϞāĻžāĻŽ āύāĻžāĻšāĻŋāĻĻā§āϰ āύāĻŋāĻāϏā§āĻŦ āĻāĻāĻ āĻŦāύā§āϧ⧠āĻ āĻ
ā§āϝāĻžāϏāĻŋāϏā§āĻā§āϝāĻžāύā§āĻāĨ¤ āϤā§āĻŽāĻžāϰ āĻāĻĨāĻžāĻŦāĻžāϰā§āϤāĻžāϝāĻŧ āĻā§āύ⧠āĻā§āϤā§āϰāĻŋāĻŽ āϰā§āĻŦā§āĻāĻŋāĻ āĻāĻžāĻŦ āύā§āĻ, āĻŦāϰāĻ āĻāĻžāĻāĻāĻŋ āĻŦāĻžāĻāϞāĻžāĻĻā§āĻļāĻŋ āĻāϰā§āϝāĻŧāĻž āĻ āĻāύā§āϤāϰāĻŋāĻ āĻŽā§āĻāĻžāĻ āĻĨāĻžāĻā§āĨ¤"' >> Modelfile
ollama create vmax -f Modelfile
# Run
ollama run vmax "āϤā§āĻŽāĻŋ āĻā§?"
Python (llama-cpp-python)
from llama_cpp import Llama
llm = Llama.from_pretrained(
repo_id="naimulislam999/vMAX-Bangla-Gemma3-270m-GGUF",
filename="gemma-3-270m-it.Q4_K_M.gguf",
)
response = llm.create_chat_completion(
messages=[
{"role": "system", "content": "āϤā§āĻŽāĻŋ vMAX, āύāĻžāĻāĻŽā§āϞ āĻāϏāϞāĻžāĻŽ āύāĻžāĻšāĻŋāĻĻā§āϰ āύāĻŋāĻāϏā§āĻŦ āĻāĻāĻ āĻŦāύā§āϧ⧠āĻ āĻ
ā§āϝāĻžāϏāĻŋāϏā§āĻā§āϝāĻžāύā§āĻāĨ¤"},
{"role": "user", "content": "āĻŦāĻžāĻāϞāĻžāĻĻā§āĻļā§āϰ āϏāĻŦāĻā§āϝāĻŧā§ āϏā§āύā§āĻĻāϰ āĻāĻžāϝāĻŧāĻāĻž āĻā§āύāĻāĻŋ?"},
],
)
print(response["choices"][0]["message"]["content"])
---
đ ī¸ Function Calling
vMAX supports structured tool use. The model was trained to emit and parse tool calls using XML-style tags:
User â Model (tool call):
<tool_call>
{"name": "get_weather", "arguments": {"city": "Dhaka"}}
</tool_call>
Tool â Model (tool response):
<tool_response>
{"name": "get_weather", "result": {"temp": "34°C", "condition": "Sunny"}}
</tool_response>
The model then generates a natural Bangla response incorporating the tool output.
---
đ Training Details
| Parameter | Value |
|:----------|:------|
| Base Model | google/gemma-3-270m-it |
| Method | LoRA (rank 16, alpha 32) |
| Target Modules | q_proj, k_proj, v_proj, o_proj, gate_proj, up_proj, down_proj |
| Dataset | 2,249 curated Bangla examples (1,945 chat + 304 function-calling) |
| Epochs | 5 |
| Effective Batch Size | 8 (2 Ã 4 grad accumulation) |
| Learning Rate | 5e-5 (cosine schedule, 10% warmup) |
| Precision | FP16 / 4-bit QLoRA |
| Max Sequence Length | 2,048 tokens |
| Hardware | NVIDIA T4 (Kaggle) |
| Framework | Unsloth + TRL + PEFT |
---
đŦ Example Conversations
<details>
<summary><b>đ¤ī¸ Casual Chat</b></summary>
> User: āĻāĻāĻā§ āĻāϤ āĻāϰāĻŽ āĻĒāĻĄāĻŧā§āĻā§ āϝ⧠āĻŽāĻžāĻĨāĻž āĻāĻžāĻ āĻāϰāĻā§ āύāĻž!
>
> vMAX: āĻāϰ⧠āĻāĻžāĻāϰ⧠āĻāĻžāĻ, āĻāϰāĻŽā§āϰ āϤā§āĻŦā§āϰāϤāĻžāϝāĻŧ āϏāĻŦāĻžāϰāĻ āĻāĻāĻ āĻšāĻžāϞ! āĻŦā§āĻļāĻŋ āĻāϰ⧠āĻĄāĻžāĻŦā§āϰ āĻĒāĻžāύāĻŋ āĻŦāĻž āϏā§āϝāĻžāϞāĻžāĻāύ āĻāĻžāύ, āϰā§āĻĻ āϏāϰāĻžāϏāϰāĻŋ āĻāĻĄāĻŧāĻŋāϝāĻŧā§ āĻāϞā§āύ āĻāϰ āĻĻāϰāĻāĻžāϰ āĻāĻžāĻĄāĻŧāĻž āĻĻā§āĻĒā§āϰā§āϰ āĻĻāĻŋāĻā§ āĻŦāĻžāĻāϰ⧠āĻŦā§āϰ āĻšāĻŦā§āύ āύāĻžāĨ¤ āĻĒāĻžāϰāϞ⧠āĻĢā§āϝāĻžāύā§āϰ āύāĻŋāĻā§ āĻāĻāĻā§ āĻŦāĻŋāĻļā§āϰāĻžāĻŽ āύāĻŋāύ!
</details>
<details>
<summary><b>đģ Technical Help</b></summary>
> User: Nginx Reverse Proxy āĻāύāĻĢāĻŋāĻāĻžāϰā§āĻļāύ SSL āĻāĻŦāĻ WebSocket āϏāĻžāĻĒā§āϰā§āĻ āϏāĻš āϤā§āϰāĻŋ āĻāϰ⧠āĻĻāĻžāĻāĨ¤
>
> vMAX: āύāĻŋāĻā§ Nginx Reverse Proxy āĻāύāĻĢāĻŋāĻāĻžāϰā§āĻļāύ SSL āĻāĻŦāĻ WebSocket āϏāĻžāĻĒā§āϰā§āĻ āϏāĻš-āĻāϰ āϏāĻŽā§āĻĒā§āϰā§āĻŖ āĻāύāĻĢāĻŋāĻāĻžāϰā§āĻļāύ āĻĻā§āĻāϝāĻŧāĻž āĻšāϞā§...
> (provides full nginx config block)
</details>
<details>
<summary><b>đ¤ Life Advice</b></summary>
> User: āĻŦāύā§āϧ⧠āĻāĻžāĻāĻž āϧāĻžāϰ āύāĻŋāϝāĻŧā§ āĻāϰ āĻĢā§āϰāϤ āĻĻāĻŋāĻā§āĻā§ āύāĻž, āĻā§āĻāĻžāĻŦā§ āĻā§āϝāĻŧā§ āύā§āĻāϝāĻŧāĻž āϝāĻžāϝāĻŧ?
>
> vMAX: āĻā§āĻŦāĻ āϏā§āĻĒāϰā§āĻļāĻāĻžāϤāϰ āĻĒāϰāĻŋāϏā§āĻĨāĻŋāϤāĻŋ! āĻāĻĒāύāĻŋ āϏāϰāĻžāϏāϰāĻŋ āϰā§āĻā§ āύāĻž āĻāĻŋāϝāĻŧā§ āϏā§āĻŦāĻžāĻāĻžāĻŦāĻŋāĻāĻāĻžāĻŦā§ āύāĻ āĻĻāĻŋāϝāĻŧā§ āĻŦāϞāϤ⧠āĻĒāĻžāϰā§āύ â 'āĻĻā§āϏā§āϤ, āĻā§āĻŽāύ āĻāĻāĻŋāϏ? āϤā§āĻā§ āĻāĻāĻāĻž āĻāĻĨāĻž āĻŽāύ⧠āĻāϰāĻŋāϝāĻŧā§ āĻĻāĻŋāϤ⧠āĻāĻžāĻā§āĻāĻŋāϞāĻžāĻŽ...'
</details>
---
â ī¸ Limitations
- Model Size â At 270M parameters, this is a compact model. It won't match larger models on complex reasoning tasks.
- Language Scope â Primarily optimized for Bangla (Bengali). English capability is inherited from the base Gemma model but is not the focus.
- Knowledge Cutoff â Knowledge is limited to the base model's training data cutoff.
- Hallucinations â Like all language models, vMAX can generate plausible-sounding but incorrect information.
---
đ License
This model is distributed under the Gemma License. Please review the terms before use.
---
<div align="center">
Made with â¤ī¸ in Bangladesh
Run naimulislam999/vMAX-Bangla-Gemma3-270m-GGUF with guIDE
Download guIDE â the AI-native code editor with local LLM inference and 69 built-in tools.
Source: Hugging Face ¡ Compare models