AGmind/strizh-ru-retriever-GGUF overview
strizh ru retriever GGUF GGUF кванты двуязычного RU+EN эмбеддера strizh ru retriever https://huggingface.co/AGmind/strizh ru retriever для llama.cpp, Vulkan и …
Runs locally from ~25.1 MB disk (4 GB VRAM class GPUs with llama.cpp / guIDE).
Repository Files & Downloads
Model Details
Model README
---
license: apache-2.0
language:
- ru
- en
base_model: AGmind/strizh-ru-retriever
tags:
- gguf
- llama.cpp
- retrieval
- rag
- russian
- english
- bilingual
- embeddings
---
strizh-ru-retriever-GGUF
GGUF-кванты двуязычного (RU+EN) эмбеддера strizh-ru-retriever для llama.cpp, Vulkan и CPU. 4 слоя, mean-pooling, вектор 384, без префиксов.
Кванты
recall@10 на MIRACL-ru (dev), замер через llama-server (Vulkan):
| квант | размер | recall@10 |
|---|---|---|
| F16 | 49 МБ | 0.800 |
| Q8_0 | 27 МБ | 0.800 |
| Q5_0 | 26 МБ | 0.790 |
| Q4_0 | 25 МБ | 0.785 |
Квантизация почти не влияет на качество. Q8_0 — рабочий выбор.
Запуск
llama-server -m strizh-ru-retriever.Q8_0.gguf --embeddings --pooling mean -c 8192
curl -s http://127.0.0.1:8080/v1/embeddings \
-H "Content-Type: application/json" \
-d '{"input":["текст на русском","text in english"]}'
Нормализуйте вектор (L2) на клиенте перед косинусным сравнением.
Параллельная нагрузка (AMD Strix Halo)
Одна коробка (Ryzen AI Max, Vulkan) даёт ~2500–3700 эмб/с при 16–64 запросах, p95 < 14 мс; sustained 60с — 4771 эмб/с. Один инстанс — <1 ГБ VRAM.
Полное описание и метрики RU/EN/mixed — в strizh-ru-retriever.
Лицензия
apache-2.0. База deepvk/RuModernBERT-small.
Run AGmind/strizh-ru-retriever-GGUF with guIDE
Download guIDE — the AI-native code editor with local LLM inference and 69 built-in tools.
Source: Hugging Face · Compare models