GraySoft
Projects Models Compare Cloud benchmarks FAQ Download guIDE →
Model Intelligence Sheet

AGmind/strizh-ru-retriever-GGUF overview

strizh ru retriever GGUF GGUF кванты двуязычного RU+EN эмбеддера strizh ru retriever https://huggingface.co/AGmind/strizh ru retriever для llama.cpp, Vulkan и …

ggufllama.cppretrievalragrussianenglishbilingualembeddingsruenbase_model:AGmind/strizh-ru-retrieverbase_model:quantized:AGmind/strizh-ru-retrieverlicense:apache-2.0endpoints_compatibleregion:usfeature-extraction

Runs locally from ~25.1 MB disk (4 GB VRAM class GPUs with llama.cpp / guIDE).

Downloads
0
Likes
0
Pipeline
Author

Repository Files & Downloads

4 GGUF files detected
Direct downloads for local inference
FileTypeQuantizationSizeLink
strizh-ru-retriever.F16.ggufGGUFGGUF49.3 MBDownload
strizh-ru-retriever.Q4_0.ggufGGUFGGUF25.1 MBDownload
strizh-ru-retriever.Q5_0.ggufGGUFGGUF25.7 MBDownload
strizh-ru-retriever.Q8_0.ggufGGUFGGUF27.5 MBDownload

Model Details

Model IDAGmind/strizh-ru-retriever-GGUF
AuthorAGmind
Pipeline
Licenseapache-2.0
Base modelAGmind/strizh-ru-retriever
Last modified2026-07-22T19:27:55.000Z

Model README

---

license: apache-2.0

language:

  • ru
  • en

base_model: AGmind/strizh-ru-retriever

tags:

  • gguf
  • llama.cpp
  • retrieval
  • rag
  • russian
  • english
  • bilingual
  • embeddings

---

strizh-ru-retriever-GGUF

GGUF-кванты двуязычного (RU+EN) эмбеддера strizh-ru-retriever для llama.cpp, Vulkan и CPU. 4 слоя, mean-pooling, вектор 384, без префиксов.

Кванты

recall@10 на MIRACL-ru (dev), замер через llama-server (Vulkan):

| квант | размер | recall@10 |

|---|---|---|

| F16 | 49 МБ | 0.800 |

| Q8_0 | 27 МБ | 0.800 |

| Q5_0 | 26 МБ | 0.790 |

| Q4_0 | 25 МБ | 0.785 |

Квантизация почти не влияет на качество. Q8_0 — рабочий выбор.

Запуск

llama-server -m strizh-ru-retriever.Q8_0.gguf --embeddings --pooling mean -c 8192
curl -s http://127.0.0.1:8080/v1/embeddings \
  -H "Content-Type: application/json" \
  -d '{"input":["текст на русском","text in english"]}'

Нормализуйте вектор (L2) на клиенте перед косинусным сравнением.

Параллельная нагрузка (AMD Strix Halo)

Одна коробка (Ryzen AI Max, Vulkan) даёт ~2500–3700 эмб/с при 16–64 запросах, p95 < 14 мс; sustained 60с — 4771 эмб/с. Один инстанс — <1 ГБ VRAM.

Полное описание и метрики RU/EN/mixed — в strizh-ru-retriever.

Лицензия

apache-2.0. База deepvk/RuModernBERT-small.

Run AGmind/strizh-ru-retriever-GGUF with guIDE

Download guIDE — the AI-native code editor with local LLM inference and 69 built-in tools.

Download guIDE → · Browse 524k+ models · Compare models

Source: Hugging Face · Compare models