shannonkun author hub
Выход за пределы 128 токенов резко снижает качество, так как в этом gguf не активирован механизм sparse attention. Исправление требует принятие патча и пересоздание gguf: https://github.com/ggml org/llama.cpp/pull/21161 Запускать лучше с шаблоном чата: .\llama server m "rugpt3xl…
Models
2
Downloads
630
Run models locally with guIDE
Download guIDE — the AI-native code editor with local LLM inference and 69 built-in tools.