voconly/parakeet-tdt-0.6b-v3-gguf overview
Parakeet TDT 0.6B v3 GGUF NVIDIA 推出的高效时间依赖转录 TDT 多语言语音识别模型,第三代版本,专注于欧洲语言。 模型简介 NVIDIA Parakeet TDT Time Delay Transformer 是采用时间依赖架构的多语言语音识别模型: 参数量 :0.6B 600M 版…
Runs locally from ~462.9 MB disk (4 GB VRAM class GPUs with llama.cpp / guIDE).
Repository Files & Downloads
Model Details
| Model ID | voconly/parakeet-tdt-0.6b-v3-gguf |
|---|---|
| Author | voconly |
| Pipeline | automatic-speech-recognition |
| License | cc-by-4.0 |
| Base model | nvidia/parakeet-tdt-0.6b-v3 |
| Last modified | 2026-07-22T14:08:06.000Z |
Model README
---
license: cc-by-4.0
language:
- en
- de
- fr
- es
- it
- pt
- nl
- ru
- uk
- pl
- cs
- sk
- hu
- ro
- bg
- hr
- sl
- sr
- el
- da
- sv
- fi
- et
- lv
- lt
- mt
tags:
- asr
- automatic-speech-recognition
- nvidia
- parakeet
- tdt
- gguf
- multilingual
- european-languages
- speech-to-text
base_model:
- nvidia/parakeet-tdt-0.6b-v3
---
Parakeet TDT 0.6B v3 GGUF
NVIDIA 推出的高效时间依赖转录 (TDT) 多语言语音识别模型,第三代版本,专注于欧洲语言。
模型简介
NVIDIA Parakeet TDT (Time-Delay Transformer) 是采用时间依赖架构的多语言语音识别模型:
- 参数量:0.6B (600M)
- 版本:v3 (第三代)
- 语言支持:25种欧洲语言
- 量化格式:GGUF (llama.cpp 兼容)
- 特点:TDT架构、高准确率、快速推理、欧洲语言专项优化
- 适用场景:欧洲语言语音转写、语音命令识别、字幕生成
支持语言 (25种欧洲语言)
| 语言 | 代码 | 语言 | 代码 | 语言 | 代码 |
|------|------|------|------|------|------|
| 英语 | en | 德语 | de | 法语 | fr |
| 西班牙语 | es | 意大利语 | it | 葡萄牙语 | pt |
| 荷兰语 | nl | 俄语 | ru | 乌克兰语 | uk |
| 波兰语 | pl | 捷克语 | cs | 斯洛伐克语 | sk |
| 匈牙利语 | hu | 罗马尼亚语 | ro | 保加利亚语 | bg |
| 克罗地亚语 | hr | 斯洛文尼亚语 | sl | 塞尔维亚语 | sr |
| 希腊语 | el | 丹麦语 | da | 瑞典语 | sv |
| 芬兰语 | fi | 爱沙尼亚语 | et | 拉脱维亚语 | lv |
| 立陶宛语 | lt | 马耳他语 | mt | - | - |
可用量化版本
| 文件名 | 量化类型 | 文件大小 | 说明 |
|--------|----------|----------|------|
| parakeet-tdt-0.6b-v3-Q4_K_M.gguf | Q4_K_M | ~最小 | 推荐日常使用 |
| parakeet-tdt-0.6b-v3-Q5_K_M.gguf | Q5_K_M | ~小 | 平衡精度 |
| parakeet-tdt-0.6b-v3-Q6_K.gguf | Q6_K | ~中 | 更高精度 |
| parakeet-tdt-0.6b-v3-Q8_0.gguf | Q8_0 | ~中高 | 最高量化精度 |
> 注意:F16/F32 版本已排除,推荐使用量化版本。
使用方法
llama.cpp 命令行
./main -m parakeet-tdt-0.6b-v3-Q4_K_M.gguf -f audio.wav --output-txt
Python (llama-cpp-python)
from llama_cpp import Llama
llm = Llama(
model_path="parakeet-tdt-0.6b-v3-Q4_K_M.gguf",
n_gpu_layers=-1,
)
result = llm.transcribe("audio.wav")
print(result["text"])
TDT 架构特点
Parakeet TDT 采用时间延迟Transformer架构,具有以下优势:
- 时间建模能力强:更好地捕捉语音的时序特征
- 长音频处理:对长音频有更好的处理能力
- 快速推理:优化的架构设计,推理速度更快
- 准确率高:在多个基准测试中表现优异
性能基准
| 测试集 | WER (词错误率) |
|--------|----------------|
| LibriSpeech test-clean | ~3-4% |
| LibriSpeech test-other | ~7-8% |
技术规格
- 架构:Time-Delay Transformer
- 采样率:16kHz
- 输入格式:WAV/PCM 音频
- 推理速度:快速 (具体取决于硬件)
许可证
CC BY 4.0 License
致谢
- 原始模型:nvidia/parakeet-tdt-0.6b-v3
- GGUF转换:由 voconly 团队完成
Run voconly/parakeet-tdt-0.6b-v3-gguf with guIDE
Download guIDE — the AI-native code editor with local LLM inference and 69 built-in tools.
Source: Hugging Face · Compare models