GraySoft
Projects Models Compare Cloud benchmarks FAQ Download guIDE →
Model Intelligence Sheet

voconly/parakeet-tdt-0.6b-v3-gguf overview

Parakeet TDT 0.6B v3 GGUF NVIDIA 推出的高效时间依赖转录 TDT 多语言语音识别模型,第三代版本,专注于欧洲语言。 模型简介 NVIDIA Parakeet TDT Time Delay Transformer 是采用时间依赖架构的多语言语音识别模型: 参数量 :0.6B 600M 版…

ggufasrautomatic-speech-recognitionnvidiaparakeettdtmultilingualeuropean-languagesspeech-to-textendefresitptnlruukplcsskhurobg

Runs locally from ~462.9 MB disk (4 GB VRAM class GPUs with llama.cpp / guIDE).

Downloads
0
Likes
0
Pipeline
automatic-speech-recognition
Author

Repository Files & Downloads

4 GGUF files detected
Direct downloads for local inference
FileTypeQuantizationSizeLink
parakeet-tdt-0.6b-v3-Q4_K_M.ggufGGUFQ4_K_M462.9 MBDownload
parakeet-tdt-0.6b-v3-Q5_K_M.ggufGGUFQ5_K_M523.5 MBDownload
parakeet-tdt-0.6b-v3-Q6_K.ggufGGUFQ6_K582.1 MBDownload
parakeet-tdt-0.6b-v3-Q8_0.ggufGGUFQ8_0705.3 MBDownload

Model Details

Model IDvoconly/parakeet-tdt-0.6b-v3-gguf
Authorvoconly
Pipelineautomatic-speech-recognition
Licensecc-by-4.0
Base modelnvidia/parakeet-tdt-0.6b-v3
Last modified2026-07-22T14:08:06.000Z

Model README

---

license: cc-by-4.0

language:

  • en
  • de
  • fr
  • es
  • it
  • pt
  • nl
  • ru
  • uk
  • pl
  • cs
  • sk
  • hu
  • ro
  • bg
  • hr
  • sl
  • sr
  • el
  • da
  • sv
  • fi
  • et
  • lv
  • lt
  • mt

tags:

  • asr
  • automatic-speech-recognition
  • nvidia
  • parakeet
  • tdt
  • gguf
  • multilingual
  • european-languages
  • speech-to-text

base_model:

  • nvidia/parakeet-tdt-0.6b-v3

---

Parakeet TDT 0.6B v3 GGUF

NVIDIA 推出的高效时间依赖转录 (TDT) 多语言语音识别模型,第三代版本,专注于欧洲语言。

模型简介

NVIDIA Parakeet TDT (Time-Delay Transformer) 是采用时间依赖架构的多语言语音识别模型:

  • 参数量:0.6B (600M)
  • 版本:v3 (第三代)
  • 语言支持:25种欧洲语言
  • 量化格式:GGUF (llama.cpp 兼容)
  • 特点:TDT架构、高准确率、快速推理、欧洲语言专项优化
  • 适用场景:欧洲语言语音转写、语音命令识别、字幕生成

支持语言 (25种欧洲语言)

| 语言 | 代码 | 语言 | 代码 | 语言 | 代码 |

|------|------|------|------|------|------|

| 英语 | en | 德语 | de | 法语 | fr |

| 西班牙语 | es | 意大利语 | it | 葡萄牙语 | pt |

| 荷兰语 | nl | 俄语 | ru | 乌克兰语 | uk |

| 波兰语 | pl | 捷克语 | cs | 斯洛伐克语 | sk |

| 匈牙利语 | hu | 罗马尼亚语 | ro | 保加利亚语 | bg |

| 克罗地亚语 | hr | 斯洛文尼亚语 | sl | 塞尔维亚语 | sr |

| 希腊语 | el | 丹麦语 | da | 瑞典语 | sv |

| 芬兰语 | fi | 爱沙尼亚语 | et | 拉脱维亚语 | lv |

| 立陶宛语 | lt | 马耳他语 | mt | - | - |

可用量化版本

| 文件名 | 量化类型 | 文件大小 | 说明 |

|--------|----------|----------|------|

| parakeet-tdt-0.6b-v3-Q4_K_M.gguf | Q4_K_M | ~最小 | 推荐日常使用 |

| parakeet-tdt-0.6b-v3-Q5_K_M.gguf | Q5_K_M | ~小 | 平衡精度 |

| parakeet-tdt-0.6b-v3-Q6_K.gguf | Q6_K | ~中 | 更高精度 |

| parakeet-tdt-0.6b-v3-Q8_0.gguf | Q8_0 | ~中高 | 最高量化精度 |

> 注意:F16/F32 版本已排除,推荐使用量化版本。

使用方法

llama.cpp 命令行

./main -m parakeet-tdt-0.6b-v3-Q4_K_M.gguf -f audio.wav --output-txt

Python (llama-cpp-python)

from llama_cpp import Llama

llm = Llama(
    model_path="parakeet-tdt-0.6b-v3-Q4_K_M.gguf",
    n_gpu_layers=-1,
)

result = llm.transcribe("audio.wav")
print(result["text"])

TDT 架构特点

Parakeet TDT 采用时间延迟Transformer架构,具有以下优势:

  1. 时间建模能力强:更好地捕捉语音的时序特征
  2. 长音频处理:对长音频有更好的处理能力
  3. 快速推理:优化的架构设计,推理速度更快
  4. 准确率高:在多个基准测试中表现优异

性能基准

| 测试集 | WER (词错误率) |

|--------|----------------|

| LibriSpeech test-clean | ~3-4% |

| LibriSpeech test-other | ~7-8% |

技术规格

  • 架构:Time-Delay Transformer
  • 采样率:16kHz
  • 输入格式:WAV/PCM 音频
  • 推理速度:快速 (具体取决于硬件)

许可证

CC BY 4.0 License

致谢

Run voconly/parakeet-tdt-0.6b-v3-gguf with guIDE

Download guIDE — the AI-native code editor with local LLM inference and 69 built-in tools.

Download guIDE → · Browse 524k+ models · Compare models

Source: Hugging Face · Compare models