Jetson Audio Service
X-API-Key:
Speech-to-Text (Whisper)
Upload Audio File:
Whisper Model Size:
tiny (fastest, least accurate)
base
small
medium (recommended)
large (slowest, most accurate)
Select model size based on accuracy vs speed tradeoff.
Enable Smart Split (Better for long files/podcasts)
Splits audio on silence for better transcription of long recordings.
Transcribe Audio
Transcription:
Text-to-Speech (Qwen3 Cloning)
TTS Model:
1.7B (Better quality, default)
0.6B (Faster, less memory)
Input Text (Auto-detects CN/EN):
Speaker Reference (Optional):
Auto-detect (Chinese/English)
speaker01 (Default Chinese)
speaker_en (English)
speaker_zh_mandarin (Mandarin Chinese)
speaker_zh_yue (Cantonese)
Select a speaker voice reference. Auto-detects Chinese vs English if not specified.
Speed:
Speech speed multiplier (0.5 = slow, 2.0 = fast).
Synthesize Voice
Generated Audio:
Download .wav