Jetson Audio Service

Speech-to-Text (Whisper)

Select model size based on accuracy vs speed tradeoff.
Splits audio on silence for better transcription of long recordings.

Text-to-Speech (Qwen3 Cloning)

TTS Model:
Select a speaker voice reference. Auto-detects Chinese vs English if not specified.
Speech speed multiplier (0.5 = slow, 2.0 = fast).