Qwen3-TTS、10 RPSで初音声50ms未満を実測
これは何?Qwen3-TTSは文章と話者指定から音声を生成するmodelで、対話serviceでは最初の音が届くまでの待ち時間と途切れない再生が重要です。
Nari LabsはQwen3-TTS 1.7B CustomVoiceを単一のNVIDIA H100で動かし、10 RPS時の95percentileで最初の音声まで50ms未満、再生中のunderrunなしを報告しました。Talker、Code Predictor、Codecを一つのschedulerで扱い、初音声を優先した後は再生deadlineを守るbatching、CUDA graph、専用Triton kernel、codec state cacheを組み合わせています。約2 dollar per million charactersという試算はfull utilization前提で、network、idle time、運用費や品質比較は含みません。
音声AIの体感速度はmodel単体のtoken速度では決まらず、初音声と継続再生をどうscheduleするかに左右されます。導入判断では公開benchmarkの負荷条件を合わせ、latency、underrun、音質、idle costを分けて測る必要があります。
- 読むべき人
- 音声AI、real-time inference、GPU serving、対話productの担当者
- HN
- 138 points / 33 comments