LLM vs CosyVoice vs Qwen3-TTS 流式性能对比 spark-4c47

左上:Qwen3.6-35B-A3B-NVFP4(vLLM)· 关注 首 token / TPS  |  右上:Fun-CosyVoice3-0.5B(vLLM 加速)· 关注 首包 / 生成时间 / 权重带宽  |  下方:Qwen3-TTS-12Hz-1.7B-Base(faster-qwen3-tts · CUDA Graphs)
各栏两个按钮:单路运行、3 并发运行(同一时刻 3 路请求;CosyVoice 侧有 3 路闸门,超出返回 429;Qwen3-TTS 为单流 CUDA Graphs,服务端逐条串行,3 并发时第 2/3 路首包会排队变长)。带宽为估算口径:引擎生成 token 数 × 每步权重字节(CosyVoice bf16 0.5B ≈ 740MB / vLLM 批处理共享为上限值;Qwen3-TTS 1.7B bf16 ≈ 3.4GB,单流无批处理)。
/api/llm/v1/chat/completions · stream · 首 token = 首个正文增量
就绪
首 token (TTFT)
TPS(tok/s)
总输出 token
累计输出 token(每路一条线,斜率 = 实时 TPS)
/api/cosy/v1/audio/speech · 流式 PCM 24kHz · 首包 = 首个音频块
就绪
首包 TTFB
生成时间
带宽估算 GB/s
累计音频秒数(每路一条线,斜率 = 实时 RTF)
权重带宽估算 GB/s(每 0.6s 采样一次,按 token 增量折算)
/api/qwen3tts/v1/audio/speech · 流式 PCM 24kHz · 首包 = 首个音频块(q-vivian 为 chunk_size=4,首包更快)· 单流服务:3 并发时逐条串行排队,第 2/3 路首包含排队时间
就绪
首包 TTFB
生成时间
带宽估算 GB/s
累计音频秒数(每路一条线,斜率 = 实时 RTF)
实测基线(GB10 空载):CosyVoice3-vLLM x1 首包 2.15s / RTF 2.3x;x2 2.70s / 1.51x;x3 3.41s / 1.21x;x4 起跌破 1x。Qwen3-TTS-1.7B(faster-qwen3-tts,chunk_size=4)x1 warmed 首包 ~0.3s / RTF ~1.35x,单流串行。Qwen3.6 NVFP4 5 路混合 ~86-90 tok/s。本页带宽为模型自身权重带宽估算,非全机内存总线实测值(GB10 不暴露带宽计数器)。