语音与实时智能体最低延迟推理 API:以首 token 延迟(TTFT)为先的基准评测

💡 灵机 AI 深度洞见与核心提炼
语音智能体的真实体验取决于首句延迟(TTFS)而非首 token 延迟(TTFT),后者仅标记生成开始,TTS 模型需等完整句子才能发声。评测覆盖 LLM、STT、TTS 及语音到语音全链路,并给出各层延迟预算:STT 约 100-200ms、LLM 300-500ms、TTS 100-200ms,端到端目标 700ms-1.2s。
信源媒体:MarkTechPost(RSS)
访问出处网页 ↗