2026年9月23日,千问正式发布Qwen-Audio-3.1系列语音大模型。本次共推出5款新模型,覆盖语音识别(ASR)、语音合成(TTS)、实时交互(Realtime)及全新音频理解(ASR-Next)与音频创作(TTS-Next)能力。模型支持30种语言、16种中文方言,具备结构化转写、情绪识别、多角色音色一致生成及全双工实时对话等能力。全线模型价格大幅下调,ASR降幅达95%,TTS降约70%,Realtime降约85%。新模型已接入千问AI眼镜等智能硬件及办公Agent场景。