2026年6月,英伟达推出Audex(Nemotron-Labs-Audex-30B-A3B)统一音频-文本大语言模型。该模型总参数300亿,激活参数仅30亿,基于混合Mamba-Transformer骨干架构,支持音频理解与生成。其通过AF-Whisper编码器处理16kHz音频,结合X-Codec2/X-Codec实现语音与非语音音频编解码,并将音频标记与文本标记统一嵌入空间。设计目标为避免多模态扩展导致文本能力退化;实测显示其在MMLU-Redux和IMO AnswerBench上优于基线模型。