幻兹快讯
Meta发布首个实时音频感知模型Muse Voice Transcribe
幻兹快讯
2026年09月02日
阅读 45 次

2026年9月1日,Meta公司正式推出Muse Voice Transcribe——其首个实时音频感知模型。该模型支持流式语音识别、说话人分离与端点检测,可在用户说话过程中同步输出文字,延迟低至毫秒级。开发者可通过Meta Model API调用,定价为每1000分钟音频3美元(约20.2元人民币)。模型覆盖70余种语言,25种已验证,支持超1小时音频及多语种自然切换,并采用自适应延迟机制动态平衡速度与准确率。Meta称其当前位居Artificial Analysis流式语音转文本排行榜首位。

Copyright © 幻兹网 All Rights Reserved粤ICP备2026034579号粤公网安备44030002012995号