Meta 发布首个实时音频感知 AI 模型,支持 20 余人分轨转写
IT之家 9 月 2 日消息,科技媒体 9to5Mac 昨日(9 月 1 日)发布博文,报道称 Meta 公司推出 Muse Voice Transcribe,这是其首个实时音频感知模型。开发者可通过 Meta Model API 调用该能力,定价为每 1000 分钟音频 3 美元(现汇率约合 20.2 元人民币),等同每小时 0.18 美元(现汇率约合 1.2 元人民币)。该模型在同一流程中整合流式自动语音识别、说话人分离与端点检测,用户说话时,系统可同步输出文字,无需等待完整录音结束后再单独处理。IT之家注:“流式”就是边说边转写,模型不必等整段音频说完才出结果,而是会一小段一小段持续输出文字,所以延迟更低,适合实时听写、会议记录、通话字幕。Muse Voice Transcribe 可在包含 20 余名说话者的录音中分离不同发言者,还能识别说话是否结束,从而自动确定一段输入的边界。模
原文:IT之家