美股资讯

 

美股投资网获悉,近日,Meta(META)旗下超级智能实验室(Superintelligence Labs)正式推出实时语音识别模型Muse Voice Transcribe。该模型在部分基准测试中超越OpenAI、谷歌(GOOGL)等竞争对手的同类产品,并以每小时0.18美元的API价格进入市场。不过,Meta方面确认,该模型不会开放权重。

据了解,在Artificial Analysis的AA-WER Streaming英语语音转写准确率基准上,Muse Voice Transcribe的词错率为3.1%,优于Cartesia Ink-2的3.4%、ElevenLabs Scribe v2 Real-time的3.6%、OpenAI GPT Live Transcribe的3.9%以及谷歌Gemini 3.5 Transcribe Live的4.0%。

在说话人区分能力上,各模型整体表现仍难令用户满意,但Muse Voice Transcribe在多个标准基准中的平均错误率为17.5%,同样处于领先位置。

据Meta介绍,该模型可区分超过20位说话人,并支持超过70种语言,其中25种经过“广泛验证”,还能处理多语者在对话中切换语言以及超过一小时的长时间对话。

Muse Voice Transcribe目前已通过Meta Model API、Meta AI for Mac和Muse Code提供。API定价为每1000音频分钟3美元,折合每小时0.18美元。与Meta此前Muse Glimmer系列开放权重的做法不同,Meta发言人向The New Stack确认,该模型不会公开权重。

技术层面,Muse Voice Transcribe属于Muse Spark家族的自回归多模态模型。音频以80毫秒为单位输入,每秒约12.5个块,每块被压缩为单个软token。模型在每个块上做出选择要么输出文本token,要么输出特殊的“下一音频”占位符,等待更多音频上下文。当音频结束时,“空音频”令牌会触发模型输出剩余文本。

这种机制使模型能自行控制延迟,Meta称之为“自适应延迟”。简单词汇几乎可以即时转写,复杂词汇则获得更多音频上下文。该权衡在强化学习阶段被训练,词错率奖励与延迟奖励采用相乘而非相加的方式优化。说话人识别也使用类似机制。

今夏,实时语音转写已成为AI领域竞争最激烈的细分市场之一。近期OpenAI、谷歌、xAI、阿里巴巴(BABA)等公司均在数周内密集发布流式语音模型,专业厂商也已深耕多时。而Muse Voice Transcribe目前0.3个百分点的基准领先优势,在这种竞争强度下很难长期保持。

不过,对Meta而言,智能眼镜、Mac应用等核心产品都需要实时语音能力作为底层支撑。这一内生需求可能促使Meta在该赛道持续投入,而非仅追求外部API市场份额。

最专业的美股资讯,推荐美股大数据 https://Stockwe.com/

如何识别美股市场异常波动?美国机构主力资金买卖情况,出货和吸筹,使用美股投资网VIP会员,2008年成立于美国硅谷,由前纽约证券交易所分析师Ken创立,联合多位摩根斯坦利分析师,谷歌 Meta工程师利用AI和大数据,配合十多年美股实战经验和业内量化模型,建立了一个股市数据库 https://StockWe.com/ 每天处理千万级股票数据:捕捉期权大单,实时主力资金流向、机构持仓变化、川普突发新闻,精准交易信号第一时间发到您手机APP!

 

Fullscreen Image