Meta发布首个实时音频感知AI模型,支持20余人分轨转写

发布时间:2026-09-02 11:28

  开发者可通过 Meta Model API 调用该能力,定价为每 1000 分钟音频 3 美元,等同每小时 0.18 美元。

  该模型在同一流程中整合流式自动语音识别、说话人分离与端点检测,用户说话时,系统可同步输出文字,无需等待完整录音结束后再单独处理。

  注:“流式”就是边说边转写,模型不必等整段音频说完才出结果,而是会一小段一小段持续输出文字,所以延迟更低,适合实时听写、会议记录、通话字幕。

  Muse Voice Transcribe 可在包含 20 余名说话者的录音中分离不同发言者,还能识别说话是否结束,从而自动确定一段输入的边界。

  模型训练覆盖 70 余种语言,其中 25 种语言在发布时完成验证。该模型支持长度超过 1 小时的音频,也支持句内或句间的自然语言切换。开发者还可通过语言、关键词和上下文偏置,提高特定语言、术语或场景下的识别效果。

  在技术方面,Meta 为兼顾实时响应和识别准确度,引入名为自适应延迟的动态决策机制。系统不会为所有词语采用固定的速度与准确度取舍,而是针对每个词判断需要额外接收多少音频后再输出识别结果。

  对于较容易识别的语音,系统可更快提交转写结果。对于发音不清、术语较多或语境复杂的词语,系统会调用更多前后文音频信息。这种机制旨在兼顾。

  特别

  “韦东奕这么牛,为啥没女孩子喜欢他呢?”女儿白了我一眼说:“别的先不讲,要是有人能把这三点都接纳了,我不光服,还得佩服。”

  美国中央司令部确认了:美军完成一轮约6.5小时的针对伊朗军事目标袭击,袭击覆盖伊朗革命卫队防空、雷达、海上遗产设施等目标

  网友称苏州体育中心拼盘演唱会2小时休息了80分钟,主办方辟谣并公布演出数据:系恶意计算,四艺人演唱时长共计超2小时,将起诉造谣账号

排行

精选