云知声:语音大模型U2-ASR与U2-TTS全面升级

发布时间:2026-07-28 08:27

  云知声发布公告,近日,公司全面完成U2-ASR与U2-TTS的能力升级,持续加强多模态大模型能力,在语音大模型领域实现从“百种方言”的本土深耕到“全球多语种”的广阔拓展,进一步夯实了全球化语音交互基础设施能力,为跨境出海、具身智能及Agent交互等场景提供高效、低门槛的技术支撑。

  本次升级中,U2-ASR新增13种国际语言识别能力,覆盖欧洲、东南亚、中东及拉美等重点出海市场;U2-TTS新增8种东南亚语言语音合成能力。至此,U2语音大模型已支持超100种中国方言及超15种国际语言,企业只需接入一个模型、一套接口,即可处理不同语言的音频内容,大幅降低多语种语音业务的开发、部署和维护门槛。

  在统一评测口径下,U2-ASR与业界标杆模型对比表现卓越:113种语言平均字错率仅为6.58%,在不传入语种标签的真实业务场景中,凭借自动语种识别与闭集路由能力依然保持高准确率,有效避免语种误判。与此同时,在 ChinaVoices Challenge 2026中文多方言语音识别挑战赛中,U2-ASR以CER 9.235% 获得限定数据方案第1名、开放数据方案第2名的双榜领先成绩,进一步验证了其语音识别技术的领先性。U2-TTS在可懂度与自然度主观评测中综合表现领先业界主流模型,并採用流式神经网络声学模型实现逐chunk实时输出24kHz高保真语音,首包延迟显着降低,满足实时语音对话等强时效交互需求。

  此次升级使U2-ASR与U2-TTS能够无缝协同,为企业构建面向智能体的完整多语种语音交互链路,语音技术正逐步成为全球化业务的核心交互基础设施。目前,升级后的U2-ASR与U2-TTS已全量上线公司TokenHub大模型服务平台并开放标准API。公司将持续践行“智能向善”理念,以科技之力打破语言壁垒,推动AI技术普惠共享,使不同国家、不同发展阶段的地区均能平等享受 AGI时代的技术红利。

排行

精选