阿里发布Qwen3.8-Omni-Flash全模态模型:音能力提升

发布时间:2026-09-18 12:39

  阿里千问今日正式上线新一代原生全模态模型 Qwen3.8-Omni-Flash,并已在千问 AI 平台提供。该模型可同时处理文本、图像、音频和输入,支持 1M 上下文。

  全模态模型指可同时处理文本、图像、音频、等多种输入形式。官方称,该模型在保持同尺寸文本模型能力的同时,全模态能力较上一代明显提升。

  官方称,其音能力接近 Gemini 3.8 Flash,音频能力整体超过 Gemini 3.8 Flash。API 每小时音频输入价格降幅超过 98%,每小时音输入价格降幅超过 93%。

  为支持长音,官方扩展了 Qwen-MM-Plugins,并开源 Qwen-Live Harness。前者面向长程工作流的按需感知、工具调用与执行,后者面向实时、持续的全模态交互。

  长音理解方面,模型支持按需描述、Agentic 主动取证、会议任务推进和深度研究报告。可控音 Caption 可指定描述对象、时间范围、信息粒度和输出格式。

  会议场景中,模型支持最长一小时音输入,可完成说话人切分、内容转录与身份对应,生成会议纪要和待办事项,并分析项目风险。结合工具调用,还可发送邮件、整理任务或编码。

  音生产方面,Music2MV 可理解歌曲结构、节奏与情绪,输出带时间戳的句级歌词。短剧翻译可完成角色识别、口语化翻译、角色克隆配音、音轨重混与成片质检。

  长电影解说中,用户提供影片和一句话需求,Agent 可完成全模态理解、关键情节提炼、解说规划、配音配乐、剪辑渲染与成片质检。

  实时版 Qwen3.8-Omni-Flash-Realtime 可在音流输入同时完成感知与响应,并结合实时上下文调用工具。它还支持实时口语陪练,联合建模发音与语义,理解受口音影响的非标准表达。

  官方称,该实时版是首个支持“听声辨位”的全模态大模型,融合空间声音与

  官方同时公布了 Qwen3.8-Omni-Flash-Realtime API 在不同输入场景下的实际吞吐与延迟性能信息以及完整性能测试结果。

排行

精选