SeedRealtime 用统一架构原生融合音频、与文本,能在连续的多模态信息流上实时交互,带来“边看、边听、边说”的全新体验。它实现了以下三项核心突破:
原生支持声音、画面与时序信息的深度融合。模型既能结合场景消解同音词歧义,也能准确理解
具备持续的环境感知与主动表达能力。模型能在察觉画面状态变化时主动提醒,并能调用工具融入表达,让交互从被动响应升级为主动协作。
能够实时感知用户的对话状态与交流节奏,在适当时机自然接话、停顿与回应;同时具备较强的抗干扰能力,能分辨旁人闲聊与背景噪声,不因干扰误触发,保持沟通的流畅连贯。
端到端人工评测结果显示,相比级联模型,SeedRealtime 的音对话节奏问题减少了一半 —— 模型对说话时机的把握更加自然,“话未说完被抢断、话音已落却回应迟缓、或是被背景杂音与闲聊误触发”等卡壳现象显著减少;同时,单次对话能够完整、顺畅交流的概率也有明显提升。
,在业界率先实现了音全双工技术的规模化落地。将豆包 App 更新至最新版本,在对话框内选择“打电话”,进入通话界面体验即可。附项目主页地址:
母亲911录音:“有人偷了我的车,我两岁女儿还在里面!”警方15分钟解救,女孩裙扣却被解开
周星驰的剧组,有个不成文的规矩,但没人敢破。吃饭时,场工扯着嗓子喊:“跑龙套的先吃!不限量,热乎的!”
Vita 胡志斌/沈洪兵/林苑团队绘制孕期血浆代谢物基因组图谱,系统揭示妊娠期代谢调控的遗传基础










