7月31日,字节跳动正式发布新一代创作模型 Seedance 2.5。字节跳动表示,Seedance 2.0 发布后,用户对创作模型的期待正在从“生成一个片段”走向“完成一段创作”。Seedance 2.5 延续了 Seedance 2.0 统一的多模态音联合生成架构,重点突破长叙事能力、多模态参考能力和
单次生成时长达 30 秒,支持多轮延长:Seedance 2.5 可单次生成 30 秒高质量片段,并支持多轮延长。同时,模型优化了镜头衔接和场景过渡,让长保持更好的连贯性。模型还大幅优化了画质、音质以及运动质量,并有效弱化了生成中常见的“油腻感”。用户可以生产数分钟具有统一视听语言、高质量的连贯内容,精彩故事一次呈现。
多模态参考能力全面升级:Seedance 2.5 支持用户单次输入最多 30 张、10 段、10 段音频作为参考素材。模型还提升了白模参考、运动参考、创意参考等各类参考能力,使模型能更好地理解创作意图,实现多主体、多场景、多镜头变化的复杂创意。
更精准、稳定的
凭借长叙事、多模态参考、
Seedance 2.5 将单次生成时长从 15 秒提升至 30 秒,同时进一步提升长中的叙事能力。模型可以在 30 秒内组织多个有逻辑关联的镜头,让故事从铺垫、推进、转折到收尾逐步展开,而不是简单延续一个画面。比如创作一段歌手一镜到底上台演出的片段,模型演绎了歌手在化妆间与工作人员互动后,穿过后台走廊与伴舞相遇并一起登台演出的完整故事,而非仅歌手上台的画面。
凭借模型的多轮延长能力,用户能在已有的结果上自然衔接后续镜头,并在延长过程中保持主体特征、场景环境和叙事节奏的连贯,最终生成数分钟具有统一视听语言的连贯内容,减少拆分镜头、反复拼接和处理衔接的成本。
在画面呈现上,模型能更好地做到自然的运镜衔接,主体在多次切镜中仍保持稳定,音画始终对齐,使长生成结果更连贯。比如在一段京剧表演中,镜头伴随主角水袖甩动完成一次优雅的环绕运镜,主体和背景的呈现始终保持一致。水袖在空中的摆动形成自然的弧线,更遵循物理规律。
此外,针对生成中常见的“油腻感”问题,Seedance 2.5 对物体材质、人物肤质与眼神、光影、画面饱和度等细节进行系统优化。模型还减少了字幕与背景音乐不受控的情况,使成片更接近实拍的影视质感。
Seedance 2.5 进一步强化多模态参考能力,支持用户单次输入最多 30 张、10 段和 10 段音频作为参考素材。更多数量、不同类型的参考素材,能更好的还原用户脑海中的创意,生成主体更多、场景更丰富、镜头变化更灵活的复杂内容。
模型能综合理解不同素材中的画面构图、场景、风格、人物、道具等元素,并按指令将这些参考素材用于生成。在多人同框、群像叙事等复杂场景中,也能同时还原多个人物的形象与声音,保持各主体特征稳定。
此外,模型还提升了白模参考、运动参考、创意参考等各类参考能力,让画面中的主体、动作、运镜更可控。比如,在白模参考中,用户可以用无纹理 3D 模型搭出画面的空间结构、主体姿态、运动轨迹和镜头机位,再让模型参考这套结构生成,使复杂镜头的构图和调度更接近预期。同时,模型还增强了光照控制能力,通过白模的空间信息,生成符合真实物理规律的光照效果,包括光源方向、色温、强度、阴影投射等,让最终生成的画面光影更自然。
在生成创作中,用户通常需要控制生成时的节奏,并在生成后持续打磨细节。某个动作在第几秒出现、镜头在什么时间切换,或某片段里的角色、动作是否需要调整,都关系到最终成片的效果。更精准、稳定的
Seedance 2.5 支持通过时间戳精准
模型还进一步提升了绿幕
随着模型能力的提升,Seedance 2.5 也在深入教育、工业等更广泛的产业场景。在教育领域,模型已开始进入真实学习场景。比如,Seedance 2.5 可以将课文背后的历史背景、人物和情节转化为内容,把学习内容从静态讲解转化成更生动、更沉浸感的画面。同时,模型可以帮助老师更高效地制作教学,将科学原理、历史事件、实验过程等抽象内容转化为动态演示,不仅降低教学物料的制作门槛,还支持灵活的内容定制。
在工业制造、具身智能和自动驾驶等产业中,Seedance 2.5 也开始进入更具体的生产环节。模型可以生成高质量合成数据,帮助训练机器人的感知和操作能力;也可以用于工业仿真、流程培训和设备演示。在自动驾驶场景中,模型还可以模拟极端天气、复杂路况等低频场景,为系统测试和训练提供更多样本。
字节跳动表示,Seedance 2.5 进一步增强了对真实世界的理解和呈现能力,让生成从片段级输出,走向更完整的创作流程。我们也看到,在复杂运动的物理合理性、极多主体交互场景的稳定性上,模型仍有提升空间。










