Seedance 2.5
字节跳动新一代专业级多模态视频创作模型。长叙事 × 强参考 × 准编辑 × 多语言四大能力升级, 面向真实生产场景系统性补强,让视频可复用、可交付、可规模化生产。现已接入 a2e。
用这个模型做出来的东西
核心能力
以下五条与其中的数字均取自 Seedance 官方说明,在 a2e 上的实际表现以你生成的结果为准。
一次投喂整套素材,跨镜头稳得住
角色集合、场景集合、参考镜头、品牌音乐可以一次性喂进去,模型综合理解后输出贴合创意意图的成片。多个主体跨镜头时,各角色的面孔、神态、服饰保持稳定;同一主体在多个场景之间切换,形象与风格也始终统一。
单段 30 秒直出,短素材还能自然延长
单段直出从 2.0 的 15 秒提升到 30 秒,一条里就装得下完整的情绪起伏与剧情推进,不用后期拼接。另有高保真时序延长,能在保持人物、场景、镜头一致的前提下,把短素材自然延展成更长的成片。
一次生成里可以给 50 个参考
一次最多 50 个参考素材 = 30 张图(4K 以内)+ 10 段视频(总时长 ≤ 30 秒)+ 10 段音频(总时长 ≤ 30 秒)。相比 2.0(图 9 张、音视频各 3 段、总时长 15 秒)扩了一大截。这一版还新增「只参考音频」——直接用一段 BGM、人声或音效驱动画面节奏、卡点与口型对齐。
只改一处,不重新生成整段
把原片用 @视频1 喂进去,再用提示词说清楚要改哪里,模型就在锁定其余画面的前提下完成局部改写——换掉不对的物体、调视觉细节、改人物表情或年龄、换整体风格。光照、构图、运动与时间线的连续性都保留,不用整段重出。
多语言,且不再乱加字幕与配乐
原生支持中文、英语、西班牙语、印尼语、马来语、泰语、阿拉伯语、葡萄牙语、越南语、日语、韩语等 10 余种语言,用母语写提示词即可,不必先翻译。不只是念得对——书写与发音都按目标语言来,还会依据语种替换匹配的人物面孔等元素。
先分清三种任务
官方实践手册专门立了一节讲这个,原因很直白:参考、编辑、延长这三类常被混用,一混就会 Prompt 错位、素材引用方式失当,最后生成结果不可控。动手前先对号入座。
参考生成:手上没有成片
以图片、视频、音频作参考素材,从零生成一段全新视频。提示词写法是「生成要求 + 参考素材」,素材用 @ 引用:@图片N、@视频N、@音频N。
视频编辑:改已有成片的局部
对一段已有视频做局部改写、替换或增删,其余画面锁住不动。写法是「修改要求 + @视频1(原片)」,需要时再补图片或音频参考。
视频延长:给已有成片续写
基于原片的画面、节奏与风格续写新片段。不只是往后接——向前续写、给两段或三段视频中间补全都支持。延长片段的时长可以在提示词里自己指定。
有几个参数是模型自动锁的,改不了
用视频编辑、视频延长或首尾帧能力时,模型会依据参考素材自动锁定部分生成参数:编辑的输出比例严格对齐原片、时长基本对齐原片;延长的比例同样对齐原片,但片段时长可自定义;首尾帧生视频的比例对齐首帧图,尾帧画幅不一致会被拉伸——所以首尾帧最好用同一画幅,否则会形变。
提示词与素材配比
2.5 的提示词工程调整后,对提示词质量的要求明显更高,官方强烈建议先做一轮 prompt 优化。下面几条是官方经大量评测得出的配比建议。
能传 50 个,不等于该传 50 个
主体是音视频:1–5 个效果好,6–10 个可以试但稳定性下降、可能要抽卡;单段控制在 5–10 秒,更长同样会掉稳定性。
主体是图:1–8 个效果好,9–12 个可以试。1–5 主体单视图、多视图都行;超过 5 主体「单视图」更稳,要多视角就拆成多张图,别把多视角塞进同一张。
另外几条:视频编辑的输入视频建议 20 秒以内;视频参考图编辑用 1–5 张参考图;多宫格分镜目前适用于 15 个以内,推荐火柴人或线稿,别在分镜图上写太多字;白模用粗粒度(简单几何体拼接)效果反而更好。
什么算一个「主体」
画面里希望模型稳定还原、贯穿全片的核心元素都算——人物角色、关键产品或道具、场景环境、整体风格。举例:口播片里只有出镜模特一个主体,传模特的多视图(5 张以内)就够;而「一个人在森林里拉弓射中一只兔子」里,人、弓箭、兔子各算一个主体,都需要稳定还原。
换语种版本,一句话就够
官方给的转语种提示词写得极简:「将声音、台词、旁白、标题字幕中的任何英语都改为法语/日语,其他均保持一致」。一次创作输出多语种口播版本,用来做出海本地化最省事。
提示词怎么写
官方原话是「把 Seedance 2.5 当作一个视觉内容生产者,用导演的思维书写结构化 Prompt」。下面是官方提示词指南里的写法要点。
官方提供了调优 skill,强烈推荐先装上
在本地项目里用 NPX 安装:
npx --yes skills@latest add \
"https://arkdocs.tos-cn-beijing.volces.com/skills/" \
--skill sd25-pe \
--yes
装好后,在 AI 对话框输入 /sd25-pe + 你的提示词内容,就能开始调试。2.5 的提示词工程调整后对提示词质量要求明显更高,官方把这一步标为「强烈推荐」。
结构化 Prompt 的四段
1 · 素材指代——按上传顺序标明每个图/视频/音频的编号与用途:谁是形象、谁是音色、谁是动作、谁是场景。
2 · 一句话概述——主体 + 地点 + 事件 + 题材/风格 + 特殊运镜。
3 · 具体情节——用时间戳或「镜头 N」切分,逐段写画面、运镜、动作、台词、音效,尽量用正向描述。
4 · 结尾——补充贯穿全片的机位/运镜、环境、声音、氛围。
素材一多,映射关系比画面描述更要紧
不要只在图片里呈现映射信息。比如在主角图上写「张三」,然后提示词里直接写「张三在学校……」,容易导致多人混淆或角色重复。要逐一做文本绑定:「img1-2 是人物 1,对应音频 1;img3-4 是人物 2,对应音频 2」。
分工要具体到「参考什么」:「参考视频 1 中施法的动作,视频 2 的环绕式运镜」。反过来,当参考素材本身已经够精准时,只做指代、减少画面复述——写「严格参考视频 1 的动作与运镜,顺序保持一致」就够,不必再逐条描述抬手、转身、环绕。
时间戳与负向控制
时间戳以 1 秒为单位。注意时间轴的连续性,别出现「0-3 秒……5-6 秒」这种断档。某段内容太少模型会自由发挥,太多则会过度剪切或漏剧情。不建议用时间戳控制频次,比如「一秒摇头 3 次」。
负向控制可以管字幕和音频,音频还能分维度:「不要字幕」「无 bgm,只生成环境音和动作音」。
从 2.0 迁过来,这四条写法变了
时间戳:2.0 只响应镜头序号,2.5 响应整数秒的时间戳。
多视图:2.0 不建议用多视图作主体参考,2.5 支持。
宽高比:2.0 输出只有固定 6 档,2.5 可以通过控制输入素材,输出 0.4 到 2.5 之间的任意宽高比。
输出格式:2.5 支持 MOV,在延长和编辑任务里能更好地保持颜色亮度一致与声画一致——所以做这两类任务时建议选 MOV。
体验时能调什么
下面是官方体验中心开放给这个模型的参数,用来判断它够不够你的交付要求。a2e 上实际开放的参数以产品页为准。
先选模式,再设参数
四种模式:参考生成、首尾帧、视频编辑、视频延长。选哪种,决定了哪些参数会被输入素材锁死——编辑和延长严格对齐原片的画面比例,首尾帧对齐首帧图的画幅,这几种情况下比例就不再由你决定。详见上面「先分清三种任务」。
逐项参数
分辨率:480p / 720p。画面比例:21:9、16:9、4:3、1:1、3:4、9:16,也可以交给「智能」按素材自己判断。视频时长:既能按秒数指定,也能用「智能时长」交给模型。此外还有视频格式(延长与编辑任务建议选 MOV)、是否输出声音,以及单次生成数量,一次最多 8 条。
不必从零攒素材
官方体验中心带模版库和素材库:模版库一键复用现成配置直接出片,素材库能自由组合图片、视频、音频生成自定义视频。另外还预置了覆盖多参考生成、视频编辑等场景的示例,用来快速验证模型能力。
文档与入口
要做集成看开发者文档,想直接用就从下面进。