文生视频,支持电影级运镜控制
用中文或英文描述一个场景,Seedance 2.0 会用有动机的布光、符合物理的运动和刻意的运镜把它拍出来——推镜、甩镜、固定全景都可以。主体、动作、镜头与氛围全部可以在提示词里指挥,因此改一句话就等于重拍一条,成本是几秒钟。
Seedance 2.0
旗舰 AI 视频模型
旗舰 AI 视频模型
描述画面、人物动作和运镜方式。例如:"缓慢推镜,一个身影穿过霓虹雨夜的街道"。
模型
0/2000
输出数量
声音
有声音
同步生成声音、人声与配乐
生成的视频会显示在这里。描述一个镜头,然后点击生成。
Seedance 2.0 是第一个被广泛使用的多模态 AI 视频生成器:文本、图像、视频与音频不再是四个独立模式,而是融合成同一次请求。把产品图、情绪片段、人声参考和文字脚本一起提交,即可获得一段 4 到 15 秒、最高 4K、声画同步的完整影片 —— 由字节跳动(TikTok / 抖音)研发。
在 FrameAI 上免费即可体验完整模型能力:最高 4K、7 种画面比例(竖版 9:16 到宽银幕 21:9)、单次最多 9 张参考图 + 3 段参考视频,每条片段自带同步音频。积分在生成前实时报价,失败自动退还;付费套餐导出的内容可商用。
大多数 AI 视频生成器只能选一种模式 —— 纯文字或纯图片。Seedance 2.0 在一次请求里同时接收文字提示、参考图、视频片段和音频。
用中文或英文描述一个场景,Seedance 2.0 会用有动机的布光、符合物理的运动和刻意的运镜把它拍出来——推镜、甩镜、固定全景都可以。主体、动作、镜头与氛围全部可以在提示词里指挥,因此改一句话就等于重拍一条,成本是几秒钟。
单次请求中可叠加最多 9 张参考图与 3 段参考视频。模型会把它们放在一起读——这张脸、那个产品、这套配色、那个运镜——最终收敛成一条一致的成片,而不是把它们平均成一团糊。
同行模型返回的是静音文件,Seedance 2.0 则生成与画面锁定的拟音、环境声与配乐。脚步声落在落脚那一帧,撞击声响在撞上那一刻。你下载的是一段完成品,而不是等待音效设计的素材板。
Seedance 2.0 是一个视频基础模型——用单一网络把一堆混合的条件信号变成活动影像,而不是把若干窄工具拼装成流水线。从 Seedance 1.5 到 2.0 的代际变化在架构层面:1.5 一次只处理一种条件类型,所以图生视频和文生视频本质上是两种不同的请求。2.0 会在生成第一帧之前,把你提供的每一种信号融合进一个共享表征——这正是为什么参考图里的那张脸能始终保持是同一张脸,而参考视频的运镜可以被套用到它本身从未拍到过的场景上。
这些差别会直接体现在成片里。角色一致性能跨镜头保持,因为身份信息承载在融合表征中,而不是每个镜头重新猜一遍。指令还原度明显更紧——要求「手持、35mm、傍晚」时,你会拿到这三件事,而不是其中一件。而由于音频是与画面联合生成、而非从成片反推的,声音能在帧级别对上动作。在 FrameAI 上模型以 24 帧/秒运行,单次生成窗口为 4 到 15 秒;更长的序列应当通过视频延长或镜头转场来搭建,而不是去要一条长得不现实的单镜。
9 张图像、3 段视频、3 个音频参考与完整文本提示在生成开始前就被合并。没有任何东西是后期叠上去的——这就是为什么被参考的产品,其光照能与它被放入的场景对得上。
Seedance 2.0 追求最高保真、可达 4K;Seedance 2.0 Fast 与 Mini 上限 720p,草稿成本只有零头。先低成本验证想法,再为真正要留下的那一条付费。
Seedance 2.0 在生成画面的同一个 pass 里同步产出拟音、环境声、撞击声和配乐。音频不是从成片倒推的——它是和视觉帧一起写出来的,所以关门声就响在关门那一帧,而不是晚两帧。这直接省掉了所有其他 AI 视频生成器仍然需要的后期音效设计环节。
模型规格
以下是公开的硬性上限,不是市场话术。每一项都会在扣除积分前由生成器校验:超出限制的任务会被直接拦下,而不是跑到一半才失败。
模型是字节跳动的。FrameAI 补上的是决定它能否真正用于工作的那部分:诚实的上限、诚实的计费,以及一份你有权拿去卖的成片。
文本、最多 9 张参考图、最多 3 段参考视频在同一次生成中被融合,而不是事后拼接。这里没有需要来回切换的「文生视频模式」——你手上有什么素材就丢进去,模型自己去调和它们。
Seedance 2.0 会把脚步声、环境底噪、撞击声和配乐与画面一并写出,并锁定在动作上。大多数模型交给你的是一段静音素材,音效设计还得自己做;这里导出的就是成品。
同一条提示词可以产出 9:16 竖版短视频、16:9 的 YouTube 主片,以及 21:9 的宽银幕片头。分辨率从 480p 到 4K,同一个镜头既能适配宽银幕画幅,也能用于手机。
积分成本由你选的时长、分辨率和画面比例算出,并在点击生成之前就显示出来——而不是之后。如果服务商侧生成失败,预扣的积分会自动退回。
Seedance 2.0 Fast 和 Seedance 2.0 Mini 就是为那二十版没人会看到的草稿准备的。先用 480p 花很少的积分把镜头打个样,再把跑通的那一版用旗舰模型重跑成全分辨率。
付费套餐生成的内容可根据《服务条款》用于商业用途;免费积分生成的内容仅供评估。
没有时间线、没有关键帧、不用装剪辑软件。用自然语言描述你的镜头,在线生成一段完整视频。
用一两句话描述主体、动作和运镜——中英文都能被原生理解。然后把你手上的东西附上去:产品图、需要保持一致的人脸、想借用运动的片段。具体永远胜过文艺:「缓慢推近,厨师摆盘扇贝,钨丝灯主光」远好过「好看的美食视频」。
从 7 种画面比例、4 到 15 秒时长、480p 到 4K 中选择。积分成本会随你的改动实时更新,所以你在花钱之前就决定这一条值多少。原生音频默认开启,也可以关掉。
点击生成后,任务会在后台运行,结果会出现在「我的作品」。如果视频是在付费套餐有效期内生成的,可根据《服务条款》用于商业用途;如果服务商生成失败,积分会自动退回。
营销团队、内容创作者和影视工作室正在用一条提示词 + 一个下午,替代过去需要剧组、场地和一整周的拍摄流程。
增长团队会为同一支产品广告生成十几个变体——不同钩子、不同画面比例、不同节奏——然后交给 Meta、TikTok 或巨量引擎去判断跑量效果。把产品图作为参考附上,可以让包装在每一版里都保持准确,而这恰恰是通用 AI 视频生成器最容易翻车的地方。
原生音频在信息流里最关键——一段静音素材等于被划走。生成一条自带同步环境声与撞击声的 9:16 竖版视频,意味着导出即完稿——无需音效库、无需二次剪辑,直接发布到抖音、小红书或 YouTube Shorts。
导演与创意代理商用 4K AI 生成片段在预算落地之前先把想法卖出去。参考图锁住视觉风格,参考片锁住运镜,客户看到的是一段带声音的真正影片——而不是一版分镜和一句承诺。
Seedance 2.0 是字节跳动的第二代视频基础模型。它能把文本、参考图、参考视频与音频融合后,生成 4 到 15 秒、最高 4K 的视频,并与画面同步产出声音。在 FrameAI 上模型未做修改运行,7 种画面比例与全分辨率输出全部开放。
按积分计费,取决于真正决定算力的三个设置:时长、分辨率和画面比例。确切数字会在你点击生成之前显示在生成器里,不会有意外扣费。一段简短的 480p 草稿成本只是 15 秒 4K 成片的零头,而生成失败会自动退还积分。
中文或英文的文字提示、最多 9 张参考图、最多 3 段参考视频、最多 3 个音频参考——全部可以放在同一次请求里。这些都不是必填项:只用文字也能跑,每多一份参考,只是让模型多一样需要保持不变的东西。
分辨率支持 480p、720p、1080p 和 4K。画面比例支持 16:9、9:16、21:9、1:1、4:3、3:4 以及自适应(让模型匹配参考素材的画幅)。Seedance 2.0 Fast 与 Seedance 2.0 Mini 上限为 720p——这是服务商的限制,生成器会提前拦住,而不是让任务在服务商侧失败。
可以。如果视频是在付费套餐有效期内生成的,你拥有相应内容的所有权,并可根据《服务条款》用于商业用途。免费积分生成的内容仅供评估。
三点核心差异。第一,Seedance 2.0 在一次生成里融合文本、图像、视频与音频参考,而不是逼你一次只能用一种模式。第二,它产出的是原生同步音频,而不是一段需要另外配音的静音素材。第三,它支持 7 种画面比例、最高 4K 输出,一个模型就能同时搞定 9:16 竖版社媒短片和 21:9 宽银幕主片。
写好 Seedance 2.0 提示词的核心原则:具体描述主体、动作和运镜,去掉模糊修饰语。「缓慢推近,厨师摆盘扇贝,钨丝灯主光,浅景深」永远比「好看的电影级美食视频」效果好。保持一两句话,指定镜头和灯光,剩下的交给模型。如果结果偏离了你的意图,把提示词精简到单一动作,再一个元素一个元素加回来。
Seedance 2.0 单次生成 4 到 15 秒。要做更长的视频,可以用「视频延长」工具续接,或者用「视频转场」工具把两条片段流畅拼接。这种组合式做法效果比让任何模型一次生成超长片段更好,因为每一段都能拿到模型的全部注意力预算。
每个工具都是同一个 Seedance 2.0 模型,只是对准了不同的活儿。你可以随意切换——积分、历史记录和导出文件是共用的。