选起点,把手里的东西放进去
上传一张角色立绘、商品实拍或分镜图,粘一段已有视频片段,或者放一组起止关键帧;什么都没有也没关系,只写一句中文提示同样能开始。四种起点走的是同一个入口,用哪种取决于你手上有什么——有图就从图开始,落地效果比纯文字描述更贴近预期。
一句中文提示、一张图或一组关键帧,出最长 20 秒声画同出的视频。
每条都是 flux ai 视频里画面与声音一次生成的成片片段。
霓虹地平线揭幕
品牌宣传
樱桃蛋糕预告
产品短片
赛博城市发布
品牌宣传
金色田野邂逅
电影感宣传
动作女主登场
娱乐宣传
便利店冲击
品牌宣传
头盔特写
产品短片
日落咖啡馆宣传
生活方式宣传
四项能力决定了你从素材到成片要走几步,也决定了你还需不需要打开剪辑软件。
对白、脚步声、衣料摩擦、环境风声与画面里的事件对得上,因为它们和画面在同一次生成里一起产出,而不是事后贴上去的音效包。想要纯画面也行——音频是可选项,提示里不写声音要求就不出声。一个人从提示词做到能直接发的短视频,中间不必再走配音和对轨。
手里的角色立绘、商品实拍、封面图可以被动画化,也可以只作为画面参考;给出起止两张关键画面,模型来补中间的运镜与过渡。这正是 Flux 3 图生视频对国内创作者的价值:立绘、分镜稿这些本来就有的东西不作废,比从零描述更接近你想要的那一镜。
多语言对白说得了中文台词,画面内的多语言文字也能以较高准确度渲染出来。知识区的中文标题字、术语标注因此经得起看——抖音和 B站 的静音浏览习惯下,画面里写清楚比说清楚更要紧。
单个片段可以被串接成更长的多镜头序列,也可以用视频-音频续写在已有片段后面继续生成画面和声音,风格与音场接得住。短剧一镜一镜拍、游戏 PV 一段一段接,20 秒是一个镜头的单位,不是整支片子的天花板。
在 VideoAI 选好模型之后,剩下的事情就是把起点放进去、把镜头和声音说清楚、再按镜头攒成片。
上传一张角色立绘、商品实拍或分镜图,粘一段已有视频片段,或者放一组起止关键帧;什么都没有也没关系,只写一句中文提示同样能开始。四种起点走的是同一个入口,用哪种取决于你手上有什么——有图就从图开始,落地效果比纯文字描述更贴近预期。
提示词里写进三件事:画面里发生什么(人物动作、运镜方式)、要不要出声以及出什么声(谁说哪句中文台词、什么环境音与音效)、画面里要不要出中文字(标题、术语标注)。台词和画面事件写得越对得上,声画同步就越准;不想要声音就别写声音要求,音频本来就是可选的。
单次拿到一段最长 20 秒、画面与声音一起生成的视频。不够就换一组关键帧再出下一镜,或者在已有片段后面续写,把多个镜头串成更长的多镜头序列。短剧和角色 PV 在国内本来就是一镜一镜攒出来的,不必指望一次出完整片;攒够了再按抖音、B站、小红书、视频号、快手各自的版式发出去。
浏览更多用于图像和视频创作的 AI 模型。

它是黑森林实验室于 2026 年 7 月 23 日发布的多模态模型,图像、视频、音频在同一个统一架构里联合训练。本页讲的是它的视频生成部分——你在 VideoAI 上选中它,就能拿它把提示词或素材做成带声音的短片。
流程只有三步:先在 VideoAI 选中这个模型,再放进你的起点(一句中文提示、一张图、一段已有片段或一组起止关键帧),然后把画面动作、要出的声音、要显示的文字写进提示词里生成。第一次做建议从一张现成的图起步,画面更可控;出来不满意就改提示词重生成一次。
新用户在 VideoAI 有 10 点免费额度,可以直接用来跑这个模型,不需要先付费;额度用完后有加油包和订阅套餐两种续费方式。生成需要登录账号,这一步免不了。
单次生成最长 20 秒。想要更长的内容,就把多个片段串接成多镜头序列,或者在已有片段后面用视频-音频续写继续往下生成——短剧和 PV 都是这么攒出来的。
行。音频与画面是一起生成的,对白、音效和环境声会跟画面里的事件对上;但音频属于可选项,提示词里不提声音要求,就按纯画面来。
两件事都做得到——模型支持多语言对白,中文台词可以直接写进提示词;画面内的多语言文字也能以较高准确度渲染,中文标题和术语标注读得清。当然不是每一帧都零失误,关键的字建议生成后自己再看一眼。
构图和取景由你在提示词里说明——想要竖屏就写清楚画面是竖构图、人物在画面中的位置、镜头怎么取景。模型层面没有公布固定的宽高比或输出格式档位,所以我们不写死;实际做法是把版式要求写进提示,生成后按各平台的发布规范上传。
没有水印,可以直接下载。用免费额度生成的结果同样可商用,接商单、做店铺推广素材、放进商业项目都没问题。