最长 20 秒的原生音频短片
FLUX 3 Video 面向单次最长 20 秒的画面与音频同步生成。提示词可以统一协调可见动作、人物对白、环境声、音乐方向和有时间关系的音效,不需要把声音当成完全独立的后期步骤。这适合表情、动作、语音和音效共同服务于同一个叙事节点的场景。
Veo 3.1

围绕 FLUX 3 多模态基础模型探索视频创作:从文字、图片、视频、音频或关键帧规划场景,让动作与对白、音效互相配合,并为广告、产品故事、社交内容与短片设计连续镜头。页面先提供生成器,再介绍动作、镜头、连续性、语音、氛围和动态设计的提示词方法。
用一份多模态创意简报统一规划画面、动作、对白、声音、文字和镜头连续性。
FLUX 3 Video 面向单次最长 20 秒的画面与音频同步生成。提示词可以统一协调可见动作、人物对白、环境声、音乐方向和有时间关系的音效,不需要把声音当成完全独立的后期步骤。这适合表情、动作、语音和音效共同服务于同一个叙事节点的场景。
FLUX 3 视频工作流覆盖文生视频、图生视频、视频转视频、视频与音频续写,以及关键帧引导的转场。创作者可以从文字场景开始,让静态图片动起来,转换已有片段,延续一段内容,或定义不同时刻必须出现的重要视觉状态,兼顾快速概念生成与更精细的制作规划。
FLUX 3 强调多语言对话、多种视觉风格与宽高比、动态文字、人物表情、声音事件关联,以及把片段连接为更长序列。创作者可以围绕统一人物、地点、配色与镜头语言设计多个片段,再利用连续性线索让剪辑看起来属于同一个故事。
分层设计视觉动作、镜头、时间、声音、对白与多镜头连续性。
从一个主体、一个明确动作和一个环境开始,再分别补充景别、相机位置、镜头运动、镜头质感、灯光、节奏与视觉风格。重点描述片段中会发生什么变化,而不只是描绘静态画面。例如从产品细节拉到全景、跟随人物穿过门口,或保持固定机位让环境产生变化。动作在时间上越清楚,模型越容易形成有效的运动计划。
生成视频草稿
图生视频应选择干净的源图,并指出必须稳定的内容,例如人物身份、产品结构、服装、标志位置或整体构图;然后描述要增加的运动,例如头发随风摆动、相机缓慢环绕、液体在表面流动,或人物转向声音来源。视频转换与续写则要说明原片段的节奏、方向与视觉语言如何延续到新部分。

把声音写进场景简报,注明谁在说话、使用什么语言、简短台词是什么、情绪如何,以及周围有哪些环境声。音效应和可见动作建立联系,例如脚步与行走同步、门在画面中关闭,或产品机械结构发出卡位声。对白长度要适合片段时长,并把人物台词、音乐方向与环境氛围分开描述。

关键帧可以定义开场构图、变化节点或结束姿势等重要视觉状态,让模型补全它们之间的运动。设计多镜头时,建立一段连续性描述,在每个镜头中重复人物、服装、产品、地点、配色、灯光方向和镜头语言,只改变当前叙事节点所需的动作与构图。保持屏幕方向一致,并用动作、视线、声音或相似形状推动剪辑。
设计连续镜头
把原生音频生成与多模态控制用于需要画面、动作、语音和声音同步配合的短叙事。
把产品图片或广告简报转化为电影感亮相、材质特写、生活方式片段或短广告。说明需要保留的准确产品特征,再协调镜头运动、灯光变化、声音设计与简短台词。若广告需要覆盖落地页、信息流、短视频和付费社交媒体,应分别规划横屏与竖屏版本。
制作吸引注意力的开场、表演片段、氛围循环、对白场景、标题序列和剧情节点。原生音频适合声音与可见动作需要同时发生的概念,动态文字可以介绍名称、口号或章节,多种视觉风格则便于把同一故事探索为实拍、插画、动画或设计感动态画面。
围绕一个人物规划反应镜头、台词、动作和环境空镜,同时保持身份与美术方向一致。重复稳定描述,并用关键帧或参考帧控制最重要的视觉状态。共享的连续性模块可以让每个片段属于同一个序列,也能为后期剪辑提供节奏更清楚的素材。
了解原生音频、输入模式、关键帧、对话、提示词结构和多镜头视频创作。
FLUX 3 视频生成器指 Black Forest Labs 的 FLUX 3 多模态基础模型中的视频能力。它面向画面与原生音频同步生成,并理解文字、图片、视频、音频和关键帧背景,可用于独立短片及广告、社交内容、动态设计和叙事制作中的连续镜头。
可以。原生音频是 FLUX 3 Video 的核心能力之一,对白、环境声、音乐方向和音效可以与动态画面共同设计。清楚的提示词应把声音和可见动作关联起来,说明说话者身份,控制台词长度,并把对白、环境和音乐要求分别表达。
Black Forest Labs 对 FLUX 3 Video 的介绍是单次生成最长 20 秒并带原生音频。即使片段较短,也应包含简单的时间结构:交代主体与场景,完成一个可读动作,并停在有意设计的结束状态。更长故事可以拆成多个共享连续性描述的镜头。
已介绍的工作流包括文生视频、图生视频、视频转视频、视频与音频续写以及关键帧生成视频。文字定义场景与动作,图片建立外观或构图,视频提供运动和风格背景,音频引导续写,关键帧则指定重要视觉状态或转场。
关键帧可以定义场景需要到达的特定时刻,例如起始构图、变化节点或最终姿势,让创作者更有目的地控制转场并在时间中保留重要视觉信息。每个关键帧都应配合文字运动说明,让不同状态之间如何变化足够清楚。
多语言对话属于 Black Forest Labs 介绍的 FLUX 3 Video 功能。提示词中应注明语言、准确短句、说话者、情绪、语速与场景背景。短片中不要安排过长独白,并让人物嘴部动作、表演和镜头构图与说话时刻互相匹配。
完整提示词包括主体、动作、场景、景别、镜头运动、灯光、视觉风格、节奏、音频、对白与结束状态。重点描述可以看见和听见的事件。先测试一个动作和一个镜头运动,再增加次要细节;多镜头内容则应在每条提示词中重复同一段连续性描述。
暂时还不可以。在经过验证的公共 FLUX 3 Video API 上线前,页面中的生成器使用 Veo 3.1;请以界面显示的选中模型为准。