文字、首帧与首尾帧
官方 wan3.0-video 模型支持纯文字简报、首帧图片,或同时提供首帧和尾帧。文生视频适合能完全用语言说明的镜头;首帧可以锚定主体外观、构图、色彩与机位;首尾帧还定义了明确终点,适合揭示、变形、产品旋转或必须停在特定构图的场景。无论使用哪种模式,都应描述两个状态之间的运动,而不是把提示词写成静态图片说明。
输入提示词,选择视频设置,然后生成短片。
Veo 3.1
AI 输出预览
温室镜头,用于复查运动、构图与音频。

Wan 3.0 的设计不止于一行文字提示。官方文档中的工作流可以从文字或首帧开始,也可以连接首尾帧,或使用包含图片、视频、音频、文档和公开网页的混合参考包。本指南把这些能力整理为适合产品片、解说视频、社交故事和电影感概念的实用规划方法,同时严格区分能力参考与实际生成结果的来源。
提交渲染前,根据公开的模型契约规划输入方式、输出档位、时长与声音方向。
官方 wan3.0-video 模型支持纯文字简报、首帧图片,或同时提供首帧和尾帧。文生视频适合能完全用语言说明的镜头;首帧可以锚定主体外观、构图、色彩与机位;首尾帧还定义了明确终点,适合揭示、变形、产品旋转或必须停在特定构图的场景。无论使用哪种模式,都应描述两个状态之间的运动,而不是把提示词写成静态图片说明。
基于参考的生成可以组合多种上下文。官方限制包括最多 10 张图片、5 段参考视频和 5 段参考音频;参考视频总时长与参考音频总时长分别不超过 15 秒。应给每份素材指定作用,例如一张图负责身份,另一张负责环境,一段视频负责镜头节奏,一段音频负责语速。小而清晰、标注明确的参考组通常比彼此冲突的素材文件夹更容易控制。
媒体输入可包含常见文档、表格、演示文稿、PDF、纯文本、Markdown,以及支持的 Apple 办公文件;也可以输入无需登录的公开网页。这使全能简报可以从产品说明、活动方案、脚本提纲、品牌网页或研究笔记出发。源材料仍需编辑判断:明确核心信息、受众、必须保留的事实与目标场景,而不是让一份长文档替你决定故事。
从一个可衡量的镜头想法开始,依次完成参考包、时长、渲染与复查。下方视频为每个复查步骤提供视觉参考。
按主体、动作、环境、景别、镜头运动、光线、节奏和结束状态的顺序写提示词。让时间变化可见:门打开时镜头逐渐靠近,人物转身后衣料自然落下,或产品旋转并停在标签正对镜头的位置。不要让一个短镜头同时切换地点、引入多人、改变画风并讲完整故事。聚焦的时间简报更容易检查提示词遵循和物理连续性。
起草一个镜头当视觉身份和构图比开放创作更重要时,使用干净的首帧;当结果必须到达特定姿态或版式时,再加入尾帧。全能参考工作流中,每份素材都应有明确职责:主体身份、服装、产品结构、配色、镜头语言、运动节奏、对白语气或环境声。提交前移除重复与矛盾,不要假设文件越多控制就越好。
官方契约列出 480P、720P 和 1080P 三档输出。没有视频输入时,时长可设为 2 至 30 秒,智能时长使用 -1;提供视频参考时,输入视频时长加输出时长不得超过 30 秒。该契约默认启用音频。应依据动作选择时长,不要机械地请求最大值:两拍产品揭示只需数秒,而对白、流程演示或镜头旅行需要更多空间。
打开渲染文件,先开声音从头到尾看一遍,再静音复看。检查主体身份、物体数量、肢体结构、接触关系、镜头方向、视觉连续性、口播文字、声音事件时机与最后一帧。标注或发布前,把结果与实际所选模型和任务记录核对。把提示词、参考、设置、费用与输出保存在一起,后续迭代才有可靠基准。
检查视频工作区把以下结构当作起点,再用你自己的制作简报替换主体、运动、参考职责和结束状态。
“中远景,一位陶艺师在明亮工作室里从转盘上举起完成的蓝色陶碗;镜头缓慢顺时针环绕,尘埃在侧光中浮动;手部动作自然,碗的形状稳定,房间环境声安静;最后陶碗停在胸前画面中央。” 这个结构包含主体、可读动作、镜头路径、物理约束、氛围和结束构图。用能在画面中发生的具体事件替代堆叠的装饰性形容词。
“保留上传图片中的自行车车架、标志位置、车轮结构、街道构图与日落配色。骑行时让夹克和路边草地轻微受风,镜头与骑手保持恒定距离平行跟拍。交通流保持同一方向,最后回到原来的四分之三构图。” 先说明源图锁定什么,再描述新增运动,并让镜头运动与源图透视保持相容。
先说明来源、受众、单一信息、必须保留的事实和目标格式,再请求场景。例如:“使用附件中的发布简报作为上下文,为首次购买者制作一段 12 秒产品介绍。按顺序展示三步折叠机构,保留文档中的材质与颜色,不加入未经支持的性能主张,最后停在干净的产品轮廓和克制的机械声上。” 成片中的脚本与画面仍需逐项对照源材料。
根据故事中必须受控的部分选择输入模式。
当产品结构、材质、颜色与功能顺序必须准确时,从已审核产品图或文档简报开始。用首帧建立可识别的开场,用尾帧定义结束构图,再用参考运动确定镜头节奏。每段片只聚焦一个功能或动作。结果进入广告或产品页前,复查标签、机构、比例和营销主张。
把干净的身份参考与简洁表演方向、镜头构图、口播语言、语气和环境声组合起来。对白要短到能容纳在所选时长内,音效应对应可见动作。制作系列内容时,重复包含角色外观、服装、地点、配色和屏幕方向的连续性模块。分发版式变化时,分别规划横屏与竖屏构图。
把演示文稿、报告、公开网页或 Markdown 提纲整理为紧凑的视觉简报。每段片只选择一个论点,列出必须出现的事实,并明确场景负责演示、比较、总结还是建立背景。文档提供信息但不会自动保证编辑准确性,发布前仍需核对名称、数字、字幕和暗示出的结论。
每次提交都应以实际所选模型、可见设置、显示价格和完成后的任务记录为准。
符合条件的新账号可获得 40 个欢迎积分,有效期 5 天,并受站点防滥用规则约束。这是有限的起始余额,不是无限方案;提交生成任务仍需登录。
生成器默认打开最低成本的视频基准:文生视频、16:9、720p,价格为 150 个站点积分。150 高于 40 个欢迎积分,因此新账号欢迎余额本身无法完成该任务。不同清晰度、路由或配置可能更贵,提交前请检查界面实时费用。
FluxKlein 不会在视频结果上叠加可见的站点水印;下载文件以及服务方适用的输出政策仍是准确信息来源。
解答输入方式、图生视频、参考限制、时长、输出清晰度、音频、积分与工作区实际所选模型。
Wan 3.0 视频是阿里云百炼官方 API 参考中标识为 wan3.0-video 的多模态视频生成模型。文档所列工作流包括文生视频、首帧图生视频、首尾帧引导,以及使用多种媒体的参考生成。该模型可同时规划画面与原生音频,并提供最高 1080P 的输出档位。
支持。首帧图片可以确定初始主体、构图与美术方向;首尾帧工作流还能同时定义开场和目标状态。有效提示词应先说明源图中必须稳定的细节,再描述两个画面之间新增的运动、镜头、时机和结束状态。
官方媒体输入支持图片、视频、音频、文档和公开网页。参考限制包括最多 10 张图片、5 段视频和 5 段音频,参考视频总时长与参考音频总时长分别不超过 15 秒。给每份素材明确职责,并在生成前移除互相矛盾的来源。
可以。API 参考列出常见文档、表格、演示文稿、PDF、纯文本、Markdown 与 Apple 办公文件,也支持无需登录的公开网页。把这些来源作为创作上下文后,还应明确受众、必需事实、核心信息和目标场景,避免让模型推断整份编辑简报。
没有视频输入时,文档所列时长范围为 2 至 30 秒,并支持智能时长;包含视频参考时,输入视频时长加输出时长不得超过 30 秒。时长应匹配动作数量和口播字数,而不是自动选择最大值。
官方契约列出 480P、720P 与 1080P 输出,并默认开启音频生成。把对白、环境声、音乐方向与声音事件作为同一时间场景的一部分来规划;完成后开声音检查文件,因为口型、时机和环境音仍需人工复核。
页面和规划指南可以免费打开,但提交视频需要登录并消耗积分。符合条件的新账号可获 40 个欢迎积分,有效期 5 天;当前所选 720p 基准任务需 150 积分,因此欢迎余额本身不足以生成一条视频。这是有限积分,不代表无限免费生成。
可见模型选择器目前默认使用 FluxKlein 现有 Kie 路由中的 Veo 3.1。FluxKlein 尚未在本页接入或验证 Wan 3.0 生成路由;现在提交的任务属于 Kie Veo 3.1,结果必须描述为 Veo 3.1 输出,绝不能称为 Wan 3.0 输出。只有在准确核验 Wan 3.0 API、价格和真实服务方任务后,所选模型才会改变。