Click to upload or drag and drop images. Single side: [240, 8000] px; aspect ratio ≤ 8:1
Images: JPEG/JPG/PNG/WebP/BMP, Max 20MB
Text prompt used to describe the desired video content. Supports both Chinese and English, with a maximum length of 20,000 characters.
0/20000Click to upload or drag and drop
Supported formats: JPEG, PNG, WEBP, BMP Maximum file size: 20MB; Maximum files: 10
Maximum 10 images. Mapped in array order to Image1, Image2, ... in the prompt. Specifications are the same as first_frame_url. Cannot be used together with first frame / last frame.
Click to upload or drag and drop
Supported formats: MP4, QUICKTIME Maximum file size: 100MB; Maximum files: 5
Maximum 5 clips. Each clip: 1–15s; total combined duration ≤ 15s. Mapped in array order to Video1, Video2, ... in the prompt. Formats: mp4, mov. Single side: [240, 4096] px; aspect ratio ≤ 8:1; file size per clip ≤ 100MB. Additionally, on the output side: total input video duration + output duration (duration parameter) must not exceed 30 seconds.
Click to upload or drag and drop
Supported formats: MPEG, WAV, X-WAV Maximum file size: 15MB; Maximum files: 5
Maximum 5 clips. Each clip: 1–15s; total combined duration ≤ 15s. Mapped in array order to Audio1, Audio2, ... in the prompt. Formats: wav, mp3; file size ≤ 15MB per clip. When not used as the sole media input, it is still recommended to pair with images or videos.
Maximum 1 publicly accessible webpage (no login required). Cannot be used together with reference_file_urls, nor with first frame / last frame.
Maximum 1 file. Cannot be used together with reference_link_urls, nor with first frame / last frame. Supported formats: docx, doc, xlsx, xls, pptx, ppt, pdf, txt, key, pages, numbers, md. File size ≤ 100MB. For file types such as pdf, docx, ppt, key, pages, etc., page count ≤ 50 pages.
Preset resolution levels for video generation.
Aspect ratio for generated video. "Adaptive" auto-recommends a ratio based on input media proportions and intent.
Duration of the generated video, in seconds. When no video input is provided, the value must be an integer in the range of [2, 30]. When a video input is provided, the total duration of the input video plus the output video must not exceed 30 seconds. Passing -1 enables smart duration mode, where the model automatically recommends an appropriate duration based on the input.
Whether the output video includes audio. true (default): Includes audio; false: No audio track.
Random seed for result reproducibility. 0 <= x <= 2147483647
A configurable parameter. Defaults to true in the Playground.
Explore different use cases and parameter configurations
README
Complete guide to using wan/3-0-video
万相3.0 API 以更强控制力重塑多模态视频创作
借助万相3.0 API 体验视频生成技术的全新进化。它完美融合了更长篇幅的叙事、更强的参考一致性、精准编辑与沉浸式视听创作,助您实现更完整的视觉故事表达。

借助万相3.0 API,基于更丰富的多模态输入开启视频创作
万相3.0是阿里最新推出的全能视频生成模型(All-in-One),专为更连贯的长篇叙事、更丰富的参考理解、更强的视觉一致性以及更精准的创作控制而设计。万相3.0 API 支持基于不同类型的素材(包括文本、图片、视频、音频、关键帧、文档及网页)进行创意生成,通过更灵活的参考方式,帮助塑造场景、运镜、声音、视觉风格与叙事方向。有关最新支持的输入类型、生成模式及 API 使用详情,请参阅 Kie.ai 上的万相3.0视频生成 API 文档。
将文本提示词转化为完整的视频创意
文本能做的远不止描述简单的场景。借助万相3.0 API,文字指令可以精准塑造角色、环境、运镜、动作逻辑、光影、节奏、氛围,甚至是视频的情感起伏,让详细的提示词成为结构化创作的灵活起点。 如果项目暂不需要在视频生成中加入原生立体声,可继续使用 Wan 3.0 Video;若多模态创作需要原生立体声与视频一同生成,则可转向 the newer MiniMax H3 (Hailuo-03) API 进行对比。
通过图像参考,让视觉特征在动态影像中完美延续
图片参考有助于在画面运动前奠定视频基调。角色外貌、服装、道具、场景、材质、构图及整体风格均可通过视觉进行引导,从而让万相3.0视频生成API在动态场景中精准呈现细节,并展现更强的连贯性。
使用视频参考引导画面运动与场景流转
有些创意,展示出来比用语言解释更直观。现有的视频素材可提供动作语言、表演提示、节奏把控、镜头行为及场景动态,帮助万相3.0视频生成API构建或重塑视频,实现更可控的动作呈现与更清晰的流畅感。
将声音引导与视觉生成深度融合
音频与画面一样,都是塑造场景氛围的关键。语音、音乐、节奏、人声及其他声音参考,能为万相3.0视频生成API提供更多关于步调、情绪、表演张力及视听协同的参考信息,让最终的成片更加和谐统一。
让场景发展与关键帧保持一致
关键帧为画面的起始、演变或收尾提供了强大的视觉锚点。借助首尾视觉参考,万相3.0视频生成API能够精准引导主体的连贯性、转场逻辑及场景发展,确保生成的视频在走向上更加一致。
将文档与网页引入创意工作流
创作素材并非只能来自提示词。简报、演示文稿、电子表格、PDF、文本文档乃至网页,同样能提供极具价值的结构与背景信息。万相3.0 API 可将这些现有信息转化为视频生成工作流的一部分,而无需将其视为独立的准备工作。
探索万相3.0 API 如何实现视频创作的重大飞跃
借助万相3.0 API 开启全能多模态创作
万相3.0 突破了传统提示词的限制,将更丰富的创作背景融入生成过程。图片、视频、音频、文档和网页等不同类型的参考素材,有助于引导场景搭建、视觉一致性及把控创作方向。有关最新支持的输入类型、可用功能及 API 使用详情,请参阅 Kie.ai 上的万相3.0视频生成 API 文档。
万相3.0 API:原生30秒叙事
更长的原生生成时长赋予了场景更多空间,以便更好地进行背景铺垫、动作发展、情节过渡,并带来更完美的结局。万相3.0 API 支持生成最长30秒的视频,并可根据请求内容智能适配时长,为叙事结构与创作自由打开更广阔的空间。
万相3.0视频生成API:像素级的参考一致性
角色、服装、道具、环境、音频提示以及空间关系,在不断变化的动作和场景中,均能与原始参考保持高度一致。万相3.0视频生成API 强化了细节复刻与画面连贯性,在需要保持视觉特征稳定的情况下,让基于参考的视频创作更具可靠性。
万相3.0视频生成API:精准视频编辑
通过详细的创意指令即可重塑现有视频,且不会对原始素材中无需变动的部分造成不必要的影响。万相3.0视频生成API 支持对主体、背景、环境、光影、视觉风格等元素进行精准调整,同时结合参考引导编辑与视频延展功能,让创意打磨更加灵活高效。
万相3.0 API:沉浸式音视频生成
视觉叙事与更具表现力的音频生成完美结合,让场景体验更加完整。万相3.0 API 优化了自然音色、方言表达、音乐节奏、环境音效及音视频同步,使动作、表演、氛围和声音的融合更具连贯性。
万相3.0视频 API:电影级的视觉与动态控制
万相3.0在光影、色彩、构图、角色表现、镜头语言和场景动态等方面,全面提升了真实感与美学控制力。万相3.0视频 API 能够以极高的视觉精度处理复杂的动作编排、逼真的物理交互、细腻的材质以及细致的表演,为您呈现更具电影质感的画面。
如何在 Kie.ai 上使用万相 3.0 视频生成 API 创作视频
设置您的 Kie.ai 账号,获取万相3.0视频 API 权限
为万相3.0视频 API 请求准备创意素材
提交万相 3.0 视频生成 API 任务并获取生成结果
探索万相与 Seedance 引领的 AI 视频生成演进之路
从电影级叙事到精细可控的视觉创作,万相 3.0、Seedance 2.5 和 Seedance 2.0 展现了 AI 视频生成的不同路径。您可以在统一的视觉概念下,对比它们在动态效果、跨帧一致性以及创意表达上的不同表现。
万相 3.0:新一代电影级视频生成掌控
万相 3.0 带来了更强大的视觉理解与生成控制能力,能够生成一致性更高的角色、环境及复杂场景。生成的视频展现出更出色的动作连贯性、更丰富的视听细节,并为高质量视频制作提供更精准的创意方向把控。
Seedance 2.5:进阶创作体验,视频动态更细腻
Seedance 2.5 实现了视频生成能力的进阶:更精准的参考素材理解、更流畅的运动模式以及更强的场景连贯性。凭借极具表现力的镜头语言与细腻的视觉叙事,它让创意探索与可商用的专业成片无缝衔接。
Seedance 2.0:稳定的动态表现与连贯的视觉叙事
Seedance 2.0 专注于稳定的视频生成,具备出色的提示词遵循能力与流畅的场景过渡。它能保持一致的主体特征和自然的动态效果,是打造引人入胜的视觉叙事的均衡之选。
借助万相 3.0 API,让更长、更丰富且更易控的视频创意化为现实
借助万相 3.0 API 打造更长的叙事视频
A short film can develop across multiple actions, locations, camera changes, and story beats without being reduced to a single isolated moment. Wan3.0 API is well suited to sequences such as an urban chase, miniature adventure, surreal comedy, or cinematic action scene where characters, props, environments, and narrative logic need to remain connected as the story progresses.
使用万相 3.0 API 生成基于参考画面的角色视频
When several characters, costumes, environments, or visual references need to remain recognizable throughout a scene, Wan 3.0 API can use those materials as persistent creative guidance. This makes it useful for fashion films, choreography sequences, character showcases, historical scenes, and other productions where appearance, styling, spatial relationships, and movement continuity all matter.
借助万相 3.0 视频 API 重塑现有视频素材
Existing video can become the starting point for controlled creative changes rather than being regenerated from scratch. Wan3.0-Video API can support tasks such as replacing a subject, changing an environment, removing an accessory, shifting the visual style, adjusting selected scene elements, or extending an existing sequence while preserving the motion and structure that should remain unchanged.
使用万相 3.0 视频 API 创作视听内容
Videos built around dialogue, music, environmental sound, rhythmic motion, or expressive atmosphere can benefit from treating audio as part of the creative direction from the beginning. Wan 3.0 Video API can support content such as performance videos, cinematic commercials, immersive story scenes, and rhythm-driven motion pieces where sound, visual pacing, character performance, and scene dynamics need to feel closely synchronized.
为什么选择 Kie.ai 构建更实用的万相3.0 API 工作流
借助 Kie.ai 更轻松地接入万相 3.0 API
Kie.ai 提供了一种极简的方式对接万相 3.0 API,无需繁琐的集成配置。从身份验证、请求提交、任务管理到结果获取,均采用清晰的 API 工作流,让接入与维护更加便捷。
极具竞争力的万相 3.0 API 定价,满足灵活调用需求
不同的项目对生成量和复杂度的需求各不相同。Kie.ai 为万相3.0 API 提供灵活透明的计费方案,让您轻松控制使用成本,并根据实际生产需求弹性扩展生成能力。
稳定可靠的万相3.0视频 API 任务管理
视频生成通常涉及异步任务,需要高效地进行提交、监控和结果获取。Kie.ai 为万相3.0视频 API 提供了结构化的任务管理方案,让生成状态、处理流程和成品输出的管理变得更加轻松高效。
清晰的万相3.0视频 API 文档,助力极速接入
结构清晰的文档能显著降低 API 接入难度。Kie.ai 为万相3.0视频 API 提供了实用的开发指南,涵盖身份验证、请求结构、任务提交和结果获取等核心步骤,让集成流程一目了然、轻松落地。
在 Kie.ai 探索更丰富的创作模型
Kie.ai 提供丰富的图像、视频、音频及多模态模型选择。除了万相3.0 API,您还可以根据不同的创作需求探索更多选项。一站式汇聚不断升级的生成能力,让您能够轻松为各项任务匹配最合适的模型。
极速响应的技术支持,为您的万相3.0 API 工作流保驾护航
在遇到 API 请求、任务状态、计费或集成等问题时,如果难以获得支持,往往会导致开发受阻。Kie.ai 为万相3.0 API 用户提供快速响应的协助,帮助其在问题发生时更高效地解决平台与工作流相关的问题。