Wan 3.0 是阿里云推出的一体化视频模型,页面分为通用生成、首尾帧生成、文件/网页生成三个入口。通用生成可单独使用提示词,也可附加图片、视频和音频参考;首尾帧生成要求提供首帧,尾帧可选。通过 APIMart 的统一异步接口,可生成 2–30 秒、480P、720P 或 1080P 的视频,并可选择是否输出音频。
可仅用提示词生成,也可添加图片、视频和音频参考
通用 / 参考通道
可仅用提示词,也可附加参考素材、文档或网页
首尾帧通道
首帧必填,尾帧可选
同一请求不能混用首尾帧素材与参考图片、视频、音频、文件或网页。
请至少填写提示词,或添加一项图片、视频或音频参考素材。
最多上传 5 段 WAV/MP3;单段 1–15 秒、15 MB 以内;总时长不超过 15 秒。
WAV, MP3 (max 15MB, up to 5 audios, duration ≤ 15s)
已添加 0/5 段音频,上传文件和链接共用数量上限。
请选择自动时长(-1)或 2–30 秒之间的整数;有参考视频时,输入与输出总时长不能超过 30 秒。
1080P 是默认档,也是价格最高的分辨率档。
默认生成音轨;关闭音轨不会降低价格。
在生成的视频中添加供应商水印。
已存储到 APIMart CDN
透明定价,无隐藏费用。按量付费,用多少付多少。
* 实际费用以最终输出为准。
* 总价为(参考视频时长 + 生成视频时长)× 单价。
从通用生成、首尾帧生成、文件/网页生成三个入口开始。通用生成既可单独使用提示词,也可附加图片、视频和音频参考;首尾帧生成必须提供首帧,尾帧可选。可选择 2–30 秒时长,并输出 480P、720P 或 1080P 视频。
50K+
活跃用户
99.9%
在线率
2x
更快
70%
成本节省
三个生成入口、两个素材族,以及已确认的输出控制和交付方式
覆盖通用生成、首尾帧生成和文件/网页生成的生产场景
只需三步即可提交并获取 Wan 3.0 视频任务
选择可纯提示词或附参考素材的通用生成、首帧必填且尾帧可选的首尾帧生成,或文件/网页生成。
设置 2–30 秒时长、480P/720P/1080P 分辨率、宽高比、输出音频、水印,以及可选的随机种子。
提交异步请求,使用任务 ID 轮询状态,并从 APIMart 存储获取生成完成的视频。
关于 Wan 3.0 输入、价格和任务行为的常见问题
Wan 3.0 是阿里云的一体化 AI 视频模型,在 APIMart 上以 wan3.0-video 提供服务。页面将支持的输入整理为三个生成入口,并将参考素材与首尾帧素材分为两个互斥素材族。
页面有三个入口:通用生成可单独使用提示词或附加图片、视频、音频参考;首尾帧生成中首帧必填、尾帧可选;文件/网页生成则接受文档或公开网页来源。
duration 可设为 2 到 30 之间的任意整数。提供参考视频时,参考视频总时长与请求的输出时长之和不得超过 30 秒。
Wan 3.0 按请求秒数和分辨率档位计费。官方价格为 480P 每秒 0.30 元人民币、720P 每秒 0.60 元人民币、1080P 每秒 1.20 元人民币;您当前的 APIMart 价格显示在上方。
默认分辨率为 1080P,也是价格最高的档位。如 480P 或 720P 更符合您的画质和成本要求,请显式传入相应档位。
不会。输出音频默认开启,将 audio 设为 false 也不会改变按秒价格。参考音频是另一种用于引导生成的输入素材。
不可以。首帧和尾帧属于一个输入素材族,参考图片、视频、音频、文件和链接属于另一个素材族。Wan 3.0 会拒绝混用这两族素材的请求。
支持 Word、Excel、PowerPoint、PDF、TXT、Keynote、Pages、Numbers 和 Markdown 文件,文件最大 100MB、最多 50 页;也支持无需登录即可访问的公开网页。
探索同类型的其他模型。

Gemini Omni 1.1 Flash
Gemini Omni 1.1 Flash is a multimodal video model officially released by Google that supports rapid generation, natural language editing, and cinematic-quality visual control. This page connects to the official service through APIMart’s unified video API and uses separate pricing and task logs.

Gemini Omni Flash Preview
gemini-omni-flash-preview is a multimodal video generation and editing model launched by Google.

Kling 3.0 Turbo
Kling-3.0-Turbo: A high-speed, high-quality AI video generation model ideal for quickly creating short videos.

Pixverse V6
pixverse-v6 is PixVerse's sixth-generation AI video generation model, primarily used for text-to-video and image-to-video generation.