APIMart
happyhorse-1.0 model icon
视频

happyhorse-1.0

HappyHorse 是阿里巴巴 ATH-AI 推出的统一多模态视频生成模型,单次前向传播即可同步生成 1080p 视频与原生音频,支持 7 语言对口型,在 Artificial Analysis 文生视频与图生视频双榜中均排名第一。

文生视频图生视频原生音频1080p

服务亮点

  • 99.9% SLA
  • 官方折扣
  • 按量计费
  • 高速低延
Input
11 / 2500
5s
Output

Video link valid for 72 hours

定价详情

透明定价,无隐藏费用。按量付费,用多少付多少。

* 实际费用以最终输出为准。

HappyHorse —— 原生音频视频模型,已登陆 APIMart

阿里巴巴 HappyHorse 在同一个 Transformer 中统一画面与音频 token,输出 1080p 视频,支持 7 种语言的亚像素级对口型。APIMart 提供统一的 HappyHorse API 接入,仅需一个 API Key。

50K+

活跃用户

99.9%

在线率

2x

更快

70%

成本节省

为什么 HappyHorse 与众不同

首个原生协同生成画面与音频的视频模型

统一多模态 Transformer

HappyHorse 采用单流 Transformer 架构,将文本、图像、视频、音频 token 放在同一表示空间,跳过传统的「视频 → 音频 → 对口型」流水线。

原生音频生成

HappyHorse 将对白、环境音、音效与画面一同生成,无需额外 TTS 或后期合成,音画完美同步、开箱即用。

7 语言对口型

HappyHorse 支持英语、普通话、粤语、日语、韩语、德语、法语,依据语种实现亚像素级口型对齐,专为全球化对白内容打造。

Artificial Analysis 双榜第一

截至 2026 年 4 月,HappyHorse 在 Artificial Analysis 全球盲评竞技场中文生视频(1333 Elo)与图生视频(1392 Elo)均排名第一。

8 步 DMD-2 采样

HappyHorse 蒸馏到约 8 步去噪、无需 classifier-free guidance —— 单张 H100 GPU 约 38 秒可生成一段 1080p 视频。

原生 1080p 输出

HappyHorse 无需放大即可输出广播级 1080p 视频,多镜头之间的物理一致性与时序连贯性表现出色。

竖屏与对白场景优化

HappyHorse 针对竖屏、对白密集型内容做了专门优化,非常适合短视频、社交广告以及多语种口播内容。

Sandwich 三明治架构

HappyHorse 采用共享自注意力核心的「三明治」结构高效融合多模态,约 150 亿参数,针对 H100 集群做了硬件感知优化。

HappyHorse 的典型应用场景

受益于原生音画协同生成的生产级场景

多语种广告创意

用 HappyHorse 一次生成广告创意,覆盖 7 种语言的对口型版本 —— 不再需要单独的配音流水线,大幅缩短全球营销上线周期。

竖屏短视频规模化生产

HappyHorse 原生支持竖屏与对白优先生成,非常适合抖音、TikTok、Reels、Shorts 等短视频平台的真实口语化内容。

口播与代言人视频

用 HappyHorse 生成代言人、产品讲解、培训类视频,语音、口型、手势保持完美同步,告别尴尬的对不上嘴。

分镜与预可视化

HappyHorse 可生成带临时对白与环境音的多镜头预演,适用于影视、动画、游戏 CG 的早期分镜与方案验证。

本地化在线教育

同一节课程可通过 HappyHorse 输出多语种对口型版本,成本远低于重拍或人工配音,加速课程国际化。

出海品牌内容

出海品牌可借助 HappyHorse 在每个区域无需单独建立制作团队,即可快速产出本地化的视频创意素材。

开始使用 HappyHorse

几步即可开始创作原生音频 AI 视频

1

注册账号

免费注册 APIMart 账号,开始使用 HappyHorse。任何时候都可以为你的团队创建组织。

2

充值

为账户充值后即可开始使用,余额可在平台所有模型间通用,包括 HappyHorse。

3

生成 API Key

在控制台创建 API Key,调用 HappyHorse 时用于身份验证,立即获得原生音频 AI 视频能力。

HappyHorse 用户评价

全球创作者与开发者的真实反馈

原生音频效果太惊艳了 —— 一次出片就能拿到对得上口型的对白,完全不用再走 TTS 流水线。

Alex Morgan

创意总监

HappyHorse 把我们的本地化耗时砍掉了 70%,一个 prompt 输出 7 种语言版本,口型全部对齐。

Sarah Kim

市场经理

原生 1080p 出片,没有放大伪影。多镜头序列的时序一致性表现非常稳。

James Wilson

全栈开发工程师

把之前的视频供应商换成了 HappyHorse,对白密集型场景的画质与同步度立刻提升。

Lisa Chen

StartupAI CTO

作为独立电影人,HappyHorse 让我能在分镜阶段就生成带临时对白的预演镜头,效率提升明显。

Marco Rivera

独立电影人

通过 APIMart 的统一 API 调用 HappyHorse,一个 Key 走天下,集成不到一小时就跑通了。

Emily Zhang

DevOps 工程师

HappyHorse —— 常见问题

在 APIMart 使用 HappyHorse 你需要了解的一切

HappyHorse 是什么?

HappyHorse 是阿里巴巴 ATH-AI 创新业务部(源自淘宝与天猫未来生活实验室)推出的视频生成模型。它是一个单流多模态 Transformer,可在单次前向传播中同步生成 1080p 视频与原生音频。

HappyHorse 接受哪些参数?

HappyHorse 接受以下核心参数:model(happyhorse-1.0 或 happyhorse-1.1)、prompt(文本描述,≤2500 字符)、resolution(720P 或 1080P,默认 1080P)、duration(时长 3-15 秒,默认 5 秒)、aspect_ratio(16:9 / 9:16 / 1:1 / 4:3 / 3:4,仅文生视频生效),可选 seed 和 watermark。传入 image_urls 或 first_frame_image 即切换到图生视频模式(此时 aspect_ratio 由首帧图决定)。

HappyHorse 的音频生成与其他视频模型有何不同?

大多数视频模型先生成画面、再单独添加音频。HappyHorse 在同一个 Transformer 中协同生成画面与音频,口型对齐到亚像素级,环境音也天然同步,对白场景表现尤为真实。

对口型功能支持哪些语言?

HappyHorse 支持 7 种语言:英语、普通话、粤语、日语、韩语、德语、法语。模型会根据所选语种在亚像素精度上对齐口型。

HappyHorse 的生成速度如何?

在单张 NVIDIA H100 GPU 上,HappyHorse 生成一段原生 1080p 视频约需 38 秒。它采用 8 步 DMD-2 采样、跳过 classifier-free guidance,比常规 30+ 步扩散视频模型显著更快。

HappyHorse 与 Sora 2、Veo 3.1、可灵相比如何?

在 Artificial Analysis 盲评中,HappyHorse 文生视频(1333 Elo)与图生视频(1392 Elo)均排名第一。与 Sora 2、Veo 3.1 相比,最大差异是原生音频协同生成;与可灵(Kling)相比,对白与口型表现更优,但可灵在部分动作密集场景仍具优势。

HappyHorse 的价格是多少?

请参见本页价格区域查看最新的按秒计费价格。在 APIMart 充值后即可开始使用 HappyHorse 生成视频。

如何快速接入 HappyHorse?

向 /v1/videos/generations 发送 POST 请求,携带 APIMart API Key、模型名 happyhorse-1.0 或 happyhorse-1.1 与 prompt 即可。完整集成示例见 API 文档。

相关模型

探索同类型的其他模型。