
Vidu MoE API-Leitfaden: Mixture-of-Experts-Video
Entwicklerleitfaden zur Vidu MoE (Vidu Q3) Video-API: Modellstufen, Request-Struktur, Parameter, Preise und Submit-Poll-Download-Workflow auf APIMart.
Wenn ich das in einer Zeile zusammenfassen müsste: Vidu MoE ist eine Kurzform-Video-API für Teams, die 1–16 Sekunden lange Clips, bis zu 1080p, 24 fps, asynchrone Auslieferung und optionales Audio in einer Anfrage benötigen.
Wenn Sie die Eignung für die Produktion beurteilen, hier die Kurzantwort: Es funktioniert am besten, wenn Sie asynchrone Jobs handhaben, Budget für Wiederholungen einplanen und für jede Phase die richtige Modellstufe wählen können. Ich würde viduq3-turbo für Vorschauen und viduq3-pro für die finale Ausgabe verwenden. Die meisten Jobs sind in etwa 60–120 Sekunden bei 720p und 90–180 Sekunden bei 1080p fertig, wobei die Wartezeiten in Spitzen etwa 4 Minuten erreichen.
Hier ist, was am wichtigsten ist:
- Eingabemodi: Text-zu-Video, Ein-Bild-Animation, Grok Imagine Video-Alternativen, Zwei-Frame-Start/End-Video und Mehrbild-Referenzeingabe
- Clip-Grenzen: 1 bis 16 Sekunden
- Ausgabe: bis zu 1080p bei 24 fps
- Audio: kann in derselben Anfrage aktiviert werden
- Bildreferenzen: bis zu 7 Bilder im erweiterten Modell-Funktionsumfang
- Wichtigste API-Regel: Wenn Sie Bild-URLs senden, senden Sie kein
aspect_ratio - Auslieferung: asynchron mit
task_id, Polling oder Callback - Preisbeispiel: Pro kostet etwa $0.60 für 5 Sekunden und $1.44 für 12 Sekunden
- Budget-Realität: planen Sie 2–3 Versuche pro genehmigtem Clip
Ein paar Details stechen heraus. Die API verwendet eine einfache JSON-Anfrage mit model, prompt und optionalen Medieneingaben. Die Modellwahl ist unkompliziert: Turbo für kostengünstigeres Testen, Pro für hochwertigere Renderings. Die Seed-Steuerung hilft Ihnen, Ausgaben über Wiederholungen hinweg in eine ähnliche Richtung zu halten, wenn auch nicht als exakte Übereinstimmung.
Wenn ich das für ein Produktteam bewerten würde, würde ich mich auf drei Fragen konzentrieren:
- Kann meine App asynchrone Verarbeitung sauber handhaben?
- Brauche ich reine Prompt-Generierung, bildgeführte Steuerung oder Start/End-Frame-Steuerung?
- Funktioniert mein Budget noch nach Wiederholungen, nicht nur bei den Kosten des ersten Durchgangs?
Schnellvergleich
| Punkt | Was Sie wissen müssen |
|---|---|
| Am besten für | Marketing-Clips, Produktvideos, Erklärvideos, Anzeigenvarianten |
| Modellauswahl | viduq3-turbo, viduq3-pro, viduq3 |
| Eingabesteuerung | Nur Prompt, 1 Bild, 2 Bilder oder referenzgeführte Generierung |
| Latenz | Meist 1–3 Minuten, in Spitzen manchmal länger |
| Auflösung | 540p, 720p, 1080p |
| Audio | In der Anfrage unterstützt |
| Workflow-Eignung | Teams, die ein paar Minuten warten und Dateien nach Abschluss speichern können |
| Achtungspunkte | Ablaufende Ausgabe-URLs, Wiederholungskosten und Anfragefehler durch schlechte Parameterkombinationen |
Bevor Sie also den vollständigen Leitfaden lesen, ist die Erkenntnis einfach: Vidu MoE ist eine gute Wahl für API-basierte Kurzvideogenerierung, wenn Sie mehrere Eingabemodi, integriertes Audio und Kontrolle über die Kosten durch Wechsel zwischen Turbo und Pro wollen. Der Rest läuft auf Request-Setup, Status-Handling und die Wahl der zum Workflow passenden Eingabemethode hinaus.
Vidu MoE API-Überblick und Kernfähigkeiten

Auf API-Ebene bildet Vidu MoE eine kleine Gruppe von Modellnamen, Workflows und Ausgabefeldern ab.
Vidu MoE erscheint in der API als viduq3-mix, das ausgewogene Q3-Modell. viduq3-turbo tendiert zu Geschwindigkeit, während viduq3-pro zu mehr Detail tendiert.
Was Mixture-of-Experts in der Videogenerierung bedeutet
Mixture-of-Experts schickt verschiedene Teile des Generierungsprozesses an spezialisierte Komponenten. In der Praxis hilft das bei Bewegung, Szenenkomposition und der Einhaltung des Prompts.
Die Q3-Serie unterstützt außerdem intelligenten Szenenwechsel und intelligenten Kamerawechsel [2][4]. Das ist am wichtigsten in Multi-Shot-Sequenzen, wo die Kontinuität schnell zerfallen kann, wenn das Modell den Überblick über die Szene verliert.
Unterstützte Workflows: Text-zu-Video, Bild-zu-Video und referenzgeführte Generierung
Von dort kommt der Hauptunterschied auf den Eingabetyp an, den Sie senden.
viduq3-mix unterstützt vier Workflows:
- Text-zu-Video allein aus einem Prompt
- Bild-zu-Video aus einem Startbild
- Referenz-zu-Video aus 1 bis 7 Bildern für Erscheinungs- und Stilkonsistenz
- Start-Ende-zu-Video aus zwei Frames, die den Übergang definieren
Prompts unterstützen bis zu 5.000 Zeichen [3][4]. viduq3-mix unterstützt nicht die Subjects-Entity-Bibliothek.
Eingaben und Ausgaben auf einen Blick
| Workflow | Typische Eingabefelder | Zurückgegebene Felder |
|---|---|---|
| Text-zu-Video | model, prompt, duration, aspect_ratio, audio | task_id, state, credits, video_url |
| Bild-zu-Video | model, images (1 Start-Frame), prompt, audio | task_id, state, credits, video_url |
| Referenz-zu-Video | model, images (1–7), prompt, audio | task_id, state, credits, video_url |
| Start-Ende-zu-Video | model, images (2 Frames), prompt, resolution | task_id, state, credits, video_url |
Jeder Job gibt eine task_id und einen state zurück, und die finale video_url wird nach der Verarbeitung verfügbar.
Q3-Videos laufen mit 24 fps, unterstützen Dauern von 1 bis 16 Sekunden (vergleichbar mit den Fähigkeiten von Sora 2) und bieten 540p-, 720p- oder 1080p-Ausgabe [2]. Bildeingaben sind auf 50 MB pro Datei begrenzt [4][1].
Diese Workflow-Optionen prägen die Payload, die Sie als Nächstes senden, was der folgende Abschnitt in Authentifizierung und Request-Format aufschlüsselt.
Authentifizierung, Request-Struktur und APIMart-Setup

Um Vidu MoE-Videos zu generieren, müssen Sie eine authentifizierte JSON-Anfrage senden. Der Request-Body hängt vom Eingabemodus ab: nur Text, einzelnes Bild oder mehrere Bilder.
API-Anmeldedaten erhalten und Request-Header setzen
Generieren Sie Ihren API-Schlüssel über die APIMart API Key Management Page [6]. Speichern Sie ihn als APIMART_API_KEY und laden Sie ihn dann zur Laufzeit mit os.environ.get("APIMART_API_KEY") in Python oder process.env.APIMART_API_KEY in Node.js.
Fügen Sie diese Header in jede Anfrage ein:
Authorization: Bearer YOUR_API_KEYContent-Type: application/json
Minimale Request-Payload für einen Videogenerierungs-Job
Der Standard-APIMart-Endpunkt für Vidu Q3 (MoE)-Generierungen ist https://api.apimart.ai/v1/videos/generations [6]. Die API ermittelt den Modus aus image_urls:
0URLs = Text-zu-Video1URL = Bild-zu-Video2URLs = Erst-zu-Letzt-Frame
Hier sind die Kernfelder und wann sie zu verwenden sind [6]:
| Parameter | Erforderlich | Standard | Hinweise |
|---|---|---|---|
model | Ja | - | viduq3-pro, viduq3-turbo oder viduq3 |
prompt | Bedingt | - | Erforderlich für Text-zu-Video; max. 2.000 Zeichen |
image_urls | Bedingt | - | Erforderlich für Bild-zu-Video (1 URL) oder Erst-zu-Letzt-Frame (2 URLs) |
duration | Nein | 5 Sek. | Bereich: 1–16 Sekunden |
resolution | Nein | 720p | Optionen: 540p, 720p, 1080p |
aspect_ratio | Nein | 16:9 | Nur Text-zu-Video; bei image_urls weglassen |
audio | Nein | true | Auf false setzen für ein stummes Video |
seed | Nein | - | Ganzzahl von -1 bis 2^32-1 für Reproduzierbarkeit |
Ein leicht passierender Fehler hier: Senden Sie kein aspect_ratio mit image_urls. Wenn Sie Bilder einfügen, zieht die API das Seitenverhältnis aus dem Quellbild. Wenn Sie trotzdem aspect_ratio senden, gibt die Anfrage einen 400-Fehler zurück.
Sobald die Payload gesetzt ist, können Sie den Job einreichen und mit dem Polling des Ergebnisses beginnen.
Beispiel-API-Aufruf und Antwortmuster
Beispiel einer Text-zu-Video-Anfrage:
curl -X POST https://api.apimart.ai/v1/videos/generations \
-H "Authorization: Bearer $APIMART_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "viduq3-turbo",
"prompt": "A product shot of a glass perfume bottle on a marble surface, camera slowly zooms in, soft studio lighting",
"duration": 5,
"resolution": "720p",
"aspect_ratio": "16:9",
"audio": false
}'
Eine erfolgreiche Übermittlung gibt eine task_id und den Status submitted zurück [6]:
{
"code": 200,
"data": [{
"status": "submitted",
"task_id": "task_xxxxxxxxxx"
}]
}
Die API läuft asynchron. Das bedeutet, die erste Antwort sagt Ihnen nur, dass der Job angenommen wurde. Verwenden Sie die task_id, um den „Get Task Status"-Endpunkt abzufragen. Wenn der Job fertig ist, enthält die Antwort MP4-Link(s), meist 7 Tage gültig [6].
Ein einfacher Polling-Rhythmus funktioniert gut:
- Pollen Sie alle 5 Sekunden für die ersten 5 Minuten
- Danach pollen Sie einmal pro Minute
- Pollen Sie weiter, bis der Status
completedist
An diesem Punkt laden und speichern Sie die zurückgegebenen Video-Link(s).
Als Nächstes stimmen Sie Dauer, Auflösung, Seitenverhältnis und Referenzeingaben ab, um das finale Video zu steuern. Für Projekte, die unterschiedliche cineastische Stile erfordern, können Sie auch die Kling V3-Fähigkeiten vergleichen für High-End-Videogenerierung.
Generierungs-Workflow, Parameter und Ausgabesteuerung
End-to-End-Ablauf: Einreichen, Überwachen, Abrufen und Ergebnisse speichern
Nachdem Sie einen Job eingereicht haben, ist die große Produktionsentscheidung einfach: einen Callback verwenden oder den Status pollen. In den meisten Fällen ist callback_url die bessere Wahl für die Produktion. Polling funktioniert, sollte aber Ihr Backup-Plan sein. Wenn Sie einen Callback verwenden, sendet die API den finalen Status an Ihren Endpunkt. Wenn die Zustellung fehlschlägt, wird bis zu dreimal wiederholt [3].
Der Job durchläuft dann einen festen Statuspfad: created → queueing → processing → success oder failed [3][4]. Wenn eine Task in failed landet, enthält die Antwort einen Fehlercode. Protokollieren Sie diesen Code und behandeln Sie ihn in Ihrem Workflow, damit Ihr Team Muster erkennen und Probleme schneller beheben kann.
Wenn der Status success erreicht, laden Sie die Ausgabe sofort herunter und speichern Sie sie in dauerhaftem Speicher. Dieser Schritt ist wichtig, weil API-gehostete URLs ablaufen können [9].
Wichtige Parameter, die Komposition, Bewegung, Dauer und Konsistenz beeinflussen
Sobald ein Job läuft, prägen einige Parameter, wie das Ergebnis aussieht, wie stabil es von Lauf zu Lauf bleibt und wie viele Credits Sie ausgeben.
| Parameter | Was er steuert | Visueller / Qualitätseffekt | Kostenwirkung |
|---|---|---|---|
seed | Randomisierung | Verwenden Sie denselben Seed mit demselben Prompt erneut, um ähnliche Bewegung und Komposition zu reproduzieren | Keine direkte Kostenwirkung [3][6] |
off_peak | Job-Planung | Keine visuelle Wirkung; leitet niedrigpriorisierte Jobs an die Off-Peak-Verarbeitung | Kann den Credit-Verbrauch reduzieren; kann den Abschluss um bis zu 48 Stunden verzögern [11] |
audio_type | Tonebene | Wählen Sie Speech_only, Sound-effect_only oder All (ähnlich der Audio-Unterstützung in kling-v2-6) | Keine Zusatzkosten für Standard-Audiooptionen [1][4] |
is_rec | KI-Prompt-Verbesserung | Verbessert die Prompt-Bild-Ausrichtung, wenn manuelles Prompting inkonsistente Ergebnisse liefert | Kostet 10 zusätzliche Credits pro Task [1] |
Ein Parameter ist es wert, von Anfang an verfolgt zu werden: seed. Wenn Sie ein Bewegungsmuster bekommen, das Ihnen gefällt, notieren Sie diese Ganzzahl und behalten Sie sie. Wenn Sie den Prompt später anpassen, können Sie dann denselben Seed wiederverwenden, um eine ähnliche Gesamtkomposition zu halten, statt von vorne anzufangen.
Wann nur Prompts, Bildreferenzen oder beides verwenden
Diese Eingabemodi lassen Sie Geschwindigkeit gegen Kontrolle eintauschen. Wählen Sie den, der dazu passt, wie festgelegt Ihre visuelle Ausrichtung ist.
- Nur Prompt (Text-zu-Video): Am besten für frühe Ideenfindung, Stiltests und Szenenexperimente, bevor visuelle Assets finalisiert sind. Verwenden Sie
viduq3-turbobei 540p oder 720p, um die Iterationskosten niedriger zu halten, oder vergleichen Sie es mit WAN 2.6 für Alternativen mit hoher Konsistenz [7]. - Einzelbild (Bild-zu-Video): Am besten, wenn Sie etwas Bestimmtes animieren wollen, wie ein Produktfoto, eine Charakterillustration oder ein Markenmotiv. Das ist eine starke Wahl für E-Commerce- und Marketingarbeit.
- Zwei Bilder (Erst-zu-Letzt-Frame): Am besten, wenn der Übergang auf ein festes Ergebnis landen muss, wie ein Produkt, das sich in einen bestimmten Winkel dreht, oder eine Figur, die sich in eine definierte Pose bewegt [5].
Wenn manuelles Prompting Ihnen ungleichmäßige Ergebnisse liefert, schalten Sie is_rec: true ein. Die API generiert einen optimierten Prompt aus Ihrem Bild, was die Prompt-Bild-Ausrichtung verbessern kann, aber 10 Credits pro Task hinzufügt [1].
Leistung, Preise und reale Integrationsszenarien

Wie Latenz, Zuverlässigkeit und Kosten pro Video bewertet werden
Nachdem Sie das Request-Format festgelegt haben, ist das Nächste, worauf Sie schauen, Geschwindigkeit, Preis und Job-Erfolgsrate. Dies ist ein asynchroner Workflow, daher sollte Ihre App den Job einreichen, die task_id speichern und das finale MP4 später über Polling oder einen Callback abrufen [3][6].
Jobs durchlaufen meist einen einfachen Pfad: in der Warteschlange, abgeschlossen oder fehlgeschlagen. Wenn ein Job fehlschlägt, werden Credits oft automatisch erstattet [3][10]. Das ist in der Produktion wichtig, weil Wiederholungen Teil des Prozesses sind, kein Sonderfall.
Was die Bearbeitungszeit angeht, sind 720p-Generierungen meist in 60–120 Sekunden fertig. Für 1080p erwarten Sie eher 90–180 Sekunden. Die Warteschlangenzeit liegt außerhalb der Spitzenzeiten oft bei 15–30 Sekunden, während die p95-Latenz in Spitzen auf etwa 4 Minuten ansteigen kann [7]. Also ja, es kann in der Produktion gut funktionieren – aber nur, wenn Ihr System gebaut ist, um asynchronen Abschluss sauber zu handhaben.
Was die Preise angeht, setzt die Pro-Rate einen 5-Sekunden-Clip auf $0.60 und einen 12-Sekunden-Clip auf $1.44 [10]. In der Praxis sollten die meisten Teams 2–3 Versuche pro genehmigtem Asset einplanen. Das setzt die finalen Kosten für einen brauchbaren Clip in den Bereich $1.20–$4.32, je nach Länge [10]. Wenn Sie im Testmodus sind, ist viduq3-turbo etwa halb so teuer wie Pro und ergibt mehr Sinn für schnelle Iteration. Pro ist besser für finale Renderings aufgehoben [10].
| Volumenstufe | Videos pro Monat | Durchschn. Dauer | Monatliche Basiskosten (USD) |
|---|---|---|---|
| Leicht | 50 | 12s | $72.00 |
| Mittel | 200 | 12s | $288.00 |
| Hoch | 500 | 12s | $720.00 |
Diese Zahlen decken nur die Basisgenerierung ab. Sie schließen Wiederholungen nicht ein. Wenn Ihr Team mehrere Durchgänge erwartet – und die meisten tun das –, multiplizieren Sie die Summen mit 2–3 für ein Budget, das näher an der täglichen Produktion liegt.
Anwendungsfälle: Marketing-Videos, Bildungsclips und E-Commerce-Produkt-Visuals
Sobald Kosten und Wartezeit klar sind, ist der nächste Schritt, den richtigen Eingabemodus für das Asset zu wählen, das Sie ausliefern müssen. Die beste Wahl hängt vor allem von einer Sache ab: wie viel visuelle Kontrolle Sie bereits haben.
| Szenario | Empfohlener Eingabetyp | Ausgabeerwartungen | Betriebshinweise |
|---|---|---|---|
| Marketing-Kreativ | Referenz-zu-Video | Konsistente Marken-Avatare oder Maskottchen über Clips hinweg | Übergeben Sie Charakter- und Hintergrundreferenzen zusammen für visuelle Konsistenz. |
| E-Commerce-Visuals | Bild-zu-Video | Konsistente Produktdarstellung | Beginnen Sie mit einem einzelnen hochwertigen Katalogbild; die Ausgabequalität folgt dem Eingabe-Frame. |
| Bildungsclips | Erst-Letzt-Frame | Sanfte Übergänge zwischen Zuständen | Stellen Sie ein Startbild und ein Endbild bereit, um die Bewegung zu steuern. |
| Social-Media-Anzeigen | Text-zu-Video | Vertikale (9:16) oder quadratische (1:1) Clips | Verwenden Sie kurze vertikale oder quadratische Prompts für schnelle Anzeigenvarianten. |
Eine einfache Denkweise dazu:
- Wenn Markenkonsistenz wichtig ist, verwenden Sie Referenz-zu-Video
- Wenn das Quellbild bereits gut aussieht, verwenden Sie Bild-zu-Video
- Wenn Sie Bewegung zwischen zwei Zuständen brauchen, verwenden Sie Erst-Letzt-Frame
- Wenn Sie schnell viele Anzeigenvarianten wollen, verwenden Sie Text-zu-Video oder ziehen Sie MiniMax Hailuo 2.3 für professionelle Ausgaben mit hoher Konsistenz in Betracht.
Für Teams, die die Bearbeitungszeit verkürzen wollen, verändert natives Audio den Workflow am stärksten. Natives Audio spart separate Beschaffungs- und Bearbeitungsarbeit [8], was zusätzliche Post-Production-Schritte für Teams entfernen kann, die einen fertigen Clip aus einem einzigen Generierungsdurchgang wollen. Genau dort wird das Modell am nützlichsten: wenn das Ziel ist, einem auslieferungsfertigen Asset nahezukommen, ohne die Datei durch eine lange Übergabekette zu schicken.
Fazit: Wie Sie entscheiden, ob Vidu MoE zu Ihrem Produktions-Workflow passt
Vidu MoE ergibt Sinn, wenn Sie kurze Clips bis zu 12–16 Sekunden, mehrere Eingabemodi und natives Audio in einem asynchronen API-Setup brauchen. Der seed-Parameter kann helfen, wiederholte Jobs in etwa dieselbe Richtung zu lenken, aber Sie sollten nicht erwarten, dass identische Eingaben bit-für-bit übereinstimmende Ausgaben produzieren [6][10]. Fehlgeschlagene Jobs lösen außerdem tendenziell automatische Credit-Erstattungen aus [3][10].
Das passt zu Teams, die Kurzform-Video in großem Umfang produzieren, ein paar Minuten auf Ergebnisse warten können und Spielraum im Budget für Wiederholungen haben. Wenn das nach Ihrem Workflow klingt, gibt Ihnen APIMart eine saubere Möglichkeit, Marketing-Kreativ, Produkt-Visuals und Erklärinhalte über eine API-Oberfläche zu betreiben.
FAQs
Welches Vidu MoE-Modell sollte ich zuerst verwenden?
Für die meisten Entwickler ist viduq3-turbo der beste Startpunkt. Es gibt Ihnen die schnellsten Generierungsgeschwindigkeiten, ein starkes Preis-Leistungs-Verhältnis und fortgeschrittene Funktionen wie audiovisuelle Synchronisation und intelligenten Szenenwechsel.
Wählen Sie viduq3-pro, wenn Sie den vollständigsten Funktionsumfang wollen. Es umfasst Storyboard-Generierung und die hochwertigste audiovisuelle Ausrichtung. Beide Modelle unterstützen Videos von 1 bis 16 Sekunden und Auflösungen bis zu 1080p.
Wie sollte ich fehlgeschlagene oder verzögerte Video-Jobs handhaben?
Verwenden Sie die Task-ID in Ihrem asynchronen Workflow.
Für Jobs, die länger dauern, pollen Sie entweder von Zeit zu Zeit die Status-API oder setzen Sie eine Callback-URL, damit Sie benachrichtigt werden, wenn die Task einen Endzustand erreicht.
Wenn ein Job fehlschlägt, prüfen Sie den Callback oder die Status-Antwort auf Fehlerdetails.
Für Produktionsstabilität verwenden Sie exponentielles Backoff beim Polling, damit Sie nicht in Rate-Limits laufen.
Off-Peak-Tasks, die über 48 Stunden laufen, werden automatisch abgebrochen, und die Punkte werden erstattet.
Welcher Eingabemodus bietet die meiste Kontrolle?
Multi-Frame-Generierung gibt Ihnen die meiste Kontrolle darüber, wie sich ein Video von einem Moment zum nächsten bewegt. Statt sich auf einen Prompt oder ein Zwei-Frame-Setup zu verlassen, können Sie eine Sequenz von bis zu 9 Keyframes abbilden.
Diese zusätzliche Kontrolle ist wichtig. Für jeden Übergang können Sie ein spezifisches Bild und einen eigenen Prompt hinzufügen, sodass die visuelle Geschichte dem von Ihnen gewünschten Pfad folgt, Frame für Frame.
Um es zu verwenden, senden Sie Ihre Bilder und Prompts an den Multiframe-Endpunkt im image_settings-Array.
Wählen Sie Ihr gewünschtes Modell im Marktplatz
Testen Sie Chat-, Bild- und Videomodelle im APIMart-Marktplatz und erleben Sie Modellfunktionen schnell über eine einheitliche API.