APIMart
APIMart

Métricas para evaluar la calidad de texto a vídeo

Ninguna métrica por sí sola capta la calidad de texto a vídeo, así que combina puntuaciones de distribución, alineación CLIP y métricas de consistencia temporal con revisión humana.

Análisis de modelos

Si tuviera que reducir esto a un solo punto, es este: ninguna métrica por sí sola puede juzgar bien el texto a vídeo. Necesito un conjunto que compruebe la calidad visual, la coincidencia con el prompt y el movimiento a lo largo del tiempo. Si solo uso una puntuación, puedo pasar por alto problemas importantes como clips estáticos, deriva del prompt o parpadeo de fotogramas.

Aquí va la versión corta:

  • Las métricas de distribución como FVD juzgan cuán cerca están los vídeos generados de los reales como conjunto, pero no comprueban si se siguió el prompt.
  • Las métricas de fotograma como PSNR, SSIM y LPIPS me ayudan a detectar desenfoque, ruido y defectos de fotograma, pero ignoran el movimiento y la coincidencia con el texto.
  • Las métricas de alineación como CLIPScore, ViCLIP y la puntuación basada en VQA comprueban si el vídeo muestra los objetos, acciones y relaciones correctos.
  • Las comprobaciones temporales como el flujo óptico, la consistencia del sujeto y las puntuaciones de parpadeo me ayudan a ver si el movimiento es fluido o si el vídeo simplemente se queda quieto para verse mejor sobre el papel.
  • Los benchmarks como VBench, T2VEval y T2VScore combinan muchas señales, mientras que la revisión humana todavía importa para errores de física, problemas de anatomía y fallos de sentido común. Para el análisis visual automatizado, herramientas como GPT-4o vision pueden ayudar a identificar estos defectos.

Algunos números destacan. ETVA alcanzó una correlación de Spearman de 58,47 con el juicio humano, frente a 31,0 de VideoScore y 13,8 de CLIPScore. La configuración DEVIL reportó una correlación de Pearson superior al 90 % para la puntuación de dinámica, y también encontró una correlación de Pearson de -88,9 entre la consistencia del sujeto y la dinámica, lo que muestra una clara contrapartida entre movimiento y estabilidad.

APIMart
Métricas de calidad de texto a vídeo: una guía comparativa completa

Comparación rápida

Grupo de métricasPara qué lo usoPrincipal punto ciego
Basado en distribuciónRealismo general del vídeo en un conjuntoSin comprensión del prompt
Perceptual a nivel de fotogramaDesenfoque, ruido, compresión, defectos de fotogramaSin conciencia del tiempo
Alineación texto-vídeoCoincidencia con el prompt: objetos, acciones, relacionesPuede pasar por alto movimiento fino o ser sensible a la redacción
Comprobaciones temporales/de movimientoSuavidad del movimiento, deriva, parpadeo, estabilidadSolo parte de la calidad
Suites de benchmark + humanosPuntuación más amplia y revisión finalMás cómputo o trabajo manual

Así que si estoy juzgando la salida de T2V, no me pregunto solo «¿Se ve bien?». Me pregunto tres cosas: ¿Se ve bien? ¿Sigue el prompt? ¿Se mantiene consistente a lo largo del tiempo? Estos son los benchmarks que usamos al probar modelos como Sora 2 para la preparación de producción. Ese es el núcleo del artículo.

Métricas objetivas fundamentales para la calidad de vídeo generativo

Las métricas objetivas ayudan a medir la calidad visual y la consistencia del movimiento, pero cada una mira solo una parte del panorama de T2V. Una buena forma de leerlas es por capas: empieza con métricas basadas en distribución, luego mira las métricas a nivel de fotograma para detectar problemas visuales locales.

Fréchet Video Distance y medidas relacionadas basadas en distribución

Fréchet Video Distance (FVD) mide la brecha entre las activaciones de características de vídeos reales y generados en el espacio de características de un clasificador de vídeo preentrenado, más a menudo I3D. En pocas palabras, comprueba cuán cerca están los vídeos generados de los vídeos reales como grupo. Como trabaja sobre características de vídeo, también puede reflejar la coherencia temporal.

Fréchet Inception Distance (FID) funciona de forma similar, pero sobre imágenes fijas con una red Inception-v3. Para vídeo, la gente suele aplicarlo fotograma a fotograma. Eso lo convierte en un sustituto visual aproximado, no en una métrica de movimiento. No tiene noción del flujo temporal.

Inception Score (IS) analiza tanto la calidad de la imagen como la diversidad a través de distribuciones de probabilidad de clase de una red Inception. El problema es que depende de las clases de ImageNet, lo que lo convierte en una mala opción para la generación de vídeo.

Estas métricas son útiles para el realismo agregado, no para la alineación con el prompt. También vienen con contrapartidas. FVD necesita un conjunto grande de vídeos de referencia de la misma distribución, lo que enreda las comparaciones de modelos cuando los modelos se entrenaron con conjuntos de datos diferentes. Y hay otro problema: las salidas de bajo movimiento de modelos como Kling V3 pueden puntuar bien, así que todavía necesitas comprobaciones separadas para la dinámica. Esto es particularmente relevante al evaluar modelos de alta fidelidad como Google Veo 3.1.

MétricaAspecto captadoRequisitos de datosFortalezasLimitaciones
FVDDistribución espacio-temporalConjunto grande de vídeos de referenciaCapta la coherencia temporal y el movimientoAlto coste computacional; requiere datos de referencia; agnóstica al prompt
FIDDistribución a nivel de fotogramaConjunto grande de imágenes de referenciaBuena para la fidelidad visual generalIgnora la dinámica y la consistencia temporal
ISCalidad y diversidadRed Inception preentrenadaNo se necesitan vídeos de referenciaPropensa al sobreajuste; no distingue diferencias finas de calidad

Como estas puntuaciones ignoran la semántica del prompt, el siguiente paso son las métricas perceptuales a nivel de fotograma.

SSIM, PSNR y LPIPS para la calidad perceptual a nivel de fotograma

Donde FVD comprueba la distribución del vídeo, SSIM, PSNR y LPIPS miran fotogramas individuales. Eso los hace útiles para detectar defectos de imagen, aunque no puedan decir mucho sobre el movimiento o la coincidencia con el texto.

PSNR (Peak Signal-to-Noise Ratio) mide diferencias a nivel de píxel entre un fotograma generado y un fotograma de referencia. Es muy rápido, lo cual es agradable, pero a menudo hace un mal trabajo al coincidir con el juicio humano. Un pequeño desplazamiento de píxeles puede hundir la puntuación aunque la imagen siga viéndose bien.

SSIM (Structural Similarity Index) mejora eso comparando luminancia, contraste y estructura. Tiende a ser más útil que la coincidencia de píxeles en bruto, pero aún necesita un fotograma de referencia de verdad terreno. También tiene dificultades con la semántica del prompt y el movimiento.

LPIPS (Learned Perceptual Image Patch Similarity) usa características de red profunda en lugar de píxeles en bruto. Eso suele alinearse mejor con el juicio humano. Aun así, sigue funcionando fotograma a fotograma.

Las tres comparten la misma debilidad central: evalúan los fotogramas de forma aislada. No tienen conciencia temporal ni forma de juzgar la adherencia al prompt.

MétricaTipo de métricaCorrelación con la percepción humanaIdoneidad para texto a vídeo generativoCoste computacional
SSIMSimilitud estructuralBaja a moderadaBaja (requiere verdad terreno; solo fidelidad a nivel de píxel)Bajo
PSNRFidelidad a nivel de píxelBajaBaja (sensible al ruido y a desplazamientos menores)Muy bajo
LPIPSSimilitud de características profundasModerada a altaModerada (solo calidad perceptual a nivel de fotograma)Moderado

Usa estas métricas para detectar desenfoque, ruido y artefactos de compresión. Son buenas herramientas de diagnóstico para defectos visuales, pero no miden la alineación con el texto ni la consistencia temporal.

Métricas para alineación con el texto, movimiento y consistencia temporal

Las métricas de alineación comprueban algo que las puntuaciones a nivel de fotograma pasan por alto: ¿sigue realmente el vídeo el prompt? Ese es el vacío que este grupo de métricas trata de llenar.

Puntuaciones de alineación semántica basadas en CLIP y conscientes del vídeo

APIMart

FVD, SSIM, PSNR y LPIPS pueden decirte algo sobre la calidad visual y la similitud. No pueden decirte si el modelo mostró lo que el prompt pedía. Ahí es donde entran las métricas de alineación.

CLIPScore toma embeddings del prompt de texto y de los fotogramas del vídeo, y luego mide la similitud del coseno entre ellos. Es rápido, sencillo de ejecutar y a menudo se usa como línea base. Pero también es bastante tosco. Puede pasar por alto el movimiento, las relaciones espaciales y pequeños atributos que importan a los espectadores [6].

Las variantes conscientes del vídeo como ViCLIP intentan resolver ese problema. Usan preentrenamiento vídeo-texto, por lo que pueden tener en cuenta el movimiento y el contexto basado en el tiempo mejor que el CLIPScore simple. Para prompts construidos en torno a acciones, estos métodos tienden a coincidir con el juicio humano más de cerca que el CLIPScore estándar [1][6].

MétricaBaseÁrea de enfoqueVentajasLimitaciones conocidas
CLIPScoreCLIP (ViT)Similitud con el promptRápida; fácil de calcular; línea base estándarTosca; pasa por alto movimiento, relaciones espaciales y atributos finos
ViCLIP / UMTScoreCLIP preentrenado vídeo-textoContexto temporal y de movimientoMejor alineación para acciones y dinámicaAún depende de la similitud de embeddings; puede ser sensible a la redacción del prompt

Cuando la similitud tipo CLIP es demasiado amplia, la puntuación tipo VQA te da una lectura más cercana de lo que el prompt pedía.

VQA, puntuación basada en descripciones y comprensión del prompt

La similitud de embeddings tiene límites. Dos vídeos pueden situarse cerca en el espacio de embeddings y aun así diferir en formas que una persona notaría de inmediato.

Los enfoques basados en VQA abordan eso dividiendo los prompts en pequeñas preguntas sobre entidades, atributos y relaciones. Un LLM multimodal responde luego esas preguntas basándose en el vídeo.

ETVA es un buen ejemplo. Divide los prompts en preguntas atómicas y las responde con un LLM multimodal, lo que mejora la concordancia con el juicio humano [6]. En esta tarea, ETVA alcanzó una correlación de Spearman de 58,47 con el juicio humano, en comparación con 31,0 de VideoScore y 13,8 de CLIPScore [6].

Los métodos basados en descripciones, como BLIP-BLEU, toman una ruta diferente. Generan una descripción para el vídeo y la comparan con el prompt usando BLEU o ROUGE. Eso puede funcionar para una coincidencia superficial, pero puede pasar por alto movimientos y cambios de escena más complejos [6].

Flujo óptico y medidas de consistencia temporal basadas en benchmarks

La alineación semántica te dice qué aparece en el vídeo. La consistencia temporal te dice si ese contenido se mantiene estable de fotograma a fotograma.

La consistencia del sujeto se mide a menudo con la similitud de características DINO a través de los fotogramas. Si la cara de una persona cambia con el tiempo o un objeto cambia de apariencia sin razón, la puntuación baja. La consistencia del fondo usa la similitud de características CLIP a través de los fotogramas para detectar cambios extraños en el fondo [1].

El flujo óptico, a menudo estimado con RAFT, mide la magnitud del movimiento y la consistencia del flujo. Esto importa porque algunos modelos, como MiniMax Hailuo 02, parecen estables simplemente al hacer vídeos casi estáticos. Eso puede hacer que los números de consistencia se vean mejor de lo que merecen. El protocolo DEVIL reportó una correlación de Pearson superior al 90 % entre su evaluación de dinámica y las calificaciones humanas [3]. También encontró una fuerte correlación negativa entre la consistencia del sujeto y la dinámica, con una correlación de Pearson de -88,9, lo que muestra una contrapartida común: los vídeos de alto movimiento pueden puntuar peor en consistencia incluso cuando el movimiento en sí es correcto [3].

El parpadeo temporal se mide de forma más directa calculando la diferencia absoluta media entre fotogramas consecutivos. VBench incluye esto como una de sus 16 dimensiones de evaluación [1].

En conjunto, estas comprobaciones ayudan a rastrear el movimiento, la deriva y el parpadeo. Por sí sola, cada métrica solo muestra parte del panorama, y por eso a menudo se usan junto a suites de benchmark y calificaciones humanas.

Suites de benchmark y métodos de evaluación humana

Cuando las métricas individuales apuntan en direcciones diferentes, las suites de benchmark te dan una forma compartida de juzgar los resultados. En lugar de apoyarse en una sola puntuación, agrupan varias señales en una única configuración, lo que facilita mucho las comparaciones de modelos entre estudios.

VBench, T2VEval y T2VScore como benchmarks multidimensionales

VBench, T2VEval y T2VScore intentan juzgar más de una cosa a la vez. Pero no lo hacen de la misma manera. VBench y T2VScore analizan la alineación, la calidad y el comportamiento basado en el tiempo en una sola rúbrica, mientras que T2VEval añade una dimensión de realismo separada que los otros dos no aíslan por su cuenta.

VBench divide la evaluación en 16 dimensiones jerárquicas, repartidas entre la calidad del vídeo y la consistencia vídeo-condición. Cada dimensión se prueba con unos 100 prompts [1].

T2VEval organiza la calidad en cuatro dimensiones de nivel superior:

  • impresión general
  • consistencia texto-vídeo
  • realismo
  • calidad técnica

Esa división importa. Un vídeo puede verse pulido desde un punto de vista técnico y aun así sentirse falso. T2VEval-Bench incluye 1783 vídeos generados por 13 modelos diferentes, incluidos Sora, Runway Gen-3 y Kling [5].

T2VScore reduce las cosas a dos dimensiones: alineación texto-vídeo y calidad del vídeo. Usa Visual Question Answering (VQA) para la alineación y una mezcla de expertos para la calidad. Las dos dimensiones tienen una ρ de Spearman de 0,223, lo que muestra que no se mueven juntas muy de cerca y deben puntuarse por separado [7].

BenchmarkDimensiones medidasComponentes claveMejor caso de uso
VBench16 dimensiones (p. ej., consistencia del sujeto, suavidad del movimiento, parpadeo temporal, calidad estética)DINO, CLIP, RAFT, MUSIQ, GRiT, ViCLIPMejor para diagnosticar fortalezas específicas y modos de fallo [1]
T2VEval4 dimensiones (impresión general, consistencia, realismo, calidad técnica)Fusión multirrama con Swin-3D, ConvLexNet-3D y BLIPMejor para una evaluación amplia de calidad, incluido el realismo [5]
T2VScore2 dimensiones (alineación texto-vídeo, calidad del vídeo)VQA, mezcla de expertosMejor para un cribado rápido de la alineación con el prompt y la calidad visual [7]

Protocolos de evaluación humana como T2VHE

Los benchmarks automatizados son amplios. La revisión humana capta lo que ellos pasan por alto.

Las personas detectan errores de física, fallos de anatomía y fallos de sentido común casi de inmediato. Una métrica puede no darse cuenta de que el agua debería salpicar pero no lo hace. También puede pasar por alto un brazo que se dobla de una forma que ningún cuerpo humano puede. Los jueces humanos no fallan tan fácilmente.

T2VHE (Text-to-Video Human Evaluation) es un protocolo estándar para la evaluación humana. Pone énfasis en la formación de anotadores, reglas de puntuación claras y pares de ejemplos que ayudan a calibrar el juicio. También usa un esquema de puntuación dinámico que puede reducir las necesidades de anotación manual en aproximadamente un 50 % [5].

CaracterísticaMétricas objetivas (p. ej., VBench, T2VScore)Evaluación humana (p. ej., T2VHE, MOS)
CoberturaGran volumen; puede procesar miles de vídeosLimitada por las horas de los anotadores
CosteBajo (solo recursos computacionales)Alto (requiere anotadores reclutados y remunerados)
VelocidadCasi en tiempo real una vez entrenados los modelosDías a semanas para grandes conjuntos de datos
MatizPuede pasar por alto violaciones sutiles de física o sentido comúnExcelente para detectar errores de sentido común y distorsiones sutiles
Mejor usoDesarrollo iterativo de modelos y pruebas rápidasValidación final y comparaciones de referencia dorada

Esa división prepara la siguiente decisión: elegir el conjunto de métricas adecuado para el flujo de trabajo. Esto es especialmente crítico al probar modelos de alto rendimiento como Grok Imagine Video.

Aplicación de estas métricas en flujos de trabajo de texto a vídeo

Elegir un conjunto de métricas para la evaluación en tiempo real y sin conexión

La idea principal es simple: ajusta la métrica al trabajo.

En cada etapa de una canalización de texto a vídeo, quieres un tipo de señal diferente. Usa métricas de alineación para comprobar si el vídeo encaja con el prompt. Usa puntuaciones perceptuales para juzgar la calidad del fotograma. Luego usa métricas de movimiento para ver si el vídeo se mantiene estable a lo largo del tiempo.

Para el monitoreo en vivo, quédate con las puntuaciones ligeras de alineación semántica y calidad visual. Son más fáciles de ejecutar y encajan mejor cuando la velocidad importa. Para el trabajo sin conexión, el listón es diferente. Si estás comparando modelos, estableciendo puertas de lanzamiento o rastreando la deriva de calidad a lo largo del tiempo, benchmarks más pesados como FVD y VBench tienen más sentido [4][1].

El movimiento añade otra capa. Si un vídeo tiene movimiento de cámara u objetos en primer plano en movimiento, las métricas conscientes del movimiento y el seguimiento importan mucho. Las puntuaciones estándar pueden pasar por alto cosas que los humanos notan de inmediato, como la deriva del fondo o el comportamiento inestable de un objeto.

Cómo las plataformas de API unificadas como APIMart pueden usar las métricas de evaluación

APIMart

El mismo conjunto de métricas también puede respaldar el enrutamiento a nivel de plataforma y el control de calidad.

Una plataforma unificada de API de IA como APIMart puede usar estas métricas para enrutar prompts, filtrar salidas y mantener las comprobaciones de calidad alineadas entre flujos de trabajo. Eso importa cuando una plataforma trabaja con muchos modelos y casos de uso a la vez. No quieres que cada flujo de trabajo juzgue la salida con un criterio diferente.

El enrutamiento basado en métricas puede ayudar a enviar cada prompt al modelo que mejor le encaje. Para el monitoreo a lo largo del tiempo, Conditional Fréchet Distance (cFreD) destaca porque no necesita reentrenamiento y puede rastrear la deriva de la distribución generativa de forma plug-and-play [8].

Conclusión: qué hacen bien las métricas actuales y dónde la investigación sigue abierta

En conjunto, estas métricas funcionan mejor como un conjunto, no como una sola puntuación.

Ninguna métrica por sí sola puede contar toda la historia. Una buena evaluación significa combinar puntuaciones de calidad de vídeo, medidas de alineación con el texto, comprobaciones de movimiento y consistencia temporal, y juicio humano en los puntos clave de validación.

Las métricas actuales hacen un trabajo decente cubriendo la calidad de fotograma, la alineación semántica y la consistencia temporal. El problema más difícil es lograr una mejor cobertura y explicaciones más claras sin añadir latencia. Los evaluadores basados en LMM parecen prometedores aquí porque pueden explicar por qué un vídeo falló en lenguaje natural [2]. Dicho esto, encajan mejor en la revisión sin conexión que en el monitoreo en vivo por ahora.

Preguntas frecuentes

¿Por qué no basta con una sola métrica?

Ninguna métrica por sí sola puede hacer todo el trabajo porque la calidad de texto a vídeo tiene más de una parte en movimiento.

Medidas como FVD o IS pueden decir algo sobre la calidad técnica o la similitud de patrones entre salidas. Pero a menudo pasan por alto la consistencia semántica, el movimiento a lo largo del tiempo, lo que la gente realmente prefiere y si el vídeo se alinea con el prompt de texto en primer lugar.

Por eso una mejor evaluación mira varias dimensiones en lugar de apoyarse en una sola puntuación.

¿Qué métricas debería combinar primero?

Empieza con un enfoque por capas que divida la calidad en dos partes: calidad del vídeo y consistencia texto-vídeo.

Antes de apoyarte en métricas como Inception Score, Fréchet Video Distance o CLIPSim, primero mira juntas las métricas de calidad técnica y estética. Eso te da una línea base para el contenido espacial y la consistencia temporal entre fotogramas antes de juzgar cuán bien coincide el vídeo con el prompt de texto.

¿Cuándo sigo necesitando revisión humana?

La revisión humana todavía importa. Las métricas automatizadas a menudo pasan por alto detalles que las personas notan de inmediato, como la consistencia temporal, la alineación semántica, la autenticidad, el realismo o los objetos irracionales.

Las métricas objetivas pueden darte una línea base sólida. Pero no coinciden de forma fiable con la calidad real o la percepción humana. Por eso los estudios con usuarios siguen siendo necesarios: no hay una sola medida automática que pueda captar todos estos detalles.

¿Listo para probar?

Elige el modelo que quieres en el marketplace

Prueba modelos de chat, imagen y video en el marketplace de APIMart y experimenta rápidamente sus capacidades con una API unificada.

Modelos de chatModelos de imagenModelos de video
Explorar marketplace