APIMart
APIMart

Métricas para Avaliação de Qualidade de Texto-para-Vídeo

Nenhuma métrica isolada captura a qualidade de texto-para-vídeo, então combine scores de distribuição, alinhamento CLIP e consistência temporal com revisão humana.

Insights de Modelos

Se eu tivesse que resumir isto a um único ponto, é este: nenhuma métrica isolada consegue julgar bem texto-para-vídeo. Preciso de uma pilha que verifique a qualidade visual, a correspondência com o prompt e o movimento ao longo do tempo. Se eu usar apenas um score, posso perder problemas grandes como clipes estáticos, desvio do prompt ou tremulação de quadros.

Aqui está a versão curta:

  • Métricas de distribuição como a FVD julgam o quão próximos os vídeos gerados estão dos reais como conjunto, mas não verificam se o prompt foi seguido.
  • Métricas de quadro como PSNR, SSIM e LPIPS me ajudam a detectar desfoque, ruído e defeitos de quadro, mas ignoram movimento e correspondência de texto.
  • Métricas de alinhamento como CLIPScore, ViCLIP e scoring baseado em VQA testam se o vídeo mostra os objetos, ações e relações certos.
  • Verificações temporais como fluxo óptico, consistência de sujeito e scores de tremulação me ajudam a ver se o movimento é suave ou se o vídeo simplesmente fica parado para parecer melhor no papel.
  • Benchmarks como VBench, T2VEval e T2VScore combinam muitos sinais, enquanto a revisão humana ainda importa para erros de física, problemas de anatomia e erros de senso comum. Para análise visual automatizada, ferramentas como a visão do GPT-4o podem ajudar a identificar esses defeitos.

Alguns números se destacam. A ETVA alcançou uma correlação de Spearman de 58,47 com o julgamento humano, contra 31,0 para o VideoScore e 13,8 para o CLIPScore. A configuração DEVIL relatou 90%+ de correlação de Pearson para o scoring de dinâmica, e também encontrou uma correlação de Pearson de -88,9 entre consistência de sujeito e dinâmica, o que mostra um claro trade-off entre movimento e estabilidade.

APIMart
Métricas de Qualidade de Texto-para-Vídeo: Um Guia Comparativo Completo

Comparação rápida

Grupo de métricasPara que usoPrincipal ponto cego
Baseadas em distribuiçãoRealismo geral do vídeo em um conjuntoSem compreensão do prompt
Perceptuais em nível de quadroDesfoque, ruído, compressão, defeitos de quadroSem consciência do tempo
Alinhamento texto-vídeoCorrespondência com o prompt: objetos, ações, relaçõesPode perder movimento fino ou ser sensível à redação
Verificações temporais/de movimentoSuavidade do movimento, desvio, tremulação, estabilidadeApenas parte da qualidade
Suítes de benchmark + humanosScoring mais amplo e revisão finalMais computação ou trabalho manual

Então, se estou julgando uma saída de T2V, não pergunto apenas "Parece bom?" Pergunto três coisas: Parece bom? Segue o prompt? Permanece consistente ao longo do tempo? Esses são os benchmarks que usamos ao testar modelos como o Sora 2 para prontidão de produção. Esse é o núcleo do artigo.

Métricas Objetivas Centrais para a Qualidade de Vídeo Generativo

As métricas objetivas ajudam a medir a qualidade visual e a consistência de movimento, mas cada uma olha apenas parte do quadro de T2V. Uma boa forma de lê-las é em camadas: comece com as métricas baseadas em distribuição, depois olhe as métricas em nível de quadro para detectar problemas visuais locais.

Fréchet Video Distance e Medidas Baseadas em Distribuição Relacionadas

A Fréchet Video Distance (FVD) mede a diferença entre as ativações de características de vídeos reais e gerados no espaço de características de um classificador de vídeo pré-treinado, mais frequentemente a I3D. Em bom português, ela verifica o quão próximos os vídeos gerados estão dos vídeos reais como grupo. Como trabalha com características de vídeo, pode refletir também a coerência temporal.

A Fréchet Inception Distance (FID) funciona de forma similar, mas em imagens estáticas com uma rede Inception-v3. Para vídeo, as pessoas geralmente a aplicam quadro a quadro. Isso a torna um substituto visual aproximado, não uma métrica de movimento. Ela não tem noção de fluxo temporal.

O Inception Score (IS) olha tanto a qualidade da imagem quanto a diversidade por meio de distribuições de probabilidade de classe de uma rede Inception. O problema é que depende das classes do ImageNet, o que a torna uma opção fraca para geração de vídeo.

Essas métricas são úteis para o realismo agregado, não para o alinhamento com o prompt. Elas também vêm com trade-offs. A FVD precisa de um grande conjunto de vídeos de referência da mesma distribuição, o que torna as comparações de modelos confusas quando os modelos foram treinados em conjuntos de dados diferentes. E há outro problema: saídas de baixo movimento de modelos como o Kling V3 podem pontuar bem, então você ainda precisa de verificações separadas para a dinâmica. Isso é particularmente relevante ao avaliar modelos de alta fidelidade como o Google Veo 3.1.

MétricaAspecto CapturadoRequisitos de DadosPontos FortesLimitações
FVDDistribuição espaço-temporalGrande conjunto de vídeos de referênciaCaptura coerência temporal e movimentoAlto custo computacional; exige dados de referência; agnóstica ao prompt
FIDDistribuição em nível de quadroGrande conjunto de imagens de referênciaBoa para a fidelidade visual geralIgnora a dinâmica temporal e a consistência
ISQualidade e diversidadeRede Inception pré-treinadaNão precisa de vídeos de referênciaPropensa a overfitting; não consegue distinguir diferenças finas de qualidade

Como esses scores ignoram a semântica do prompt, o próximo passo são as métricas perceptuais em nível de quadro.

SSIM, PSNR e LPIPS para a Qualidade Perceptual em Nível de Quadro

Onde a FVD verifica a distribuição do vídeo, a SSIM, a PSNR e a LPIPS olham quadros individuais. Isso as torna úteis para detectar defeitos de imagem, mesmo que não possam dizer muito sobre movimento ou correspondência de texto.

A PSNR (Peak Signal-to-Noise Ratio) mede as diferenças em nível de pixel entre um quadro gerado e um quadro de referência. É muito rápida, o que é bom, mas costuma fazer um trabalho ruim de corresponder ao julgamento humano. Um pequeno deslocamento de pixel pode derrubar o score mesmo quando a imagem ainda parece boa.

A SSIM (Structural Similarity Index) melhora isso ao comparar luminância, contraste e estrutura. Ela tende a ser mais útil do que a correspondência bruta de pixels, mas ainda precisa de um quadro de referência de verdade fundamental. Também tem dificuldade com a semântica do prompt e o movimento.

A LPIPS (Learned Perceptual Image Patch Similarity) usa características de rede profunda em vez de pixels brutos. Isso geralmente se alinha melhor com o julgamento humano. Mesmo assim, ainda funciona quadro a quadro.

Todas as três compartilham a mesma fraqueza central: avaliam os quadros isoladamente. Não têm consciência temporal nem forma de julgar a aderência ao prompt.

MétricaTipo de MétricaCorrelação com a Percepção HumanaAdequação para Texto-para-Vídeo GenerativoCusto Computacional
SSIMSimilaridade estruturalBaixa a moderadaBaixa (exige verdade fundamental; apenas fidelidade em nível de pixel)Baixo
PSNRFidelidade em nível de pixelBaixaBaixa (sensível a ruído e pequenos deslocamentos)Muito baixo
LPIPSSimilaridade de características profundasModerada a altaModerada (apenas qualidade perceptual em nível de quadro)Moderado

Use essas métricas para detectar desfoque, ruído e artefatos de compressão. Elas são boas ferramentas de diagnóstico para defeitos visuais, mas não medem o alinhamento de texto nem a consistência temporal.

Métricas para Alinhamento de Texto, Movimento e Consistência Temporal

As métricas de alinhamento verificam algo que os scores em nível de quadro deixam passar: o vídeo realmente segue o prompt? Essa é a lacuna que este grupo de métricas tenta preencher.

Scores de Alinhamento Semântico Baseados em CLIP e Cientes de Vídeo

APIMart

A FVD, a SSIM, a PSNR e a LPIPS podem te dizer sobre qualidade visual e similaridade. Elas não podem te dizer se o modelo mostrou o que o prompt pediu. É aí que entram as métricas de alinhamento.

O CLIPScore pega embeddings do prompt de texto e dos quadros de vídeo, depois mede a similaridade de cosseno entre eles. É rápido, simples de executar e frequentemente usado como baseline. Mas também é bastante grosseiro. Pode perder movimento, relações espaciais e pequenos atributos que importam para os espectadores [6].

Variantes cientes de vídeo como a ViCLIP tentam corrigir esse problema. Elas usam pré-treinamento vídeo-texto, então conseguem considerar melhor o movimento e o contexto baseado em tempo do que o CLIPScore simples. Para prompts construídos em torno de ações, esses métodos tendem a corresponder ao julgamento humano mais de perto do que o CLIPScore padrão [1][6].

MétricaBackboneÁrea de FocoVantagensLimitações Conhecidas
CLIPScoreCLIP (ViT)Similaridade com o promptRápido; fácil de computar; baseline padrãoGrosseiro; perde movimento, relações espaciais e atributos finos
ViCLIP / UMTScoreCLIP pré-treinado em vídeo-textoContexto temporal e de movimentoMelhor alinhamento para ações e dinâmicaAinda depende de similaridade de embedding; pode ser sensível à redação do prompt

Quando a similaridade estilo CLIP é ampla demais, o scoring estilo VQA te dá uma leitura mais precisa do que o prompt pediu.

VQA, Scoring Baseado em Legenda e Compreensão do Prompt

A similaridade de embedding tem limites. Dois vídeos podem ficar próximos no espaço de embedding e ainda diferir de formas que uma pessoa notaria imediatamente.

As abordagens baseadas em VQA lidam com isso ao dividir os prompts em pequenas perguntas sobre entidades, atributos e relações. Um LLM multimodal então responde a essas perguntas com base no vídeo.

A ETVA é um bom exemplo. Ela divide os prompts em perguntas atômicas e as responde com um LLM multimodal, o que melhora a concordância com o julgamento humano [6]. Nesta tarefa, a ETVA alcançou uma correlação de Spearman de 58,47 com o julgamento humano, comparada a 31,0 para o VideoScore e 13,8 para o CLIPScore [6].

Métodos baseados em legenda, como o BLIP-BLEU, seguem uma rota diferente. Eles geram uma legenda para o vídeo e comparam essa legenda com o prompt usando BLEU ou ROUGE. Isso pode funcionar para correspondência de nível superficial, mas pode perder movimentos e mudanças de cena mais complexos [6].

Fluxo Óptico e Medidas de Consistência Temporal Baseadas em Benchmark

O alinhamento semântico te diz o que aparece no vídeo. A consistência temporal te diz se esse conteúdo permanece estável de quadro em quadro.

A consistência de sujeito é frequentemente medida com a similaridade de características DINO entre quadros. Se o rosto de uma pessoa muda ao longo do tempo ou um objeto muda de aparência sem motivo, o score cai. A consistência de fundo usa a similaridade de características CLIP entre quadros para detectar mudanças estranhas no fundo [1].

O fluxo óptico, frequentemente estimado com o RAFT, mede a magnitude do movimento e a consistência do fluxo. Isso importa porque alguns modelos, como o MiniMax Hailuo 02, parecem estáveis simplesmente por tornar os vídeos quase estáticos. Isso pode fazer os números de consistência parecerem melhores do que merecem. O protocolo DEVIL relatou uma correlação de Pearson acima de 90% entre sua avaliação de dinâmica e as classificações humanas [3]. Também encontrou uma forte correlação negativa entre a Consistência de Sujeito e a dinâmica, em correlação de Pearson de -88,9, o que mostra um trade-off comum: vídeos de alto movimento podem pontuar pior em consistência mesmo quando o movimento em si está correto [3].

A tremulação temporal é medida de forma mais direta ao computar a diferença absoluta média entre quadros consecutivos. O VBench inclui isso como uma de suas 16 dimensões de avaliação [1].

Juntas, essas verificações ajudam a rastrear movimento, desvio e tremulação. Por conta própria, cada métrica mostra apenas parte do quadro, e é por isso que são frequentemente usadas ao lado de suítes de benchmark e classificações humanas.

Suítes de Benchmark e Métodos de Avaliação Humana

Quando métricas isoladas apontam em direções diferentes, as suítes de benchmark te dão uma forma compartilhada de julgar os resultados. Em vez de se apoiar em um único score, elas agrupam vários sinais em uma configuração, o que torna as comparações de modelos entre estudos muito mais fáceis.

VBench, T2VEval e T2VScore como Benchmarks Multidimensionais

O VBench, o T2VEval e o T2VScore todos tentam julgar mais de uma coisa ao mesmo tempo. Mas não fazem isso da mesma forma. O VBench e o T2VScore olham alinhamento, qualidade e comportamento baseado em tempo em uma única rubrica, enquanto o T2VEval adiciona uma dimensão separada de autenticidade que os outros dois não isolam por conta própria.

O VBench divide a avaliação em 16 dimensões hierárquicas, distribuídas entre qualidade de vídeo e consistência vídeo-condição. Cada dimensão é testada com cerca de 100 prompts [1].

O T2VEval organiza a qualidade em quatro dimensões de nível superior:

  • impressão geral
  • consistência texto-vídeo
  • autenticidade
  • qualidade técnica

Essa divisão importa. Um vídeo pode parecer polido do ponto de vista técnico e ainda parecer falso. O T2VEval-Bench inclui 1.783 vídeos gerados por 13 modelos diferentes, incluindo o Sora, o Runway Gen-3 e o Kling [5].

O T2VScore reduz as coisas a duas dimensões: alinhamento texto-vídeo e qualidade de vídeo. Ele usa Visual Question Answering (VQA) para o alinhamento e uma mistura de especialistas para a qualidade. As duas dimensões têm um ρ de Spearman de 0,223, o que mostra que não se movem juntas muito de perto e devem ser pontuadas separadamente [7].

BenchmarkDimensões MedidasComponentes-ChaveMelhor Caso de Uso
VBench16 dimensões (ex.: consistência de sujeito, suavidade de movimento, tremulação temporal, qualidade estética)DINO, CLIP, RAFT, MUSIQ, GRiT, ViCLIPMelhor para diagnosticar pontos fortes específicos e modos de falha [1]
T2VEval4 dimensões (impressão geral, consistência, autenticidade, qualidade técnica)Fusão multi-ramo com Swin-3D, ConvLexNet-3D e BLIPMelhor para avaliação ampla de qualidade, incluindo realismo [5]
T2VScore2 dimensões (alinhamento texto-vídeo, qualidade de vídeo)VQA, mistura de especialistasMelhor para triagem rápida de alinhamento com o prompt e qualidade visual [7]

Protocolos de Avaliação Humana como o T2VHE

Os benchmarks automatizados são amplos. A revisão humana pega o que eles perdem.

As pessoas detectam erros de física, erros de anatomia e falhas de senso comum quase de imediato. Uma métrica pode não se importar que a água deveria respingar, mas não respinga. Também pode perder um braço se dobrando de uma forma que nenhum corpo humano consegue. Os juízes humanos não deixam passar isso tão facilmente.

O T2VHE (Text-to-Video Human Evaluation) é um protocolo padrão para avaliação humana. Ele dá peso ao treinamento dos anotadores, a regras de scoring claras e a pares de exemplo que ajudam a calibrar o julgamento. Também usa um esquema de scoring dinâmico que pode reduzir a necessidade de anotação manual em cerca de 50% [5].

CaracterísticaMétricas Objetivas (ex.: VBench, T2VScore)Avaliação Humana (ex.: T2VHE, MOS)
CoberturaAlto volume; pode processar milhares de vídeosLimitada por horas de anotador
CustoBaixo (apenas recursos computacionais)Alto (exige anotadores recrutados e remunerados)
VelocidadeQuase em tempo real quando os modelos estão treinadosDias a semanas para grandes conjuntos de dados
NuancePode perder violações sutis de física ou senso comumExcelente em detectar erros de senso comum e distorções sutis
Melhor AdequaçãoDesenvolvimento iterativo de modelos e teste rápidoValidação final e comparações padrão-ouro

Essa divisão prepara a próxima decisão: escolher a pilha de métricas certa para o fluxo de trabalho. Isso é especialmente crítico ao testar modelos de alto desempenho como o Grok Imagine Video.

Aplicando Essas Métricas em Fluxos de Trabalho de Texto-para-Vídeo

Escolhendo uma Pilha de Métricas para Avaliação em Tempo Real e Offline

A ideia principal é simples: adeque a métrica ao trabalho.

Em cada estágio de um pipeline de texto-para-vídeo, você quer um tipo diferente de sinal. Use métricas de alinhamento para verificar se o vídeo se encaixa no prompt. Use scores perceptuais para julgar a qualidade dos quadros. Depois use métricas de movimento para ver se o vídeo permanece estável ao longo do tempo.

Para monitoramento ao vivo, fique com scores leves de alinhamento semântico e qualidade visual. Eles são mais fáceis de executar e se encaixam melhor quando a velocidade importa. Para trabalho offline, a régua é diferente. Se você está comparando modelos, definindo portões de lançamento ou rastreando o desvio de qualidade ao longo do tempo, benchmarks mais pesados como a FVD e o VBench fazem mais sentido [4][1].

O movimento adiciona outra camada. Se um vídeo tem movimento de câmera ou objetos em primeiro plano em movimento, as métricas cientes de movimento e rastreamento importam muito. Os scores padrão podem perder coisas que os humanos notam imediatamente, como o desvio do fundo ou o comportamento trêmulo de objetos.

Como Plataformas de API Unificadas como a APIMart Podem Usar Métricas de Avaliação

APIMart

A mesma pilha de métricas também pode apoiar o roteamento em nível de plataforma e o controle de qualidade.

Uma plataforma de API de IA unificada como a APIMart pode usar essas métricas para rotear prompts, filtrar saídas e manter as verificações de qualidade alinhadas entre os fluxos de trabalho. Isso importa quando uma plataforma está trabalhando com muitos modelos e casos de uso ao mesmo tempo. Você não quer que cada fluxo de trabalho julgue a saída por uma régua diferente.

O roteamento baseado em métricas pode ajudar a enviar cada prompt para o modelo que melhor se encaixa nele. Para o monitoramento ao longo do tempo, a Conditional Fréchet Distance (cFreD) se destaca porque não precisa de retreinamento e pode rastrear o desvio de distribuição generativa de forma plug-and-play [8].

Conclusão: O Que as Métricas Atuais Fazem Bem e Onde a Pesquisa Ainda Está Aberta

Consideradas em conjunto, essas métricas funcionam melhor como uma pilha, não como um único score.

Nenhuma métrica isolada consegue contar a história inteira. Uma boa avaliação significa combinar scores de qualidade de vídeo, medidas de alinhamento de texto, verificações de movimento e consistência temporal, e o julgamento humano em pontos-chave de validação.

As métricas atuais fazem um trabalho decente cobrindo qualidade de quadro, alinhamento semântico e consistência temporal. O problema mais difícil é obter melhor cobertura e explicações mais claras sem adicionar latência. Os avaliadores baseados em LMM parecem promissores aqui porque conseguem explicar por que um vídeo falhou em linguagem natural [2]. Dito isso, eles se encaixam melhor na revisão offline do que no monitoramento ao vivo por enquanto.

Perguntas Frequentes

Por que uma métrica não é suficiente?

Nenhuma métrica isolada consegue fazer o trabalho inteiro porque a qualidade de texto-para-vídeo tem mais de uma parte móvel.

Medidas como a FVD ou o IS podem dizer algo sobre a qualidade técnica ou a similaridade de padrão entre as saídas. Mas elas frequentemente perdem a consistência semântica, o movimento ao longo do tempo, o que as pessoas de fato preferem e se o vídeo se alinha com o prompt de texto em primeiro lugar.

É por isso que uma avaliação melhor olha várias dimensões em vez de se apoiar em apenas um score.

Quais métricas devo combinar primeiro?

Comece com uma abordagem em camadas que divide a qualidade em duas partes: qualidade de vídeo e consistência texto-vídeo.

Antes de se apoiar em métricas como o Inception Score, a Fréchet Video Distance ou o CLIPSim, olhe primeiro as métricas de qualidade técnica e estética juntas. Isso te dá um baseline para o conteúdo espacial e a consistência temporal entre quadros antes de você julgar o quão bem o vídeo corresponde ao prompt de texto.

Quando eu ainda preciso de revisão humana?

A revisão humana ainda importa. As métricas automatizadas frequentemente perdem detalhes que as pessoas notam imediatamente, como consistência temporal, alinhamento semântico, autenticidade, realismo ou objetos irracionais.

As métricas objetivas podem te dar um baseline sólido. Mas elas não correspondem de forma confiável à qualidade real ou à percepção humana. É por isso que os estudos com usuários ainda são necessários: não existe uma medida automática única que consiga capturar todos esses detalhes.

Pronto para testar?

Escolha o modelo que você quer no marketplace

Teste modelos de chat, imagem e vídeo no marketplace da APIMart e experimente rapidamente as capacidades dos modelos com uma API unificada.

Modelos de chatModelos de imagemModelos de vídeo
Explorar marketplace