
La IA multimodal mejora la compresión de video
Descubre cómo la IA multimodal transforma la compresión de video usando texto, audio, movimiento e intención para recortar la tasa de bits sin perder detalles.
La compresión de video está pasando de la coincidencia de píxeles a decisiones basadas en el significado. A partir de la investigación de este artículo, mi conclusión principal es simple: cuando la IA usa texto, audio, movimiento o intención del usuario junto con el video, puede recortar la tasa de bits con más fuerza mientras conserva las partes que más importan.
Aquí está la versión corta:
- Los códecs aprendidos solo con lo visual ya son fuertes. STAC registró un ahorro de tasa BD del 32,20% sobre VTM-17.0.
- Los métodos multimodales cambian la asignación de bits. Usan el significado de la escena, el ritmo o los objetivos de la tarea para decidir qué recibe más bits.
- Los sistemas basados en tokens pueden recortar mucho la carga. AdaCodec redujo el uso de tokens visuales en un 84,6% y bajó el TTFT de 9,26 segundos a 1,62 segundos.
- La compresión centrada en la tarea puede recortar el desperdicio de cómputo. EMC mejoró la eficiencia de inferencia en un 33,7% para el trabajo de video-lenguaje.
- Los métodos generativos pueden empujar la tasa de bits muy abajo. Resultados recientes alcanzaron 0,005 bpp e incluso por debajo de 0,002 bpp a 1080p.
- El compromiso es el costo del decodificador. Un menor costo de transmisión suele significar más trabajo de GPU en el lado receptor, con tiempos de decodificación de alrededor de 1,85 a 2,48 segundos para un GOP de 29 fotogramas en GPU de consumo y prosumidor.
Lo que esto significa para ti: si tu objetivo es el streaming o el almacenamiento, la calidad de píxel sigue importando. Pero si tu objetivo es la vigilancia, la IA en el borde, la respuesta de emergencia, la educación o el comercio, entonces la compresión semántica y consciente de la tarea puede importar más que la reconstrucción perfecta del fotograma.

Entender es comprimir: los modelos LLM aplastan todos los métodos de compresión conocidos actualmente
Comparación rápida
| Método | Entrada principal más allá de los píxeles | Objetivo principal | Resultado de ejemplo |
|---|---|---|---|
| Códec aprendido solo con lo visual | Ninguna | Menor tasa de bits con alta calidad de reconstrucción | STAC: ahorro de tasa BD del 32,20% |
| Visión + texto | Conversaciones multimodales usando descripciones de texto del contenido de la escena | Conservar el detalle semántico a tasa de bits ultrabaja | M3-CVC superó a VVC en LPIPS y CLIP-sim |
| Audio + video | Ritmo del audio y pistas de eventos | Conservar el ritmo de los eventos y los momentos clave | CMVC apunta a configuraciones de tasa de bits ultrabaja y extremadamente baja |
| Compresión multimodal consciente de la tarea | Señales de la tarea posterior | Conservar solo la información útil para la tarea | EMC: 33,7% mejor eficiencia de inferencia |
| Compresión de tokens impulsada por intención | Instrucciones del usuario o prioridad de tokens | Gastar bits en lo que le importa al usuario | TokenCom mantiene alta precisión para tokens de alta prioridad |
| Compresión generativa | Latentes compactos más priores del decodificador | Reconstruir el detalle a partir de muy pocos bits transmitidos | Tan baja como por debajo de 0,002 bpp a 1080p |
Así que si reduzco el artículo a un solo punto, es este: la IA multimodal ayuda a los códecs a decidir qué importa, no solo qué cambió. Ahí es donde proviene buena parte del progreso actual.
Lo que muestran los estudios recientes sobre la compresión multimodal
Los códecs aprendidos solo con lo visual como referencia
El marco STAC (Contexto Adaptativo Espacio-Temporal) da una imagen clara de dónde se encuentran ahora mismo los códecs aprendidos solo con lo visual. Entregó un ahorro promedio de tasa BD del 32,20% sobre VTM-17.0 (VVC) [2], y superó al modelo de vanguardia anterior, DCMVC, por 2,7 puntos porcentuales. STAC hace esto con un Selector de Contexto Adaptativo que elige los fotogramas de referencia más útiles, además de un modelo de entropía de doble ruta que mejora la predicción [2].
Eso conduce a una mejor fidelidad a nivel de píxel. Pero hay un inconveniente: STAC todavía funciona sin contexto semántico. Así que establece una referencia fuerte para la compresión visual, mientras deja bastante obvio el siguiente paso. Si un modelo puede entender el significado de la escena, puede colocar los bits donde más importan en lugar de tratar cada región como si mereciera la misma atención.
Cómo las señales semánticas y cruzadas de modalidad cambian las decisiones del codificador
La idea principal detrás del trabajo multimodal reciente es simple: no todas las partes de un fotograma necesitan el mismo número de bits. Una vez que un codificador tiene cierta noción de lo que está pasando en la escena, puede gastar más en las regiones importantes y ser más agresivo en todo lo demás.
AdaCodec de la Universidad Jiao Tong de Shanghái y JD.com es un buen ejemplo. Almacena los cambios de fotograma a fotograma como P-tokens y conserva los tokens visuales completos para los fotogramas de referencia [3]. Esa configuración recortó el uso de tokens visuales en un 84,6% y redujo el tiempo hasta el primer token (TTFT) de 9,26 segundos a 1,62 segundos [3]. También superó a la referencia Qwen3-VL-8B en benchmarks de video largo mientras usaba solo alrededor de una séptima parte del presupuesto de tokens [3].
Otro camino se centra menos en reconstruir píxeles y más en conservar solo lo que necesita la tarea final. La Compresión Multimodal Endomórfica (EMC) sigue esa idea al preservar solo la información necesaria para tareas como VideoQA. Dicho llanamente, aplica lógica de compresión a la evidencia semántica en lugar de a los píxeles brutos. Cuando se integró EMC, mejoró la eficiencia de inferencia en un 33,7% y la eficiencia de entrenamiento en un 7,33% para la comprensión de video-lenguaje [4].
Así que la división se vuelve más clara. Los códecs solo visuales persiguen la fidelidad. Los métodos multimodales empujan hacia la consistencia semántica y el uso de tokens consciente de la tarea.
Dónde encaja APIMart para el prototipado y el despliegue

Para los equipos que construyen y prueban estas canalizaciones cruzadas de modalidad, APIMart puede hacer que el trabajo inicial sea menos caótico. Ofrece una sola API para probar juntos modelos de video, imagen y lenguaje, lo que ayuda cuando quieres probar cómo las señales cruzadas de modalidad cambian la selección de fotogramas y la reconstrucción.
Tres señales multimodales que mejoran la compresión
La sección anterior mostró, a alto nivel, cómo las señales semánticas y cruzadas de modalidad cambian las decisiones del codificador. A través de las tres direcciones aquí, el patrón es bastante claro: la conciencia semántica cambia dónde van los bits, el ritmo audiovisual afina qué se queda y la intención a nivel de token estrecha aún más el proceso.
Compresión consciente de la semántica usando señales de visión y texto
Estos métodos muestran cómo el texto y la visión pueden dirigir la tasa de bits hacia el contenido semántico. Si un codificador sabe qué importa en una escena, puede enviar más bits a las regiones importantes y comprimir todo lo demás con más fuerza.
M3-CVC (Universidad de Fudan, diciembre de 2024) usa un gran modelo multimodal basado en diálogo para extraer descripciones de texto jerárquicas de los fotogramas. Luego usa esas descripciones para guiar un decodificador basado en difusión durante la reconstrucción a tasas de bits ultrabajas. El resultado: supera a VVC por un margen claro en LPIPS y CLIP-sim, incluso en casos donde VVC muestra fuertes artefactos de bloque [1].
SMC++ (Universidad Jiao Tong de Shanghái y Laboratorio de IA de Shanghái, octubre de 2025) recorta el detalle que cuesta bits pero no ayuda a la tarea posterior. Lo hace con un objetivo de Modelado de Video Enmascarado, mientras que un Transformer guiado alinea las características a través de las modalidades. A través de 7 conjuntos de datos y 3 tareas —reconocimiento de acciones, MOT y VOS—, SMC++ mantuvo alta la precisión de la tarea incluso cuando la capa base VVC sufría una degradación de señal severa [6].
La misma idea se traslada también a las señales basadas en el tiempo. En lugar de preguntar solo qué importa en el fotograma, estos sistemas también preguntan cuándo importa.
Compresión consciente del audio para el habla y el ritmo de eventos
El ritmo audiovisual y la estructura de eventos ayudan a los modelos a elegir fotogramas clave representativos y segmentos de movimiento. Eso baja la tasa de bits sin desajustar el ritmo de los eventos [5]. En la Codificación de Video Cruzada de Modalidad (CMVC), los videos se dividen en contenido espacial y componentes de movimiento, y luego se convierten en representaciones multimodales compactas [5].
"Los MLLM destacan en el manejo de datos secuenciales y la comprensión de las relaciones temporales de los eventos en los videos." - Pingping Zhang et al. [5]
| Enfoque | Objetivo de tasa de bits | Enfoque de la métrica de calidad | Tecnología clave |
|---|---|---|---|
| TT2V (CMVC) | Ultrabaja (ULB) | Consistencia semántica | Generación de texto a video [5] |
| IT2V (CMVC) | Extremadamente baja (ELB) | Consistencia perceptual | Imagen-texto a video + LoRA [5] |
Eso desplaza la compresión del almacenamiento fotograma a fotograma hacia una representación consciente de eventos. Y a partir de ahí, el siguiente paso es aún más ajustado: comprimir según la intención directa del usuario.
Compresión impulsada por tokens para la intención del usuario
Video TokenCom da precisión completa a los tokens relevantes para la intención y baja la precisión de los de menor prioridad. En palabras sencillas, el sistema gasta bits en lo que le importa al usuario y afloja en todo lo demás, lo que recorta la tasa de bits mientras conserva intacto el contenido más importante [7].
"La Comunicación por Tokens (TokenCom) es un nuevo paradigma... donde los tokens sirven como unidades unificadas de comunicación y cómputo, permitiendo un intercambio de información eficiente y orientado a la semántica y a los objetivos." - Jingxuan Men et al. [7]
| Enfoque de codificación | Comportamiento de la tasa de bits | Preservación del detalle | Mejor caso de uso |
|---|---|---|---|
| Codificación uniforme | Constante en todo el fotograma | Distribución uniforme del detalle | Entrega de video de referencia |
| TokenCom guiado por intención semántica | Menor para tokens de menor prioridad | Mayor detalle para el contenido relevante para la intención | Compresión de video guiada por el usuario |
En lugar de tratar cada parte de un fotograma igual, este enfoque hace la compresión consciente del objetivo y selectiva [7].
Compresión generativa y compromisos del despliegue en tiempo real
Cómo los métodos generativos y basados en tokens reducen la tasa de bits
Basándose en la compresión a nivel de token, los métodos generativos van más allá. En lugar de conservar cada píxel, reconstruyen el detalle visual en el decodificador. En la práctica, la compresión generativa envía una representación latente compacta y luego usa priores generativos para rellenar lo que no se transmitió.
Ese cambio puede recortar drásticamente la tasa de bits. La demostración de satélite marítimo de mediados de 2025 de TeleAI alcanzó 0,005 bpp, y el GVCC de cero disparos de abril de 2026 de Waseda entregó una reconstrucción a 1080p por debajo de 0,002 bpp mientras reducía LPIPS en un 70,3% frente a DCVC-RT [9] [10].
La compresión basada en tokens toma otro camino. La Compresión de Video Tokenizada (TVC) usa tokens enmascarados y predicción espaciotemporal para aprovechar la redundancia semántica a través de los fotogramas [8].
Restricciones en tiempo real: cómputo, latencia y costo
Esos recortes de tasa de bits solo importan si la decodificación se mantiene lo bastante rápida para producción. Ahí es donde aparece el compromiso en términos claros: a medida que baja la tasa de bits, más carga se traslada de la transmisión a la inferencia. Así que el decodificador tiene que ejecutar modelos grandes en tiempo real.
Los números lo dejan claro. En una NVIDIA L40S, una RTX 4090 y una RTX 4080, la decodificación GVC para un GOP de 29 fotogramas toma 1,85 segundos, 2,12 segundos y 2,48 segundos [9].
Este es el compromiso compresión-cómputo-calidad. Dicho de forma sencilla, ahorras ancho de banda, pero lo pagas con más trabajo de decodificación. Por eso la destilación y el muestreo más rápido son las rutas principales hacia el despliegue de nivel de consumidor [9].
Usar APIMart para probar flujos de trabajo de video multimodal
Para el prototipado, APIMart puede unir la extracción semántica, la reconstrucción y la evaluación en un solo flujo de trabajo. Los equipos pueden usarlo para encadenar modelos de video, imagen y lenguaje a través de una sola API para la extracción semántica, la reconstrucción y la prueba de latencia.
Si intentas ver cómo se comporta una canalización de video multimodal antes del despliegue completo, esa es una forma práctica de probar las piezas móviles en un solo lugar.
Conclusión: qué cambia la IA multimodal para la compresión de video
La IA multimodal cambia la compresión de video de una forma simple pero importante: mueve el objetivo de coincidir píxeles a conservar lo que importa para el trabajo. Las señales semánticas, las pistas de audio y los datos de mirada ayudan al sistema a gastar bits en las partes que llevan más significado. El resultado es una mejor compresión porque el códec protege la información que las personas o los sistemas posteriores realmente necesitan. Este cambio es central para la forma en que las plataformas de IA unificadas gestionan salidas de modelos diversas.
Puedes ver ese cambio tanto en la calidad visual como en el uso de tokens. Los resultados de los benchmarks lo respaldan. STAC alcanzó un ahorro de tasa BD del 32,20% sobre VTM-17.0 [2], mientras que AdaCodec recortó el uso de tokens visuales en un 84,6% y mantuvo o mejoró la precisión [3].
Por eso la compresión generativa tiene más sentido cuando la piensas como comunicación orientada a la tarea [9].
¿Dónde importa primero? Las ganancias a corto plazo son más fuertes en entornos con ancho de banda limitado y sensibles a la tarea, incluyendo:
- vigilancia
- respuesta de emergencia
- dispositivos de borde
- educación
- comercio
El principal compromiso sigue siendo el costo del decodificador. El cómputo del decodificador sigue siendo el cuello de botella, aun así, los modelos generativos más pequeños ya se están acercando a cerca de 2 segundos de inferencia en GPU de consumo [9].
Preguntas frecuentes
¿En qué se diferencia la compresión multimodal de la compresión de video normal?
La compresión de video suele intentar conservar tanto detalle de píxel como sea posible en cada fotograma. La compresión multimodal toma un camino diferente. Se centra más en la información necesaria para los objetivos posteriores o la calidad perceptual que en reproducir cada píxel individual.
Con los modelos generativos, intercambia ancho de banda por cómputo. El emisor describe la composición y el estilo de un video, y la IA en el lado receptor lo reconstruye a partir de esa descripción.
¿Cuándo debería elegir la compresión semántica en lugar de la calidad de píxel perfecto?
Elige la compresión semántica cuando el objetivo sea ayudar a las tareas posteriores o coincidir con lo que las personas necesitan ver, no mantener la precisión a nivel de bit.
Funciona especialmente bien en entornos de bajo ancho de banda, como las conexiones por satélite, donde los códecs de precisión de píxel pueden fallar o producir artefactos severos. Los métodos semánticos intercambian cómputo por compresión al conservar la información relevante para la tarea en lugar de usar bits en texturas de fondo redundantes.
¿Cuáles son los mayores compromisos con la compresión de video generativa?
El principal compromiso es un alejamiento de la precisión estricta píxel a píxel y hacia la calidad semántica y perceptual.
Los códecs de la vieja escuela intentan reducir el error de píxel. Pero cuando el ancho de banda se aprieta, ese enfoque suele desmoronarse de formas que los espectadores pueden detectar de inmediato: bloques, desenfoque y parpadeo temporal.
La compresión generativa toma un camino diferente. Se apoya en priores fuertes para sintetizar detalle de alta calidad y empujar la compresión mucho más lejos.
El detalle es simple: el video reconstruido puede verse convincente y de alta calidad, incluso cuando no coincide con el fotograma original píxel por píxel. En otras palabras, tiende a favorecer la plausibilidad visual sobre la replicación exacta.
Elige el modelo que quieres en el marketplace
Prueba modelos de chat, imagen y video en el marketplace de APIMart y experimenta rápidamente sus capacidades con una API unificada.