APIMart
UniNote: embeddings multimodales unificados

UniNote: embeddings multimodales unificados

Descubre cómo UniNote de Xiaohongshu proyecta texto, imágenes, audio y vídeo en un único espacio de embeddings compartido para unificar la recuperación, el ranking y la búsqueda.

Análisis de modelos

La idea principal de Xiaohongshu es sencilla: una nota, un embedding y una ruta de búsqueda. En lugar de gestionar texto, imágenes, vídeo y audio en sistemas separados, UniNote los sitúa en un único espacio vectorial compartido tanto para la recuperación como para el ranking.

Si tuviera que resumir el artículo, esto es lo que me parece más importante:

  • UniNote crea un embedding multimodal por nota
  • Utiliza dos etapas de entrenamiento, que incluyen la función de pérdida InfoNCE y la minería de negativos difíciles
  • Busca emplear el mismo sistema de embeddings para la recuperación y el ranking
  • El objetivo es mejorar la búsqueda entre modalidades, por ejemplo, al relacionar una foto con la página de un producto o con un clip de vídeo
  • El artículo señala mejoras en la recuperación entre modalidades, incluido un resultado citado de hasta 26 puntos porcentuales en NDCG@10 procedente de trabajos relacionados sobre espacios compartidos
  • Las limitaciones siguen siendo claras: discordancias de detalle, ventanas temporales de vídeo de 3 a 25 segundos y errores de ranking cuando las señales no coinciden

En otras palabras, esto tiene menos que ver con añadir otro modelo y más con eliminar los flujos fragmentados entre distintos tipos de contenido. Para los equipos que trabajan en búsqueda, feeds o descubrimiento de productos, puede suponer un solo índice, un flujo de sistema más sencillo y menos discrepancias entre la recuperación y el ranking.

Mi conclusión es directa: los embeddings compartidos pueden simplificar la operación de la búsqueda multimodal, pero la calidad de la alineación sigue determinando si los resultados parecen correctos.

Qwen3-VL-Embedding y Qwen3-VL-Reranker: un marco unificado para la recuperación multimodal de vanguardia

Qwen3-VL-Embedding

Cómo funciona UniNote: arquitectura, entrenamiento y diseño de recuperación y ranking

UniNote

Cómo funciona UniNote: flujo unificado de embeddings multimodales
Cómo funciona UniNote: flujo unificado de embeddings multimodales

Representación unificada de notas entre modalidades

UniNote convierte audio, imágenes y vídeo en un formato de nota compartido mediante ASR, OCR y VLM antes de proyectar esas señales en un espacio vectorial común. Cada modalidad pasa por su propio codificador, y unas capas de proyección entrenables trasladan esas salidas a un único espacio de alta dimensionalidad. El resultado final es un embedding por nota, construido a partir de las señales que contenga la nota.

Esta configuración proporciona a Xiaohongshu un único flujo de búsqueda para texto, imágenes, vídeo y audio. En vez de tratar cada formato como una isla independiente, el sistema los coloca en el mismo mapa.

Por supuesto, esto solo funciona si el modelo aprende una alineación sólida entre formatos.

Entrenamiento en dos etapas y minería de negativos difíciles

UniNote utiliza un enfoque de dos etapas.

En la primera, aplica aprendizaje contrastivo con la función de pérdida InfoNCE. Así enseña al modelo a acercar el contenido coincidente, incluso cuando aparece en formatos distintos.

En la segunda etapa, la atención se desplaza hacia la calidad del ranking mediante optimización basada en la relevancia y minería de negativos difíciles. Los negativos difíciles son elementos que parecen cercanos por su contexto, pero cuyo significado sigue siendo incorrecto. Esto es muy importante: si un modelo puede distinguir las coincidencias aparentes de las reales, el ranking gana precisión.

UniNote también utiliza embeddings de longitud variable. Esto permite acortarlos cuando una tarea no necesita la máxima precisión. Dicho de forma sencilla, el sistema puede sacrificar un poco de detalle a cambio de consumir menos almacenamiento y acelerar la recuperación.

El mismo embedding puede encargarse entonces tanto de recuperar candidatos como de elaborar el ranking final.

Por qué un solo modelo para recuperación y ranking simplifica el diseño del sistema

Muchos sistemas de recomendación usan un modelo para la recuperación y otro para el ranking. Sobre el papel, parece una solución ordenada. En la práctica, puede generar diferencias entre las etapas: un modelo aprende un concepto de relevancia y el otro, uno ligeramente distinto.

UniNote evita esa separación. Utiliza un único marco de embeddings para la recuperación y el ranking, lo que mantiene alineadas ambas etapas. Esta configuración compartida ayuda a que la recuperación y el ranking se comporten del mismo modo en producción.

La siguiente pregunta es qué tal rinde este diseño en tareas de recuperación reales.

Qué muestra la investigación: tareas, resultados y limitaciones actuales

Tareas de recuperación entre elementos y alcance de la evaluación

UniNote se probó en tareas de recuperación entre elementos. Dicho de forma sencilla, el modelo intenta relacionar el mismo contenido o contenido relacionado en distintos formatos dentro de un único espacio de embeddings compartido.

La prueba central es bastante simple: ¿puede un único embedding conectar contenido entre formatos sin dirigir la recuperación por flujos separados? Esto importa más de lo que podría parecer a primera vista. El mismo embedding debe cumplir una doble función: tiene que admitir tanto la recuperación como el ranking y, al mismo tiempo, preservar el significado entre modalidades.

Mejoras de rendimiento en la recuperación entre modalidades

En las evaluaciones de recuperación, UniNote comprueba si un único espacio compartido puede mejorar la calidad de las coincidencias sin depender de flujos separados para cada modalidad. GR-CLIP, que vuelve a centrar los clústeres en un espacio de embeddings compartido, mejoró NDCG@10 hasta 26 puntos porcentuales frente a CLIP estándar[1].

No es una mejora pequeña. En los sistemas de recuperación, incluso los cambios modestos en las métricas de ranking pueden alterar de forma perceptible las recomendaciones posteriores.

Aun así, nada es gratis. Esas mejoras conllevan ciertas contrapartidas.

En qué siguen fallando los embeddings unificados

Los embeddings unificados siguen teniendo problemas cuando las modalidades no se alinean con claridad. En esos casos, el sistema puede ordenar mal los resultados o producir errores que recuerdan un poco a las alucinaciones. El rendimiento también puede caer con contenido muy detallado, sobre todo cuando las señales visuales y textuales apuntan en direcciones distintas.

El vídeo es otro punto problemático. Muchos sistemas todavía trabajan con apenas 3 a 25 segundos de contexto temporal, lo que impone un límite estricto a la cantidad de significado secuencial que pueden utilizar.

Esto se convierte en un problema aún mayor en sistemas dinámicos de búsqueda y recomendación que gestionan contenido de formatos mixtos a gran escala.

Usos prácticos en búsqueda, recomendación y flujos de trabajo de IA multimodal

Esas mejoras en la recuperación solo importan si facilitan la operación de la búsqueda y las recomendaciones en producción.

Búsqueda y recomendación entre modalidades para el comercio social y los medios

El principal caso de uso de los embeddings al estilo de UniNote es el descubrimiento de productos y la asociación de contenido. Con un sistema de embeddings unificado, una sola consulta puede relacionar la foto de un comprador con la ficha de un producto, una reseña de un creador o un vídeo corto sin obligar a los equipos a construir flujos separados para cada formato.

Esto es especialmente importante en el comercio social y los medios. Una persona podría subir una captura de pantalla, pegar un pie de foto o buscar por el nombre de un producto. Si todas esas entradas se encuentran en el mismo espacio de embeddings, el sistema tiene muchas más posibilidades de devolver elementos relacionados en forma de texto, imágenes y vídeo.

También mejora las recomendaciones. Las publicaciones, los pies de foto y los clips relacionados permanecen lo bastante cerca entre sí como para formar grupos de contenido más cohesionados y ofrecer mejores sugerencias en el feed. Además, desde el punto de vista operativo, los equipos pueden mantener un solo índice en vez de varios, lo que elimina muchos componentes adicionales.

Consideraciones sobre indexación multimodal, latencia e infraestructura

Adoptar un modelo de embeddings unificado cambia la indexación de forma muy directa. En lugar de ejecutar almacenes vectoriales separados para texto, imágenes y vídeo, los equipos pueden consolidarlos en un único índice de vecinos más próximos aproximados (ANN). Esto simplifica el enrutamiento de consultas y reduce la carga operativa.

El vídeo añade otra dimensión. Los equipos necesitan un preprocesamiento que conserve las señales temporales sin ralentizar la recuperación. En la práctica, esto suele implicar:

  • Muestrear fotogramas
  • Codificar clips mediante el mismo flujo multimodal
  • Mantener una recuperación lo bastante rápida para su uso en producción

Esta configuración también reduce la carga de integrar modelos. No hace falta conectar una ruta para el texto, otra para las imágenes y una más para el vídeo. El flujo se simplifica y eso suele traducirse en menos problemas de mantenimiento más adelante.

Cómo encaja APIMart en los flujos de trabajo multimodales unificados

APIMart

APIMart ofrece modelos de texto, imagen y vídeo mediante un único endpoint compatible con OpenAI (api.apimart.ai/v1). Esto reduce la carga asociada a los contratos, la autenticación y los límites de solicitudes.

Para los equipos que crean flujos de trabajo multimodales, esto significa que una sola capa de integración puede gestionar distintos tipos de modelos sin reescribir la infraestructura cada vez. El trabajo de ingeniería se concentra en la lógica de los embeddings y del negocio, no en la gestión de API.

Conclusiones clave para desarrolladores y equipos de IA

Qué aprender de UniNote

Después de analizar la recuperación y la infraestructura, la conclusión principal es operativa: UniNote utiliza un único espacio semántico para gestionar la búsqueda multimodal y el ranking. Esto importa porque los flujos separados tienden a producir resultados incoherentes a gran escala.

En términos sencillos, hay menos traspasos entre modalidades y menos discrepancias de ranking. Para los desarrolladores, eso implica menos componentes en la búsqueda entre modalidades. Relacionar imágenes de productos con descripciones, vincular vídeos cortos con pies de foto y ejecutar búsquedas multimodales para el comercio social resulta más sencillo cuando el mismo embedding se encarga tanto de la recuperación como del ranking, sin unir modelos independientes para cada formato.

El paso práctico es claro. Construye la indexación, la recuperación y las recomendaciones en torno a un único espacio semántico compartido, de modo que se puedan incorporar nuevas modalidades sin tener que reconstruir todo el flujo. Un índice, una lógica de ranking y menos puntos de integración.

Preguntas frecuentes

¿Cómo se crea un embedding a partir de contenido multimedia mixto?

UniNote y otros sistemas similares crean un único embedding proyectando texto, imágenes, vídeo y audio en un espacio vectorial semántico compartido.

Normalmente se apoyan en modelos basados en transformers para convertir cada tipo de entrada en una representación unificada. A partir de ahí, utilizan atención entre modalidades y capas de proyección para alinear la misma idea en distintos formatos. Esto permite al sistema medir la similitud semántica entre diferentes tipos de contenido.

¿Por qué usar el mismo embedding para la recuperación y el ranking?

Usar el mismo embedding para la recuperación y el ranking mantiene todo en un único espacio semántico compartido. Esto importa más de lo que podría parecer a primera vista.

Cuando el texto, las imágenes y el vídeo se proyectan de la misma manera, se pueden comparar directamente. Una consulta escrita puede alinearse con una imagen. Un vídeo puede coincidir con una descripción textual. El contenido relacionado permanece sincronizado entre formatos en vez de separarse poco a poco.

Esto mejora la búsqueda y la recuperación entre modalidades, reduce la brecha entre ellas y ayuda a que los flujos de recomendación se mantengan estables y coherentes.

¿Cuáles son hoy las mayores limitaciones de UniNote?

UniNote encuentra sus principales limitaciones cuando intenta situar texto, imágenes, vídeo y audio en un único espacio semántico compartido. En teoría parece sencillo. En la práctica, estas modalidades no se alinean por sí solas, por lo que el entrenamiento se vuelve más difícil y las representaciones aprendidas pueden ser más débiles.

Durante el entrenamiento conjunto surge otro problema: la pereza o el conflicto entre modalidades. Dicho de forma sencilla, el modelo puede depender demasiado de la entrada más fácil y prestar menos atención a las demás. Esto puede dejar algunas modalidades insuficientemente entrenadas. Y cuando los datos del mundo real están incompletos, por ejemplo, si falta el audio, el problema empeora. El modelo puede rendir peor en general o depender demasiado de la modalidad que resulte ser la más sólida.

¿Listo para probar?

Elige el modelo que quieres en el marketplace

Prueba modelos de chat, imagen y video en el marketplace de APIMart y experimenta rápidamente sus capacidades con una API unificada.

Modelos de chatModelos de imagenModelos de video
Explorar marketplace