

Qwen 3.8 Preview: nuevas funciones y acceso a la API
Qwen 3.8 Preview unifica texto, imagen y video con hasta 1M tokens de contexto, nuevas funciones y acceso a la API compatible con OpenAI en APIMart.
Si tuviera que resumirlo en una sola línea: Qwen 3.8 Preview es un modelo de prueba para equipos que necesitan una sola API para texto, imágenes y video, con hasta 262,144 tokens nativos y hasta 1,010,000 tokens mediante RoPE scaling.
Si quieres la respuesta corta, aquí la tienes:
-
Lo consideraría para trabajo multimodal: texto, imagen y video en un mismo flujo de solicitud
-
Lo probaría para tareas con entradas largas: grandes conjuntos de documentos, chats extensos, bases de código y video de una hora de duración
-
No trataría el acceso preview como luz verde para producción sin antes probar la latencia, la calidad de salida y la estabilidad con contexto largo primero
Esto es lo que más importa:
-
Entradas: texto, imágenes y video
-
Salidas: texto, JSON, código, diagramas, llamadas a herramientas y texto a voz
-
Ventana de contexto: 262K nativa, hasta 1.01M con escalado
-
Límites de salida: hasta 32,768 tokens para texto y 16,384 para tareas de visión-lenguaje
-
Endpoint de la API:
https://api.apimart.ai/v1/chat/completions -
Autenticación: token Bearer
-
Formato de solicitud: estilo OpenAI, con arreglos multimodales tipados en
content -
Usos más adecuados: OCR, análisis de documentos, UI-to-code, indexación de video y traspasos de automatización
| Área | Qué tendría en cuenta |
|---|---|
| Acceso | API unificada de APIMart con solicitudes estilo OpenAI |
| Estado del modelo | Preview, por lo que las salidas y configuraciones aún pueden cambiar |
| Contexto largo | Suficientemente grande para tareas intensivas de documentos y video |
| Soporte multimodal | Un solo modelo puede procesar medios mixtos en el mismo flujo |
| Encaje en el flujo de trabajo | Se usa mejor como paso de análisis antes de la generación o automatización posterior |
| Verificación para producción | Pruébalo con tus propios PDF, imágenes, clips y niveles de tráfico |
En otras palabras: esto parece una opción sólida como piloto para cargas de trabajo multimodales y de contexto largo, pero lo validaría con mis propios archivos antes de confiar en él.

Qwen 3.8 Preview: entradas multimodales, contexto largo y capacidades de salida
Modos compatibles: texto, imagen y video
Los cambios de esta preview se ven mejor en lo que Qwen 3.8 puede aceptar y producir.
Qwen 3.8 Preview admite texto, imagen y video en un solo modelo multimodal. Eso significa que puedes trabajar con entradas mixtas en el mismo prompt en lugar de saltar entre sistemas separados. Maneja prompts con múltiples imágenes, análisis de documentos basado en OCR en 32 idiomas, y comprensión de video por fotogramas con indexación a nivel de marca de tiempo para una localización precisa de eventos [4][5].
En cuanto a la salida, puede generar HTML/CSS/JS o diagramas de Draw.io a partir de imágenes o video, producir JSON estructurado y admitir llamadas a herramientas [4][5]. También admite texto a voz nativo con voces personalizables [4]. Para automatización, Visual Agent puede reconocer elementos de la interfaz en PC y móvil, y llamar a herramientas para completar tareas [5].
En pocas palabras, este es el tipo de configuración que ayuda cuando un equipo quiere que un solo modelo lea un documento, inspeccione una captura de pantalla, vea un clip y luego devuelva código o datos estructurados sin cambiar de herramienta a mitad de camino.
Ventana de contexto y límites de salida: qué significan en la práctica
La ventana de contexto nativa es de 262,144 tokens, ampliable a 1,010,000 con RoPE scaling [3]. Las tareas de texto pueden generar hasta 32,768 tokens de salida; las tareas de visión-lenguaje, hasta 16,384 [1].
| Capacidad | Especificación | Uso práctico |
|---|---|---|
| Ventana de contexto nativa | 262K tokens [3] | Revisión de múltiples documentos, bases de código extensas |
| Contexto ampliado | 1M tokens [3] | Documentos muy extensos, bases de código grandes |
| Límite de salida de texto | 32,768 tokens [1] | Chats extensos, generación de contenido detallado |
| Límite de salida VL | 16,384 tokens [1] | Codificación visual, análisis de documentos |
En la práctica, esos límites importan más cuando manejas mucho material de origen a la vez. Una ventana de contexto más grande te da más margen para mantener documentos largos, chats extensos o archivos de código grandes en una sola solicitud. Y con límites de salida más altos, el modelo tiene más espacio para devolver respuestas largas, código o resultados analizados sin cortarse antes de tiempo.
En documentos o videos largos, mantener más material de origen en una sola solicitud reduce la necesidad de dividir las entradas en fragmentos más pequeños. Esa suele ser la diferencia entre un flujo de trabajo fluido y uno que se convierte en trabajo tedioso de copiar y pegar.
Qué hay de nuevo en comparación con versiones anteriores de Qwen
El cambio principal es cómo Qwen 3.8 entrena y maneja los datos multimodales en conjunto. El mayor cambio en la línea Qwen 3 es el entrenamiento de fusión temprana (early fusion), donde los tokens multimodales se entrenan juntos desde el inicio en lugar de ser procesados por codificadores separados [3]. La escala del preentrenamiento también aumentó, alcanzando cerca de 36 billones de tokens [2].
En pocas palabras, el modelo está construido para tratar las señales de texto, imagen y video como parte del mismo sistema desde el principio. Eso importa si quieres que un solo modelo se mueva entre chat, razonamiento y tareas visuales dentro del mismo flujo de trabajo, en lugar de coser esas tareas entre distintos modelos [3].
Como el lanzamiento todavía está en preview, algunas configuraciones de muestreo (sampling) aún pueden necesitar ajustes [3].
Qwen 3.8 Max (probado a fondo): ¡UN VERDADERO COMPETIDOR ABIERTO DE FABLE!
Acceso a la API: disponibilidad, autenticación, endpoints, precios y cuotas
Una vez que sabes qué puede hacer Qwen 3.8 Preview, el siguiente paso es simple: conectarlo a un flujo de API que puedas usar.
Dónde está disponible Qwen 3.8 Preview
Qwen 3.8 Preview está disponible a través de la API unificada de APIMart y un formato de solicitud compatible con OpenAI.
Configuración de autenticación y endpoint
Usa un token Bearer en el encabezado Authorization y envía las solicitudes al endpoint de chat completions de APIMart: https://api.apimart.ai/v1/chat/completions [6].
Durante la fase preview, es más inteligente fijar un snapshot específico del modelo en lugar de apoyarte en un alias -latest. ¿Por qué? Porque un alias cambiante puede modificarse debajo de ti. Un identificador con versión como qwen3-vl-plus-2025-12-19 es una opción más segura que un objetivo cambiante [6].
En las solicitudes multimodales, el campo content se convierte en un arreglo de objetos tipados. El texto usa {"type": "text", "text": "..."}, y la entrada de imagen usa {"type": "image_url", "image_url": {"url": "..."}}. La entrada de imagen admite URLs HTTPS y data URLs en base64. También puedes usar detail (auto, low o high) para equilibrar la calidad de salida frente al costo en tokens.
Ese formato compartido importa más de lo que parece a primera vista. Te permite manejar flujos de texto, imagen y video con la misma forma de solicitud, así que no necesitas código adicional de conexión solo para cambiar el tipo de entrada.
Una vez que tu clave y endpoint están configurados, el siguiente paso es decidir cómo estructurar las solicitudes multimodales sin que el payload quede desordenado.
Precios, cuotas y comparación de rutas de acceso
Con el acceso ya configurado, lo siguiente que hay que revisar es el costo y el comportamiento de las cuotas frente al volumen de solicitudes que esperas.
El precio se basa en tokens y varía según el nivel del modelo. Consulta la página actual del modelo en APIMart para conocer las tarifas vigentes y los límites de cuota. Si envías muchas solicitudes, añade un backoff exponencial para el throttling [6].
Esa es la forma de API que hace práctico combinar el razonamiento de Qwen 3.8 con flujos de generación impulsados por APIMart.
Usar Qwen 3.8 a través de APIMart para flujos multimodales y de automatización

Cómo encaja Qwen 3.8 en la API unificada de APIMart
Una vez configurado el acceso, el siguiente paso es identificar dónde encaja Qwen 3.8 en tu flujo multimodal. En la mayoría de los casos, funciona mejor como la capa de análisis dentro de un pipeline más grande. Esa configuración te da una salida estructurada que puedes pasar a los pasos de generación posteriores sin mucha fricción.
Apunta el base_url de tu SDK a https://api.apimart.ai/v1 y usa tu clave de API de APIMart. Tu código SDK existente puede quedarse igual porque la estructura de la solicitud no necesita cambiar.
Patrones de flujo de trabajo: razonar con Qwen 3.8 y luego crear con modelos de APIMart
El patrón central es simple: Qwen 3.8 hace el razonamiento, y los modelos de imagen o video de APIMart producen la salida final.
Eso funciona bien en distintos equipos. Por ejemplo:
-
Los equipos de medios pueden convertir video en esquemas estructurados de escenas y luego usar esos esquemas para generar clips.
-
Los equipos de e-commerce pueden revisar imágenes de productos, redactar descripciones y luego generar visuales pulidos.
Para trabajos de medios más grandes, este mismo pipeline puede ejecutarse de forma asíncrona con callbacks de estado. APIMart admite gestión asíncrona de tareas con seguimiento de estado y notificaciones por webhook, para que tu pipeline no se quede atascado esperando pasos de generación más lentos.
Decisiones de diseño de integración y tabla de mapeo de capacidades
La gran decisión de diseño aquí es llamada única frente a flujos de trabajo encadenados. Una llamada única encaja bien para tareas directas como el subtitulado de imágenes o preguntas y respuestas sobre documentos. Los flujos encadenados tienen más sentido cuando Qwen 3.8 necesita pasar la salida a un modelo de generación, especialmente si quieres traspasos limpios de JSON entre pasos.
Así es como Qwen 3.8 se mapea a las categorías de modelos de APIMart para el siguiente paso del flujo de trabajo:
| Capacidad de Qwen 3.8 | Categoría de modelo de APIMart | Tipos de entrada | Salida típica | Rol de flujo de trabajo más adecuado |
|---|---|---|---|---|
| Razonamiento y planificación | Chat Completion (Qwen 3.8) | Texto, imagen, video | JSON estructurado, expansión de prompt | Análisis, resumen, expansión de prompt |
| Análisis visual | Chat Completion (Qwen 3.8) | Imagen, video | Descripciones, desgloses de escenas | E-commerce, revisión de medios |
| Creación de video | Video Creation (Kling V3, Sora 2) | Texto, imagen | MP4 720p/1080p | Anuncios sociales, clips explicativos |
| Generación de imágenes | Image Creation (Qwen Image 2.0 Pro) | Texto, imagen de referencia | PNG/JPG 2K | Recursos de marketing, visuales de producto |
| Traspaso de automatización | Chat Completion (Qwen 3.8) | Texto, imagen | JSON estructurado, llamadas a herramientas | Automatización, orquestación de herramientas |
Casos de uso más adecuados y conclusiones finales
Casos de uso que funcionan bien ahora mismo
Ahora que los detalles de acceso y los patrones de flujo de trabajo ya quedaron claros, el siguiente paso es simple: ¿dónde tiene sentido Qwen 3.8 Preview hoy?
Un encaje claro es el trabajo de conocimiento con contexto largo. Puede procesar libros o videos de horas de duración en una sola pasada, lo que significa menos fragmentación para revisiones legales, de cumplimiento y empresariales.
También funciona bien para el análisis de documentos y OCR, especialmente con facturas, formularios y archivos escaneados.
Del lado del desarrollo, puede convertir mockups en código front-end con menos idas y vueltas.
Y para operaciones de contenido, su indexación de video a nivel de marca de tiempo es útil para grabaciones de horas de duración y otros flujos de trabajo conscientes del video.
Cómo evaluar el encaje de la API antes de pasar a producción
Antes de lanzar cualquier cosa, pon a prueba esas fortalezas con tus propios archivos, clips y objetivos de latencia.
Empieza con la precisión multimodal. Envía las imágenes de productos, PDF escaneados y clips de video que esperas usar en producción, y luego compara las salidas con tus criterios de aceptación.
Después, revisa la latencia tanto en el modo thinking como en el modo non-thinking. Mide el tiempo de respuesta y la calidad de salida en cada modo, usando la configuración que corresponda a la tarea.
También deberías probar la fiabilidad con longitudes de contexto usando tus documentos o entradas de video más largos. Aunque el modelo admita entradas muy largas, las cargas de trabajo ultralargas todavía necesitan validación con tus tamaños reales [5].
| Categoría de caso de uso | Modalidad principal | Patrón de integración | Ventaja clave de Qwen 3.8 |
|---|---|---|---|
| Operaciones de contenido | Video | Tarea asíncrona + webhooks | Indexación a nivel de marca de tiempo para video de horas de duración [5] |
| Asistencia para desarrolladores | Imagen/código | Codificación visual | Genera código front-end directamente a partir de imágenes de UI [5] |
| Trabajo de conocimiento | Texto | RAG de contexto largo | Contexto nativo de 256K, ampliable a 1M de tokens [5] |
| Automatización/SaaS | GUI/visión | Visual Agent | Opera interfaces de PC/móvil directamente [5] |
Conclusión: puntos clave para recordar sobre Qwen 3.8 Preview
Qwen 3.8 Preview tiene más sentido como modelo piloto para flujos de trabajo de contexto largo, multimodales y con mucho video. Como todavía es un modelo preview, valídalo con tus propias cargas de trabajo antes de pasar a producción.
Preguntas frecuentes
¿En qué se diferencia Qwen 3.8 Preview de los modelos Qwen anteriores?
Qwen 3.8 Preview se basa en la serie Qwen 3 e incluye hybrid thinking. Eso significa que puede alternar entre razonamiento paso a paso para tareas difíciles y respuestas más rápidas para las más simples.
En comparación con los modelos anteriores, añade un escalado MoE más fuerte, un manejo de contexto más largo y una integración multimodal más profunda entre texto, imagen y video.
¿Cuándo debería usar toda la ventana de contexto largo?
Usa toda la ventana de contexto largo cuando necesites un análisis profundo de grandes cantidades de datos, como libros completos, horas de video o comprensión de código a escala de un repositorio completo.
El modelo admite una ventana de contexto nativa de 256K, y puedes ampliarla a 1M de tokens. Si te encuentras con errores de falta de memoria (out-of-memory), reduce el contexto a 32,768 tokens. Para la mayoría de las instrucciones estándar, 65,536 tokens de salida suelen ser suficientes.
¿Qué debería probar antes de usarlo en producción?
Antes de desplegar Qwen 3.8 en producción, evalúalo con tu tráfico real usando un conjunto de evaluación representativo. Eso te da una imagen mucho más clara de cómo se comportará el modelo una vez en vivo, en lugar de depender de prompts de prueba en el mejor de los casos.
También querrás revisar el gasto esperado en tokens, imágenes y reintentos. Los costos pueden dispararse rápido cuando los reintentos se acumulan sobre solicitudes con muchas imágenes o de contexto largo, así que vale la pena hacer los cálculos de antemano.
Prueba también tu endpoint unificado compatible con OpenAI, especialmente para el manejo del contexto y el manejo de límites de tasa. Sobre el papel, todo puede verse bien. En la práctica, el estado de sesión, el tamaño del prompt y la lógica de reintentos suelen ser donde las cosas se complican.
Usa un dry run para validar la configuración antes de enviarle tráfico en vivo. Es un paso simple, pero puede ahorrarte tener que perseguir errores evitables más adelante.
Aquí importan algunos hábitos básicos:
-
Rota las claves de API de forma periódica
-
Mantén separadas las claves de desarrollo y staging
-
Registra solo el task_id
Ese último punto es fácil de pasar por alto, pero ayuda a reducir el riesgo de exponer datos de prompts o de usuarios en los logs.
Elige el modelo que quieres en el marketplace
Prueba modelos de chat, imagen y video en el marketplace de APIMart y experimenta rápidamente sus capacidades con una API unificada.
