APIMart
Modelos Apache 2.0 de Cohere e IA autoalojada

Modelos Apache 2.0 de Cohere e IA autoalojada

Descubre la hoja de ruta de modelos Apache 2.0 de Cohere para texto, voz, código e IA multilingüe, además de las ventajas y contrapartidas del despliegue autoalojado.

Análisis de modelos

Si quieres ejecutar IA dentro de tu propia infraestructura, la hoja de ruta de julio de 2026 de Cohere lo hace mucho más sencillo. Yo lo resumiría así: Cohere está incorporando más familias de modelos a Apache 2.0, lo que permite utilizarlas en proyectos comerciales, modificarlas y alojarlas por cuenta propia sin los problemas de licencia que suelen ralentizar los proyectos empresariales de IA.

Esta es la versión breve:

  • Qué cambió: Cohere ya ofrece modelos Apache 2.0 para casos de uso de texto, voz, código y varios idiomas.
  • Qué modelos importan: Command A+, Cohere Transcribe, North Mini Code y partes de la familia Aya.
  • Por qué interesa a los equipos: Apache 2.0 permite usar, modificar y distribuir los pesos del modelo, también en productos de pago.
  • Qué sigue siendo responsabilidad del equipo: aún hay que gestionar la infraestructura, los avisos, los archivos de licencia y la revisión de la cláusula de patentes.
  • Dónde encajan estos modelos: en instalaciones locales, VPC privadas o configuraciones híbridas donde los datos privados permanecen en el entorno local.
  • Quién debería prestar atención: los equipos que trabajan con PII, PHI, documentos internos, búsquedas reguladas, asistentes privados o transcripción local.
  • Cifras clave del artículo:
    • Command A+: modelo MoE de 218B
    • Precio de la API de Command A+: $2.50 por 1 millón de tokens de entrada y $10.00 por 1 millón de tokens de salida
    • Ventana de contexto: 128K tokens, con una posible ampliación a 1 millón
    • WER de Cohere Transcribe: 5.42% frente al 7.44% de Whisper Large v3
    • Velocidad de Transcribe: unos 525 minutos de audio por minuto de tiempo real
    • Acceso mediante APIMart: 500+ modelos de IA a través de una sola API

Lo que esto significa para ti es sencillo: si tu equipo busca un mayor control de los datos, el despliegue y los costes a largo plazo, la estrategia de pesos abiertos de Cohere es ahora una opción más sólida que una IA disponible solo como servicio alojado.

Cómo crear un clon autoalojado de ChatGPT con la IA de Cohere

Cohere

Comparación rápida

OpciónControlLos datos permanecen en tu entornoTrabajo inicial de infraestructuraOpción ideal
Modelos de Cohere autoalojadosAltoAltoCargas de trabajo reguladas, privadas y aisladas de la red
Configuración híbrida con APIMartMedio a altoSí, para los flujos sensiblesMedioEquipos que separan las cargas privadas de las externas
Solo API gestionadaBajoNoBajoLanzamientos rápidos y menos operaciones internas

Para mí, la conclusión principal es esta: Apache 2.0 elimina un gran obstáculo legal, pero tu equipo todavía necesita las GPU, el sistema de MLOps y la configuración de cumplimiento adecuados para que el autoalojamiento funcione bien.

Qué está cambiando en la hoja de ruta de modelos de Cohere

Apache 2.0 de Cohere frente a CC-BY-NC y API propietaria: comparación de licencias para IA autoalojada
Apache 2.0 de Cohere frente a CC-BY-NC y API propietaria: comparación de licencias para IA autoalojada

Cohere está incorporando varias familias de modelos insignia a Apache 2.0. Esto ofrece a los equipos una vía mucho más clara para alojarlos, personalizarlos y desplegarlos por cuenta propia con fines comerciales. Para las empresas, el gran cambio es sencillo: menos complicaciones con las licencias y más libertad para ejecutar modelos dentro de su propia infraestructura.

Familias de modelos de Cohere que pasan a Apache 2.0

Apache 2.0

En julio de 2026, varias familias de modelos de Cohere están bajo Apache 2.0:

  • Command A+ - Lanzado en mayo de 2026, este modelo de mezcla de expertos (MoE) con 218B parámetros incluye variantes cuantizadas W4A4 para reducir el uso de memoria de GPU en despliegues empresariales [3][4].
  • Cohere Transcribe - Una familia de modelos de voz a texto con 2B parámetros publicada bajo Apache 2.0, que incluye el modelo base lanzado en marzo de 2026 y una versión especializada en árabe publicada en julio de 2026 [3][6].
  • North Mini Code - Lanzado en junio de 2026, un modelo centrado en código que amplía la hoja de ruta con pesos especializados en programación [5][7].
  • Familia Aya - Modelos multilingües, entre ellos Tiny Aya y Aya Vision, creados para el uso local o en dispositivos en varios idiomas [3].

El patrón es evidente. Cohere está ampliando su catálogo de pesos abiertos para abarcar la generación de texto, el reconocimiento de voz, la programación y las cargas de trabajo multilingües.

Y esto importa porque Apache 2.0 cambia lo que los equipos pueden hacer una vez que tienen los pesos.

Pesos Apache 2.0 frente a las condiciones de una API alojada

Apache 2.0 proporciona los pesos, lo que permite ejecutar y modificar el modelo de forma local. La API alojada funciona de otra manera: en ese caso, la inferencia permanece en la infraestructura de Cohere bajo unas condiciones de pago independientes. Por ejemplo, Command A+ cuesta $2.50 por 1 millón de tokens de entrada y $10.00 por 1 millón de tokens de salida a través de la API [6].

Esta separación cambia las contrapartidas. El autoalojamiento pone el trabajo de infraestructura en manos de tu equipo, pero también mantiene los datos dentro de tu propio entorno. Con la API, el despliegue es más sencillo, pero el proveedor conserva un mayor control sobre cómo se ejecuta el modelo.

Esa diferencia se ve con bastante claridad en la siguiente tabla.

Comparación de licencias: CC-BY-NC, acceso propietario y Apache 2.0

CaracterísticaApache 2.0 (p. ej., Command A+)CC-BY-NC (modelos de investigación)Acceso mediante API propietaria
Uso comercialTotalmente permitidoProhibidoPermitido según condiciones de pago
Derechos de modificaciónAcceso completo a los pesosPermitido solo para investigaciónLimitado al ajuste fino
RedistribuciónPermitidaPermitida para uso no comercialProhibida
AutoalojamientoViable: en local, VPC o entornos aislados de la redViable, pero sin fines de lucroNo disponible
Impacto en el cumplimientoAlto: los datos permanecen dentro de la empresaModerado: solo para investigaciónMenor: los datos salen del perímetro propio

CC-BY-NC puede hacer ambiguo el uso en producción. El acceso mediante una API propietaria facilita el despliegue, pero el control permanece en manos del proveedor. Apache 2.0 encaja mejor cuando el uso comercial, los cambios internos en los modelos y el control local de los datos ocupan los primeros puestos de la lista de prioridades.

A continuación viene la parte práctica: qué permite hacer Apache 2.0 en producción y qué obligaciones siguen vigentes.

Qué permite Apache 2.0 y por qué interesa a las empresas

Explicación del uso comercial, la modificación, la redistribución y las condiciones de patentes

Apache 2.0 concede a las empresas una licencia perpetua, mundial y libre de regalías para usar, modificar y distribuir el modelo [9]. Dicho sin tecnicismos: puedes ejecutarlo, modificarlo y distribuirlo sin pagar tasas de licencia.

Para las empresas, esto elimina muchas fricciones, sobre todo cuando quieren mantener la inferencia dentro de su propio entorno. Se permite cualquier uso comercial. Y para los equipos que se autoalojan, ese permiso legal se traduce en mucha más libertad para desplegar el modelo donde y como quieran.

Los equipos pueden ajustar los modelos con datos propietarios, adaptar su comportamiento a un dominio y alinear los resultados con la terminología interna. También pueden mantener esos cambios en privado. No existe la obligación de publicar los pesos modificados [9]. Esto importa si los cambios del modelo reflejan conocimientos internos o una lógica de producto que no quieres hacer pública.

La concesión de patentes añade otra capa de protección. Cubre las reclamaciones de patentes que el modelo necesariamente infrinja, pero termina si tu organización demanda a un contribuidor por infracción de patente [9][10]. Apache 2.0 tampoco concede derechos sobre marcas comerciales, por lo que el nombre de Cohere solo debe utilizarse para identificar la procedencia [9][10].

Obligaciones de cumplimiento que los equipos aún deben satisfacer

Todavía queda cierta documentación por gestionar correctamente.

Si distribuyes el modelo o trabajos derivados, debes incluir la licencia, conservar los avisos obligatorios, incorporar cualquier archivo NOTICE y marcar con claridad los archivos modificados [9]. Los equipos jurídicos deberían revisar pronto la cláusula de represalia por patentes. Al mismo tiempo, los equipos de MLOps deben asegurarse de que los avisos se conserven durante todo el proceso de compilación y publicación.

Una vez resueltas esas condiciones, la siguiente cuestión es práctica: dónde debe ejecutarse el modelo.

Tabla de correspondencia entre los derechos de Apache 2.0 y los resultados empresariales

Derecho de licenciaQué permite legalmenteVentaja empresarial
Uso comercialUtilizar el modelo en cualquier producto o servicio que genere ingresosSin regalías
ModificaciónAjustar o alterar los pesos y el código del modeloCrear capacidades propietarias sobre modelos de pesos abiertos
RedistribuciónCompartir el modelo o los trabajos derivados con otras personasMenos fricción para los equipos de producto que distribuyen aplicaciones con IA
Concesión de patentesUtilizar las reclamaciones de patentes de los contribuidores que el modelo infringe necesariamenteProtección frente a reclamaciones de patentes de los contribuidores
Exención de garantíaUtilizar el modelo «tal cual», sin garantíaMenos fricción para la experimentación

Esta contrapartida conduce directamente a las opciones de despliegue local, en VPC e híbrido.

Cómo desplegar y utilizar modelos de Cohere autoalojados

Opciones de despliegue: en local, VPC privada e híbrida

Apache 2.0 solo importa si puedes ejecutar el modelo donde ya residen tus datos. Ese es el lado práctico de la hoja de ruta de Cohere. Para la mayoría de los equipos, hay tres formas principales de desplegarlo: en sus propias instalaciones, dentro de una VPC privada o en una configuración híbrida. La opción más adecuada depende del control, el cumplimiento y la velocidad.

Los clústeres de GPU locales ofrecen el máximo control sobre los datos. Si es necesario, pueden estar totalmente aislados de la red y, además, mantienen baja la latencia de inferencia porque los datos nunca abandonan la red propia. Command A+ puede ejecutarse con solo dos GPU H100 mediante cuantización W4A4, lo que pone el despliegue local al alcance de los equipos que ya cuentan con una infraestructura de GPU moderna [4][8].

Los despliegues en VPC privadas trasladan ese cómputo a un entorno aislado en la nube. Se mantiene una separación sólida sin tener que ejecutar todo en un centro de datos propio. Esta opción suele encajar bien con empresas de SaaS y equipos financieros.

Las configuraciones híbridas dividen el trabajo. El razonamiento sensible y la recuperación de información permanecen dentro del entorno propio, mientras que las cargas externas más pesadas pasan por una capa de API. Este modelo suele ser el punto intermedio cuando una empresa necesita privacidad en algunas áreas, pero no en todas.

Opción de despliegueControl de los datosLatenciaTipo de costeCaso de uso ideal
Clúster de GPU localMáximoUltrabajaCapital (CapEx)Entornos aislados de la red y de alta seguridad
VPC privada (nube)AltoBaja a mediaOperativo (OpEx)Búsqueda regulada, RAG empresarial
Configuración híbridaAlto para cargas de trabajo sensiblesVariableMixtoAplicaciones multimodales y flujos de asistencia

Estas contrapartidas se aprecian con mayor claridad en los asistentes privados, la búsqueda regulada y las capas de API internas.

Casos de uso: asistentes privados, búsqueda regulada y API locales

La elección del despliegue cobra importancia rápidamente cuando la carga de trabajo incluye datos que no pueden filtrarse. En los equipos empresariales aparecen una y otra vez tres patrones.

Los asistentes privados para empleados suelen ser el primer paso. Un equipo jurídico o de RR. HH. puede enviar documentos internos de políticas, contratos o guías de prestaciones a una instancia autoalojada de Command A+. A continuación, el modelo responde preguntas mediante generación aumentada por recuperación (RAG) sobre esos documentos, mientras todo el flujo permanece dentro del entorno de la empresa. Command A+ admite una ventana de contexto de 128K tokens, con una posible ampliación a 1 millón de tokens [8].

La búsqueda regulada de conocimiento es el siguiente nivel. Los grupos sanitarios y las instituciones financieras suelen necesitar consultar registros sujetos a estrictas reglas de residencia de datos. En esa configuración, un modelo de Cohere autoalojado puede gestionar la creación de embeddings, la recuperación y la reclasificación sin enviar los datos fuera del perímetro.

Las capas de API locales llevan esta idea aún más lejos. Los equipos pueden crear endpoints internos para tareas como la clasificación de documentos, la transcripción y el resumen. Aquí es donde destaca Cohere Transcribe. Registra una tasa de error de palabras del 5.42% en el Open ASR Leaderboard, por delante del 7.44% de Whisper Large v3, y puede procesar unos 525 minutos de audio por minuto de tiempo real [1][3]. Para centros de atención telefónica y grabaciones de cumplimiento, esto lo convierte en una opción práctica y no solo en una demostración de laboratorio.

Cuando solo una parte de la infraestructura debe mantenerse en privado, una capa de API híbrida puede encargarse del resto.

El lugar de APIMart en una configuración híbrida

APIMart

En una arquitectura híbrida, APIMart actúa como capa de API única para las cargas de vídeo, imagen y lenguaje que no son sensibles, mientras que el razonamiento confidencial, la recuperación y los datos privados permanecen dentro del entorno autoalojado del cliente. Ofrece a los equipos acceso a 500+ modelos de IA mediante una sola API, de modo que los despliegues internos de Cohere pueden centrarse en flujos con datos privados en lugar de ramificarse en muchas integraciones externas independientes.

La división es sencilla, pero útil: mantener el razonamiento sensible en el entorno local y enviar las tareas externas a través de un único punto de conexión.

Problema empresarialUbicación del modeloVentaja principalSensibilidad de los datos
Búsqueda regulada de conocimientoVPC privada / entorno localRAG sobre documentos internos sin salida de datosAlta
Asistente privado para empleadosVPC privadaFlujos seguros con agentes para tareas de RR. HH. y asuntos jurídicosMedia a alta
Capa de API localEntorno localTranscripción y análisis de documentos con baja latencia para PII/PHIAlta
Vídeo y contenido multimodalAPIMart (API)Acceso a 500+ modelos mediante un solo endpointBaja a media
Flujos de asistencia multilingüeHíbridaCompatibilidad con 48 idiomas y datos sensibles conservados en el entorno localMedia

Cómo decidir si la hoja de ruta abierta de Cohere encaja en tu infraestructura

Criterios de decisión: control, cumplimiento, coste y capacidad de MLOps

Una vez conocidas las opciones de despliegue, el siguiente paso es más sencillo: elegir el modelo que tu equipo pueda ejecutar y mantener a largo plazo.

El mejor modelo no es solo el que obtiene buenos resultados en los benchmarks. Es aquel con el que tu equipo puede convivir durante los próximos 12 a 24 meses. En la mayoría de los casos, cuatro preguntas aclaran rápidamente la decisión.

¿Qué grado de sensibilidad tienen tus datos? Si tus flujos incluyen PHI, PII o documentos protegidos por secreto profesional, el autoalojamiento o una VPC privada suelen ser imprescindibles. Si la carga de trabajo es menos sensible, una API gestionada puede bastar.

¿Qué grado de madurez tiene tu equipo de MLOps? Ejecutar los modelos Apache 2.0 de Cohere en las propias instalaciones significa que tu equipo asume la orquestación con Kubernetes, la adquisición de GPU y el trabajo de ajuste de modelos, como la cuantización [11]. No es poca cosa. La carga operativa es real.

¿Cómo es tu presupuesto de 12 a 24 meses? El acceso mediante una API alojada suele costar menos al principio. El autoalojamiento traslada una mayor parte del gasto a la infraestructura y las operaciones diarias.

¿Necesitas derechos comerciales claros para tus productos? Apache 2.0 ofrece a los equipos esa claridad para el uso comercial, la modificación y la redistribución [2].

Para muchos equipos estadounidenses, una configuración híbrida alcanza el equilibrio ideal. APIMart puede cubrir un acceso multimodal más amplio, mientras el razonamiento sensible permanece en el entorno local.

Tabla comparativa: solo autoalojamiento, configuración híbrida con APIMart o API gestionada

Utiliza esta tabla para relacionar el control, el cumplimiento, el presupuesto y la capacidad de MLOps con el patrón de despliegue más adecuado.

Solo autoalojamientoConfiguración híbrida con APIMartAPI gestionada
Prioridad de controlMáximaAlta para las cargas sensiblesBaja (gestionada por el proveedor)
Cumplimiento / residencia de datosPosibilidad de aislamiento de la redLos datos sensibles permanecen en el entorno localEstándar (SOC 2/ISO 27001)
Perfil presupuestarioCapEx alto y operaciones continuasCapEx/OpEx mixtoOpEx puro, basado en el uso
Esfuerzo de MLOpsAltoModeradoMínimo
Opción idealSectores regulados, IA soberana, entornos aislados de la redRAG empresarial y flujos multimodalesEmpresas emergentes, creación rápida de prototipos

Conclusión: la enseñanza práctica para los equipos estadounidenses

La hoja de ruta Apache 2.0 de Cohere ofrece a los equipos más de una vía de avance sin obligar a todos a adoptar la misma configuración.

Una empresa emergente puede empezar con el acceso mediante una API gestionada y avanzar hacia el autoalojamiento si la sensibilidad de los datos o la escala empiezan a exigirlo. Una empresa regulada puede ejecutar toda la infraestructura en sus instalaciones desde el primer día. Y un equipo de tamaño medio puede seguir el camino intermedio: mantener en local la recuperación y el razonamiento sensibles, mientras utiliza APIMart para flujos multimodales más amplios.

La arquitectura más adecuada es la que se ajusta a tus necesidades reales de cumplimiento, la capacidad de infraestructura de tu equipo y tu presupuesto para los próximos uno o dos años.

Preguntas frecuentes

¿Qué modelos de Cohere están ahora bajo Apache 2.0?

Los modelos actuales de Cohere bajo Apache 2.0 incluyen Command A+ y Transcribe.

Estas versiones permiten el uso comercial, el despliegue local y la personalización en infraestructuras privadas. Esto ofrece más control a las organizaciones, facilita el cumplimiento y reduce la dependencia de sistemas externos.

¿Qué seguimos teniendo que gestionar si optamos por el autoalojamiento?

Cuando eliges el autoalojamiento, asumes toda la infraestructura.

Eso significa que eres responsable de todo lo que normalmente gestionaría un servicio administrado: hardware y recursos de cómputo, configuración, mantenimiento, datos, registros, seguridad, cumplimiento y garantizar que el rendimiento se mantenga en tu propio entorno.

¿Cuándo tiene más sentido el autoalojamiento que utilizar una API?

El autoalojamiento tiene más sentido cuando necesitas control total sobre tus datos, la configuración de cumplimiento y la infraestructura.

Suele ser la opción más adecuada para organizaciones con reglas estrictas de residencia de datos o para equipos de sectores regulados que no pueden enviar información sensible a servidores externos.

También puede reducir la dependencia de proveedores externos. Y en entornos de producción de gran volumen, puede ayudarte a evitar las tarifas por minuto o por token, si ya cuentas con el hardware local o la capacidad de nube privada necesarios.

¿Listo para probar?

Elige el modelo que quieres en el marketplace

Prueba modelos de chat, imagen y video en el marketplace de APIMart y experimenta rápidamente sus capacidades con una API unificada.

Modelos de chatModelos de imagenModelos de video
Explorar marketplace