Stripe ha comprado OpenRouter por más de 7.000 millones de dólares. Y con esa compra llega la incertidumbre: ¿subirán los precios de las APIs? ¿Cambiarán los modelos disponibles? ¿Seguirán las mismas condiciones para los negocios pequeños? En lugar de esperar a ver qué pasa, hay una alternativa que puedes montar hoy mismo: autoalojar Qwen 3.8 27B, un modelo de IA abierto que corre en tu propio hardware y te libera de la dependencia de terceros.

No hace falta un centro de datos. Con un portátil potente o un PC de sobremesa con una GPU decente, puedes ejecutar un modelo de lenguaje con calidad suficiente para emails, resúmenes, generación de código y más. Y lo mejor: el coste marginal es casi cero. Pagas la electricidad y ya.

En este artículo te explico por qué esta es una alternativa OpenRouter viable, cuánto cuesta de verdad, cómo ponerla en marcha en menos de una hora y qué pegas tiene (porque las tiene). Si buscas ahorrar costes IA y mantener el control, sigue leyendo.

¿Qué está pasando con OpenRouter y por qué debería importarte?

OpenRouter se ha convertido en la navaja suiza de las APIs de IA: un único punto de acceso a cientos de modelos, con precios competitivos y facturación sencilla. La noticia de su adquisición por Stripe ha disparado todas las alarmas entre autónomos y pymes que dependen de ella para sus flujos de trabajo.

Los precedentes no son tranquilizadores. Cuando una gran empresa compra una plataforma ágil, lo normal es que vengan cambios: reestructuración de tarifas, prioridad a clientes enterprise, modificaciones en los términos de uso. Nadie sabe qué pasará, pero esperar pasivamente no es una estrategia.

La buena noticia es que hoy existen modelos abiertos con licencias permisivas que puedes ejecutar en tu propio equipo. No dependes de la nube, no pagas por token y nadie puede subirte el precio de la noche a la mañana.

¿Qué es Qwen 3.8 27B y por qué es una alternativa real?

Qwen 3.8 27B es un modelo de lenguaje de 27 mil millones de parámetros desarrollado por Alibaba, liberado bajo licencia Apache 2.0. Eso significa que puedes usarlo comercialmente, modificarlo y desplegarlo sin pagar regalías. Es una IA local para pymes que no requiere un hardware de miles de euros.

Con 27B parámetros, se sitúa en un punto dulce: suficiente capacidad para tareas complejas, pero lo bastante ligero para correr en una GPU de consumo. En concreto, con una NVIDIA RTX 3060 de 12 GB o superior puedes ejecutarlo con cuantización de 4 bits sin problemas. Incluso en CPU con suficiente RAM (32 GB o más) funciona, aunque más lento.

Simon Willison, conocido divulgador de IA, lo probó recientemente y destacó su calidad en razonamiento y generación de texto. No es perfecto, pero para muchas tareas de negocio rinde a un nivel sorprendente.

Comparativa de costes: API vs autoalojamiento

Hablemos de números. Usar OpenRouter (o cualquier API similar) tiene un coste variable por cada millón de tokens. Un modelo como GPT-4o mini ronda los 0,15-0,60 $ por millón de tokens de entrada y 0,60-2,40 $ por millón de tokens de salida. Los modelos más grandes multiplican esas cifras.

Con el autoalojamiento, el coste es principalmente el hardware (amortizado) y la electricidad. Vamos a una comparación realista para un uso moderado: 5 millones de tokens al mes (unos 3-4 millones de palabras procesadas).

ConceptoAPI (OpenRouter, GPT-4o mini)Autoalojado (Qwen 3.8 27B)
Coste mensual por 5M tokensRecomendado3-12 $ (según modelo y uso)≈ 1,50 $ (electricidad)
Hardware inicial0 $ (solo ordenador)800-1.500 $ (PC con RTX 3060/4060 o similar)
Amortización hardware (3 años)-22-42 $/mes
Coste total mensual (primer año)3-12 $23,50-43,50 $
Coste total mensual (tras amortizar)3-12 $ (o más si suben precios)≈ 1,50 $
Dependencia de tercerosAltaNinguna
Privacidad de datosDatos enviados a la nube100% local
← Desliza para ver toda la tabla →

Como ves, el autoalojamiento no es más barato desde el primer día si partes de cero y necesitas comprar hardware. Pero a medio plazo (2-3 años), y sobre todo si tu volumen de tokens crece, el ahorro es considerable. Además, ganas en privacidad y control.

Si ya tienes un PC gaming o una estación de trabajo con GPU, el coste inicial es cero y el ahorro empieza de inmediato.

Cómo montar Qwen 3.8 27B en local en menos de una hora

No necesitas ser ingeniero. Hay dos caminos principales:

  • Ollama: la opción más sencilla. Instalas Ollama, ejecutas ollama run qwen3.8:27b y listo. Gestiona la descarga del modelo y la cuantización automáticamente.
  • LM Studio: interfaz gráfica amigable, ideal si prefieres no tocar la terminal. Buscas “Qwen 3.8 27B” en su catálogo, eliges una cuantización (recomiendo Q4_K_M) y le das a descargar.

Pasos concretos:

  1. Descarga e instala Ollama desde ollama.com o LM Studio desde lmstudio.ai.
  2. Abre la terminal (o la interfaz de LM Studio) y ejecuta el comando para descargar el modelo. En Ollama: ollama pull qwen3.8:27b.
  3. Espera a que termine la descarga (unos 10-15 GB según cuantización).
  4. Prueba con un prompt sencillo: “Redacta un email profesional para un cliente que pide un presupuesto”.
  5. Integra el modelo en tu flujo: Ollama expone una API local compatible con OpenAI, así que puedes conectar herramientas como n8n, LangChain o scripts propios.

Para tareas típicas de negocio (emails, resúmenes, extracción de datos, generación de código), el rendimiento es más que aceptable. Eso sí, no esperes la velocidad de una API en la nube: en una GPU de gama media, la generación va a unos 20-40 tokens por segundo, suficiente para uso interactivo.

La pega principal: Qwen 3.8 27B piensa demasiado (y cómo solucionarlo)

Uno de los comportamientos más comentados de este modelo es su tendencia a “pensar en exceso”. Genera cadenas de razonamiento largas antes de dar la respuesta final, lo que consume tiempo y tokens. Para un negocio que quiere respuestas rápidas, esto puede ser frustrante.

¿Cómo mitigarlo?

  • Limita los tokens de razonamiento: en Ollama, puedes usar el parámetro num_ctx y num_predict para acotar la longitud. Por ejemplo, ollama run qwen3.8:27b --num-predict 512 limita la respuesta total.
  • Usa prompts concisos y directos: “Responde brevemente, sin explicar el razonamiento” al final del prompt reduce la verbosidad.
  • Configura el sistema prompt: en LM Studio u Ollama, define un mensaje de sistema que indique “Eres un asistente práctico. Da respuestas directas y sin divagaciones”.
  • Prueba cuantizaciones más pequeñas: a veces una cuantización Q3 o Q2 reduce el “sobrepensamiento” porque el modelo tiene menos capacidad para divagar.

Con estos ajustes, la experiencia mejora notablemente. No elimina el problema del todo, pero lo hace manejable.

¿Es Qwen 3.8 27B suficiente para tu negocio?

Depende de lo que hagas. Para tareas como redactar correos, resumir documentos, generar informes, traducir textos o escribir código sencillo, cumple de sobra. Para tareas muy especializadas o que requieren conocimiento actualizado en tiempo real, necesitarás complementar con RAG (búsqueda en tus propios documentos) o usar un modelo más grande en la nube para casos puntuales.

La clave está en el proyecto piloto. No migres todo de golpe. Elige una tarea concreta que hoy hagas con OpenRouter, pásala a local durante una semana y compara resultados, tiempos y costes. Si funciona, amplía.

Preguntas frecuentes

¿Necesito una GPU cara para ejecutar Qwen 3.8 27B?

No. Con una GPU de 12 GB de VRAM (RTX 3060, 4060, o equivalentes de AMD) puedes ejecutar la versión cuantizada de 4 bits. En CPU con 32 GB de RAM también funciona, aunque más lento (2-5 tokens por segundo).

¿Puedo usar Qwen 3.8 27B comercialmente?

Sí. La licencia Apache 2.0 permite uso comercial, modificación y redistribución sin restricciones. No tienes que pagar regalías ni mostrar atribución (aunque se agradece).

¿Qué pasa si OpenRouter no cambia sus precios?

No pierdes nada por probar. Tener una alternativa local te da poder de negociación y un plan B. Además, la privacidad de los datos es un valor en sí mismo.

¿Cuánto espacio en disco ocupa el modelo?

La versión cuantizada de 4 bits ocupa unos 15-18 GB. La versión completa (fp16) supera los 50 GB, pero no la necesitas para uso normal.

¿Puedo integrar Qwen local con mis herramientas actuales?

Sí. Ollama expone una API compatible con OpenAI en http://localhost:11434/v1. Puedes apuntar tus scripts o aplicaciones a esa URL y funcionarán sin cambios (solo cambia el modelo).

Nuestra recomendación: empieza esta semana

No esperes a que Stripe decida el futuro de OpenRouter. Si tienes un PC con GPU medio decente, descarga Qwen 3.8 27B hoy mismo con Ollama y pruébalo en una tarea real. Si no tienes GPU, plantéate una inversión de 800-1.000 € en un equipo que te servirá para mucho más que IA. A medio plazo, el ahorro y la independencia compensan.

La alternativa OpenRouter ya no es una utopía: es un modelo abierto, gratuito y que cabe en tu escritorio. Autoalojar Qwen 3.8 27B es la forma más práctica de blindar tu negocio contra la incertidumbre y ahorrar costes IA de verdad.