La fiesta de la IA china ultrabarata se ha acabado. Con el lanzamiento de Kimi K3, el nuevo modelo de Moonshot AI que compite de tú a tú con GPT-5 en benchmarks como AIME 2025 y SWE-bench Verified, llega también una mala noticia: los precios de risa que vimos con DeepSeek no se repetirán. Según análisis del sector, los días de las APIs de IA a precios dumping están contados. Si tu negocio depende de modelos chinos baratos para automatizar procesos, ha llegado el momento de buscar alternativas open-source que no te dejen en la estacada cuando los precios suban.
Pero no todo son malas noticias. El ecosistema de modelos abiertos está más vivo que nunca, y hoy tienes opciones reales para seguir automatizando sin arruinarte. Dos nombres propios: Inkling, el gigante de 975 mil millones de parámetros de Thinking Machines, y la recién actualizada Gemma 4 de Google. Con ellos puedes montar una estrategia híbrida que te dé control, rendimiento y previsibilidad de costes.
En este artículo te cuento cuánto cuesta cada opción, cómo ponerlas en marcha esta misma semana y por qué deberías empezar a reducir tu dependencia de las APIs chinas ahora mismo.
¿Por qué se acaba la IA china barata?
El lanzamiento de Kimi K3 ha sido un jarro de agua fría para los que esperaban otra guerra de precios. Aunque el modelo es abierto y su rendimiento es impresionante (supera a GPT-5 en razonamiento matemático y coding), las estimaciones sitúan su coste de API muy por encima de lo que DeepSeek acostumbró al mercado. Hablamos de alrededor de 2-3 $ por millón de tokens, cuando DeepSeek V3 llegó a ofrecer precios de 0,14 $. La razón: los márgenes se han evaporado y los laboratorios chinos necesitan monetizar.
Para un autónomo o una pyme que usa IA a diario para generar textos, clasificar correos o resumir documentos, este cambio puede disparar la factura mensual de 20 € a 100 € o más. Y eso si no hay nuevas subidas.
Inkling: un monstruo abierto con API asequible (si sabes domarlo)
Pocos días después del anuncio de Kimi K3, Thinking Machines (la empresa fundada por la ex-CTO de OpenAI, Mira Murati) lanzó Inkling. Un modelo de 975 mil millones de parámetros, también de código abierto, que según sus benchmarks supera a todos los modelos de laboratorios estadounidenses y solo queda por detrás de los chinos. Puedes leer los detalles en este análisis.
Lo interesante para nosotros: su API es competitiva. Thinking Machines ofrece acceso a Inkling por 1,87 $ el millón de tokens de entrada y 7,48 $ el millón de tokens de salida. No es tan barato como la DeepSeek de antaño, pero sí más predecible y con la ventaja de ser un modelo abierto: si tienes la infraestructura, puedes alojarlo tú mismo y olvidarte de costes recurrentes.
Autoalojar un modelo de casi un billón de parámetros no es trivial. Necesitas varias GPUs de alta gama (tipo A100 o H100), algo que se va de presupuesto para la mayoría de negocios pequeños. Pero si solo necesitas usarlo de forma puntual para tareas muy complejas, su API es una opción sólida y con un precio fijo.
Gemma 4: la opción práctica para autoalojar sin vender un riñón
Aquí es donde la cosa se pone interesante para el día a día. Google acaba de lanzar una actualización silenciosa de Gemma 4 que corrige bugs críticos en el uso de herramientas (tool calling) y los molestos truncamientos de respuesta. Y lo mejor: puedes ejecutarlo en una GPU de solo 8 GB de VRAM, algo que un PC de 500 € puede tener sin problemas.
Esto cambia las reglas del juego. Con Gemma 4 autoalojado, el coste marginal de cada tarea es cero. Sí, has leído bien. Una vez amortizado el hardware, cada resumen, traducción o clasificación que haga el modelo te sale gratis. Y con la actualización, su fiabilidad para automatizar flujos con APIs externas o bases de datos ha mejorado drásticamente.
Comparativa de costes reales: API vs autoalojamiento
Para que veas los números claros, he preparado esta tabla con tres escenarios mensuales típicos para un negocio pequeño que procesa 500.000 tokens al día (unos 15 millones al mes):
| Opción | Coste mensual estimado | Inversión inicial | Ideal para |
|---|---|---|---|
| API Kimi K3 (estimado 2-3 $/M tokens) | 30 - 45 $ | 0 € | No recomendable por incertidumbre de precios |
| API Inkling (1,87 $ entrada / 7,48 $ salida) | ~30 $ (mixto) | 0 € | Tareas complejas puntuales |
| Gemma 4 autoalojado (PC 500 € amortizado en 1 año) | ~42 €/mes (amortización) + electricidad (~10 €) | 500 € | Tareas diarias de bajo-medio nivel |
* Los costes de API son estimaciones basadas en precios publicados y benchmarks. El coste eléctrico asume 8h/día de uso con una GPU de 150W.
Como ves, autoalojar Gemma 4 sale a unos 52 € al mes durante el primer año, y luego solo pagas la luz. La API de Inkling ronda los 30 $, pero sin inversión inicial. La clave está en combinar ambas.
Estrategia híbrida: lo mejor de dos mundos
Mi recomendación es que no pongas todos los huevos en la misma cesta. Usa Gemma 4 autoalojado para el 80% de tus tareas: generación de textos rutinarios, resúmenes, clasificación de correos, traducciones sencillas. Es rápido, fiable y no te cuesta nada tras la inversión inicial.
Para ese 20% de tareas que requieren razonamiento complejo, análisis de datos o generación de código, tira de la API de Inkling. Pagarás solo cuando realmente necesites un modelo de gran calibre, y mantendrás el gasto bajo control.
Esta estrategia no solo te protege de subidas de precios en APIs chinas, sino que te da independencia. Si mañana Kimi K3 triplica su precio, tu negocio ni se inmuta.
Cómo empezar esta misma semana (guía paso a paso)
- Descarga Gemma 4 de Hugging Face. Ve a huggingface.co/google/gemma-4 y descarga la versión optimizada para transformers. Pesa unos 5 GB, así que no necesitas conexión de fibra extrema.
- Instala Ollama en tu PC. Ollama es la forma más fácil de ejecutar modelos locales. Descárgalo de ollama.com, instálalo y ejecuta
ollama run gemma4para empezar a probarlo. - Haz una prueba de automatización real. Coge un proceso que ahora hagas con API (por ejemplo, clasificar emails) y replica el flujo con Gemma 4 en local. Mide tiempos y calidad. Te sorprenderá lo bien que funciona.
- Evalúa si necesitas Inkling. Si hay tareas donde Gemma se queda corto, regístrate en la API de Thinking Machines y prueba con un par de consultas. El coste será mínimo y sabrás si merece la pena para tu caso de uso.
En una semana puedes tener el sistema híbrido funcionando y dejar de depender de APIs chinas con precios impredecibles.
Preguntas frecuentes
¿Necesito conocimientos técnicos para autoalojar Gemma 4?
No muchos. Con Ollama, el proceso es casi plug-and-play. Si has instalado algún programa en tu PC, puedes hacerlo. Eso sí, necesitarás una GPU con al menos 8 GB de VRAM. Si tu PC no la tiene, una opción es montar un equipo básico por unos 500 € que te servirá para otras tareas.
¿Y si no quiero comprar hardware? ¿Puedo usar solo APIs?
Claro. En ese caso, mi recomendación es que uses la API de Inkling para todo. Con 30-50 $ al mes tienes un modelo de primer nivel. Es más caro que la opción híbrida a largo plazo, pero evitas la inversión inicial y la complejidad.
¿Gemma 4 maneja bien el español?
Sí, Gemma 4 tiene un rendimiento excelente en español, tanto en generación como en comprensión. La actualización reciente ha mejorado especialmente la consistencia en respuestas largas, algo clave para automatizaciones.
En resumen: el fin de la IA china barata no es el fin de la automatización asequible. Con Gemma 4 autoalojado y la API de Inkling como comodín, tienes un plan sólido para mantener tus costes bajo control y tu negocio funcionando. Empieza hoy, y en una semana respirarás tranquilo.


