El recargo en horas pico destruye el valor de Ollama
El recargo en horas pico destruye el valor de Ollama.
Ollama Cloud suele ser más barato para los mismos modelos de código abierto, siempre que te mantengas dentro de los créditos de suscripción incluidos. Sin embargo, OpenRouter puede ser más barato si eres un usuario ligero, ejecutas consultas durante las horas pico de Ollama, o utilizas cargas de trabajo con alto caché.
Desglose de costos
Ollama Cloud y OpenRouter utilizan estructuras de precios completamente diferentes:
- Ollama Cloud: Utiliza un Multiplicador de crédito 3x. En el plan Pro de $20/mes, obtienes $60 en créditos de uso al mes.
- OpenRouter: Cobra 1:1 puro pago por uso sin tarifa mensual, tomando un pequeño margen sobre los proveedores de infraestructura subyacentes (como DeepInfra, Together o Fireworks).
Porque Ollama te brinda $60 de valor por $20, sus tarifas nominales en los modelos están efectivamente descontadas en un 66%.
Comparación directa de modelos (tarifas fuera de horas pico)
Precios por 1 millón de tokens (entrada / salida):
| Modelo | Tarifa nominal de Ollama | Costo efectivo de Ollama (after 3x credit boost) | Tarifa promedio de OpenRouter |
|---|---|---|---|
| --- | --- | --- | --- |
| DeepSeek V4 Flash | $0.22 / $0.66 | ~$0.07 / $0.22 | ~$0.14 / $0.28 |
| --- | --- | --- | --- |
| Gemma 4 | $0.14 / $0.40 | ~$0.05 / $0.13 | ~$0.12 / $0.35 |
| --- | --- | --- | --- |
| GPT-OSS 120B | $0.15 / $0.60 | ~$0.05 / $0.20 | ~$0.15 / $0.60 |
| --- | --- | --- | --- |
| Mistral Large 3 | $0.50 / $1.50 | ~$0.16 / $0.50 | ~$0.40 / $1.20 |
Cuando Ollama Cloud gana
- Uso intensivo/regular: Si consumes entre $15 y $60 en tokens cada mes, Ollama te brinda aproximadamente 2x a 3x más salida por dólar que OpenRouter.
- Sin ruleta de proveedores: Ollama aloja los modelos en su propia infraestructura, garantizando latencia constante, mientras que la velocidad de OpenRouter depende de qué proveedor de bajo costo se seleccione.
Cuando OpenRouter gana
- Uso ligero / intermitente: Si solo gastas $2–$5 al mes en IA, OpenRouter es más barato porque no tienes que pagar la suscripción mínima obligatoria de $20 de Ollama.
- Recargo en horas pico: Ollama duplica los costos nominales de los tokens durante las horas pico (12:00–18:00 UTC, lun–vie). Si ejecutas cargas de trabajo intensas durante este período, las tarifas fijas de OpenRouter a menudo superan a Ollama.
- Cache de contexto agresivo: Si tu prompt depende mucho de tokens de prompt en caché (p. ej., repitiendo prompts de sistema largos en bucles de agente), los proveedores de OpenRouter a menudo ofrecen descuentos de caché de hasta 80-90%, haciendo que los costos de tokens sin procesar sean insignificantes comparados con Ollama.
OpenRouter es más barato para desarrollo de software agente intensivo y pesado, incluso con el descuento de crédito 3x de Ollama Cloud.
En los flujos de trabajo modernos de desarrollo (p. ej., Cline, Roo Code, Aider, Cursor), constantemente alimentas enormes bases de código, prompts de sistema, contextos AST y definiciones de herramientas en bucles de agente largos de múltiples turnos.
Comparar ambos factores directamente demuestra por qué OpenRouter gana en este escenario específico.
Hecho 1: Ollama cobra por tokens en caché
Ollama Cloud no hace que el contexto en caché sea gratuito; cobra una tarifa separada de "Entrada en caché".
Al ejecutar un modelo como DeepSeek V4 Flash:
- Entrada en caché fuera de horas pico de Ollama: $0.007 / M tokens
- Entrada en caché en horas pico de Ollama (12:00–18:00 UTC): $0.014 / M tokens
Debido a que los bucles de agente intensivos vuelven a leer repetidamente prefijos de 50,000 a más de 100,000 tokens en cada llamada de herramienta, estos costos se acumulan rápidamente.
Hecho 2: El recargo en horas pico destruye el valor de Ollama
Las horas pico de Ollama (12:00 a 18:00 UTC) se superponen directamente con los días laborables estándar en Europa y América.
- Sin pico: El multiplicador de suscripción 3x de Ollama brinda una tasa de salida efectiva de ~ $0.22/M en DeepSeek Flash.
- Durante pico: Las tarifas se duplican. La tasa de salida efectiva sube a ~$0.44/M tokens, eliminando la mayor parte de la estructura de descuento de $20 por $60.
Hecho 3: OpenRouter's "Provider Routing & Sticky Caching"
OpenRouter enruta solicitudes a través de los hosts subyacentes (DeepInfra, Fireworks, Together, Novita) y usa enrutamiento de sesión persistente para mantener las solicitudes de agente en el mismo nodo.
- Sin recargos por hora: Las tarifas de OpenRouter permanecen planas 24/7.
- Descuentos de caché agresivos: Los modelos de código abierto en proveedores como DeepInfra o Fireworks a menudo ofrecen 75% a 90% de descuento en tokens de entrada al repetir prompts largos.
- Sin suscripción mínima: Pagas por consumo puro en lugar de bloquear $20 o $100/mes.
Ejemplo de cálculo de carga de trabajo: una sesión de codificación de agente de 20 pasos
Supongamos que un agente ejecuta 20 llamadas de herramienta (lectura de archivos, aplicación de ediciones, ejecución de comandos de terminal) pasando un prefijo de contexto de 60,000 tokens que golpea la caché en cada turno, y genera 1,000 tokens de salida por paso.
- Tokens base: 1,2 millones de tokens de entrada en caché + 20,000 tokens de salida.
| Métrica | Ollama Cloud (Horas pico) | OpenRouter (tarifa plana 24/7) |
|---|---|---|
| --- | --- | --- |
| Modelo usado | DeepSeek V4 Flash | DeepSeek V4 Flash |
| --- | --- | --- |
| Costo de Entrada en caché | ~$0.017 | ~$0.018 |
| --- | --- | --- |
| Costo de token de salida | ~$0.026 | ~$0.006 |
| --- | --- | --- |
| Costo total de la sesión | $0.043 | $0.024 |
| --- | --- | --- |
| Tasa efectiva vs crédito | Consume $0.13 de tu asignación de $60 | Gasto directo: $0.024 |
Veredicto
- Elige Ollama Cloud si: Codificas estrictamente durante horas fuera de pico (mañanas en Europa o noches tardías en EE. UU.), prefieres integración nativa
ollama run, o no quieres gestionar múltiples endpoints de host. - Elige OpenRouter si: Realizas trabajo de desarrollo intensivo durante las horas laborales estándar (12:00–18:00 UTC), ejecutas bucles de agente largos que vuelven a leer contextos de código masivos, y deseas la máxima flexibilidad entre modelos abiertos y propietarios (como Claude 3.7 o GPT-4.5).
Comments & Ratings
#
Loading comments...