Spitzenzeiten‑Aufschlag zerstört den Wert von Ollama
Spitzenzeiten‑Aufschlag zerstört den Wert von Ollama.
Ollama Cloud ist im Allgemeinen günstiger für dieselben Open‑Source‑Modelle, sofern Sie innerhalb Ihrer enthaltenen Abonnementguthaben bleiben. Allerdings kann OpenRouter günstiger sein, wenn Sie ein leichter Nutzer sind, Anfragen während der Spitzenzeiten von Ollama ausführen oder hochgradig zwischengespeicherte Workloads nutzen.
Kostenaufstellung
Ollama Cloud und OpenRouter verwenden völlig unterschiedliche Preisstrukturen:
- Ollama Cloud: Verwendet einen 3‑fachen Kredit‑Multiplikator. Im $20/Monat‑Pro‑Plan erhalten Sie $60 an Nutzungsguthaben pro Monat.
- OpenRouter: Berechnet 1:1 reines Pay‑as‑you‑go ohne monatliche Gebühr und nimmt eine kleine Marge über den zugrunde liegenden Host‑Anbietern (wie DeepInfra, Together oder Fireworks).
Da Ollama Ihnen $60 Wert für $20 gibt, sind ihre nominalen Modellpreise effektiv um 66 % reduziert.
Direkter Modellvergleich (Außerhalb der Spitzenzeiten)
Preise pro 1 Million Tokens (Eingabe / Ausgabe):
| Modell | Ollama Nominalrate | Ollama Effektivkosten (nach 3‑facher Kreditaufstockung) | OpenRouter Durchschnittliche Rate |
|---|---|---|---|
| --- | --- | --- | --- |
| DeepSeek V4 Flash | $0.22 / $0.66 | ~$0.07 / $0.22 | ~$0.14 / $0.28 |
| --- | --- | --- | --- |
| Gemma 4 | $0.14 / $0.40 | ~$0.05 / $0.13 | ~$0.12 / $0.35 |
| --- | --- | --- | --- |
| GPT-OSS 120B | $0.15 / $0.60 | ~$0.05 / $0.20 | ~$0.15 / $0.60 |
| --- | --- | --- | --- |
| Mistral Large 3 | $0.50 / $1.50 | ~$0.16 / $0.50 | ~$0.40 / $1.20 |
Wenn Ollama Cloud gewinnt
- Starke/regelmäßige Nutzung: Wenn Sie monatlich $15–$60 an Tokens verbrauchen, liefert Ihnen Ollama ungefähr 2‑ bis 3‑fach mehr Ausgabe pro Dollar im Vergleich zu OpenRouter.
- Kein Anbieter‑Roulette: Ollama hostet Modelle auf seiner eigenen Infrastruktur, was konsistente Latenz garantiert, während die Geschwindigkeit von OpenRouter davon abhängt, welcher kostengünstige Anbieter ausgewählt wird.
Wenn OpenRouter gewinnt
- Leichte / intermittierende Nutzung: Wenn Sie nur $2–$5 pro Monat für KI ausgeben, ist OpenRouter günstiger, da Sie das obligatorische Mindestabonnement von $20 bei Ollama nicht zahlen müssen.
- Aufschlag in Spitzenzeiten: Ollama verdoppelt die nominalen Token‑Kosten während der Spitzenzeiten (12:00–18:00 UTC, Mo–Fr). Wenn Sie in diesem Zeitraum schwere Workloads ausführen, schlagen die festen Raten von OpenRouter oft Ollama.
- Aggressives Kontext‑Caching: Wenn Ihr Prompt stark von zwischengespeicherten Prompt‑Tokens abhängt (z. B. wiederholte lange System‑Prompts in Agent‑Schleifen), bieten die Anbieter von OpenRouter häufig bis zu 80‑90 % Caching‑Rabatte, wodurch die reinen Token‑Kosten im Vergleich zu Ollama vernachlässigbar werden.
OpenRouter ist günstiger für intensive, schwere agentenbasierte Softwareentwicklung, selbst mit Ollama Clouds 3‑fachem Kredit‑Rabatt.
In modernen Entwickler‑Workflows (z. B. Cline, Roo Code, Aider, Cursor) speisen Sie ständig riesige Codebasen, System‑Prompts, AST‑Kontexte und Werkzeugdefinitionen in lange mehrstufige Agent‑Schleifen ein.
Der direkte Vergleich beider Faktoren zeigt, warum OpenRouter in diesem konkreten Szenario gewinnt.
Fakt 1: Ollama berechnet zwischengespeicherte Tokens
Ollama Cloud macht zwischengespeicherten Kontext nicht kostenlos; es berechnet einen separaten „Cached Input“-Tarif.
When running a model like DeepSeek V4 Flash:
- Ollama Cached Input außerhalb der Spitzenzeiten: $0.007 / M Tokens
- Ollama Cached Input in Spitzenzeiten (12:00–18:00 UTC): $0.014 / M Tokens
Da schwere Agent‑Schleifen jedes einzelne Tool‑Aufruf wiederholt 50.000 bis 100.000+ Token‑Präfixe neu einliest, summieren sich diese Kosten schnell.
Fakt 2: Aufschlag in Spitzenzeiten zerstört den Wert von Ollama
Ollamas Spitzenzeiten (12:00 bis 18:00 UTC) überschneiden sich direkt mit den normalen Arbeitstagen in Europa und den Amerikas.
- Ohne Spitzenzeiten: Ollamas 3‑facher Abonnement‑Multiplikator liefert eine effektive Ausgaberate von ~$0.22/M bei DeepSeek Flash.
- In Spitzenzeiten: Die Raten verdoppeln sich. Die effektive Ausgaberate springt auf ~$0.44/M Tokens und verwirft fast die gesamte $20‑für‑$60‑Rabattstruktur.
Fakt 3: OpenRouters „Provider Routing & Sticky Caching“
OpenRouter leitet Anfragen über zugrunde liegende Hosts (DeepInfra, Fireworks, Together, Novita) und verwendet sticky session routing, um Agent‑Anfragen auf demselben Knoten zu halten.
- Keine stündlichen Aufschläge: OpenRouter‑Raten bleiben 24/7 konstant.
- Aggressive Cache Discounts: Open‑Source‑Modelle bei Anbietern wie DeepInfra oder Fireworks bieten häufig 75 % bis 90 % Rabatt auf Eingabe‑Tokens, wenn lange Prompts wiederholt werden.
- Kein Mindestabonnement: Sie zahlen reinen Verbrauch statt ein $20‑ oder $100‑Monats‑Lock‑In.
Beispiel für die Arbeitslastrechnung: Eine 20‑Schritte‑Agent‑Codierungssitzung
Angenommen, ein Agent führt 20 Tool‑Aufrufe aus (Dateien lesen, Änderungen anwenden, Terminal‑Befehle ausführen) und übergibt ein 60.000‑Token‑Kontext‑Präfix, das bei jedem Durchlauf den Cache trifft, und erzeugt 1.000 Tokens Ausgabe pro Schritt.
- Basis‑Tokens: 1,2 Million zwischengespeicherte Eingabe‑Tokens + 20.000 Ausgabe‑Tokens.
| Metrik | Ollama Cloud (Spitzenzeiten) | OpenRouter (24/7 Flatrate) |
|---|---|---|
| --- | --- | --- |
| Verwendetes Modell | DeepSeek V4 Flash | DeepSeek V4 Flash |
| --- | --- | --- |
| Kosten für zwischengespeicherten Input | ~$0.017 | ~$0.018 |
| --- | --- | --- |
| Kosten für Output‑Tokens | ~$0.026 | ~$0.006 |
| --- | --- | --- |
| Gesamtkostensitzung | $0.043 | $0.024 |
| --- | --- | --- |
| Effektive Rate vs Guthaben | Verbraucht $0.13 von Ihrem $60‑Guthaben | Aus eigener Tasche: $0.024 |
Fazit
- Wählen Sie Ollama Cloud, wenn: Sie programmieren ausschließlich während der Off‑Peak‑Zeiten (Morgen in Europa oder späte Nächte in den USA), native
ollama run‑Integration bevorzugen oder nicht mehrere Host‑Endpunkte verwalten wollen. - Wählen Sie OpenRouter, wenn: Sie schwere Entwicklungsarbeit während der normalen Geschäftszeiten (12:00–18:00 UTC) leisten, lange Agent‑Schleifen laufen lassen, die massive Code‑Kontexte erneut lesen, und maximale Flexibilität über sowohl offene als auch proprietäre Modelle (wie Claude 3.7 oder GPT‑4.5) wollen.
Comments & Ratings
#
Loading comments...