Ich repariere dein Ollama, ComfyUI oder lokales AI-Setup auf Linux oder Windows


Über diesen Service
Automatische Übersetzung
Dein Modell lädt, liefert aber nichts zurück. Oder es läuft bei 2 Tokens pro Sekunde auf einer GPU, die eigentlich 40 schaffen sollte. Oder es OOMs bei einem Modell, das reinpassen müsste. Genau das behebe ich.
Ich betreibe einen vollständigen lokalen AI-Stack auf einer einzigen 3090 – Ollama, ComfyUI, LoRA-Training, Sprachmodelle, automatisierte Pipelines. Ich habe all diese Fehler auf meiner eigenen Hardware erlebt und herausgefunden, warum.
Was ich repariere:
- Leere Antworten von Reasoning-Modellen. Reasoning-Tokens verbrauchen dein ganzes num_predict-Budget, daher liefert es nichts mit done_reason "length". Sieht aus wie ein kaputtes Modell. Ist es aber nicht.
- Teilweise CPU-Offload, der deine Geschwindigkeit still und heimlich zerstört
- Der Kontextgröße, die deinen VRAM sprengt (KV-Cache skaliert mit dem Kontext)
- Modelle, die bei jeder Anfrage neu geladen werden, weil keep-alive noch Standard ist
- Fehlerhafte ComfyUI-Workflows wegen fehlendem benutzerdefiniertem Node oder Modell im falschen Ordner
- CUDA-, Treiber- und Container-Mismatches auf Linux
- Das richtige Modell und die passende Quantisierung für den VRAM, den du tatsächlich hast
Schreib mir zuerst, was passiert, dein OS, GPU und VRAM. Ich sage dir ehrlich, ob ich es reparieren kann, bevor du bestellst. Wenn nicht, sage ich es dir, anstatt dein Geld zu nehmen.
Ich entwickle und verkaufe meine eigenen lokalen AI-Tools, also ist das keine Theorie.
Lerne Tara Lyne kennen
AI Automation and LLM Integration Developer
- AusVereinigte Staaten
- Mitglied seitFeb. 2026
Sprachen
Englisch
Automatische Übersetzung
Meine weiteren Dienstleistungen im Bereich KI-Entwicklung
FAQ
Automatische Übersetzung
Kannst du das reparieren, wenn ich Windows statt Linux benutze?
Ja. Die meisten dieser Fehler sind auf beiden Systemen gleich – Token-Budget, VRAM-Reserve, keep-alive und Kontextgröße spielen keine Rolle, welches OS du hast. Einige Dinge unterscheiden sich (Treiber, WSL, Speicherort der Modelle bei Ollama) und ich sage dir, was bei dir zutrifft.
Benötigst du Fernzugriff auf meinen Rechner?
Nein, und das bevorzuge ich auch. Bei den meisten Problemen arbeite ich anhand deiner Logs, deiner Konfiguration und der Ausgabe einiger schreibgeschützter Befehle, die ich dir gebe, und sende dir dann die Lösung mit Erklärung. Wenn du es lieber live machen willst, funktioniert eine Bildschirmfreigabe, aber das ist deine Entscheidung, kein Muss.
Was, wenn du es nicht beheben kannst?
Dann sage ich dir das auch. Schreib mir vor deiner Bestellung, was passiert und welche Hardware du hast, und ich sage dir ehrlich, ob ich es lösen kann. Ich würde lieber eine Bestellung ablehnen, als Geld für ein Problem zu nehmen, das ich nicht beheben kann.
Mein GPU ist klein oder ich benutze nur CPU. Ist das hoffnungslos?
Nein, aber die ehrliche Antwort könnte sein, dass das Modell, das du laufen lassen willst, nicht passt. Ein Teil meiner Arbeit ist es, dir zu sagen, was auf deiner Hardware wirklich gut läuft, anstatt dich mit einem Modell zu kämpfen, das nie funktionieren würde.
Gibst du mir nur ein Skript oder verstehe ich, was schiefgelaufen ist?
Du wirst es verstehen. Jede Lösung erklärt, was falsch war und warum, weil das gleiche Problem immer wiederkehrt und ich möchte, dass du es beim nächsten Mal erkennst, anstatt wieder eine Bestellung aufzugeben.

