Ich werde deine LLM-Produktion mit vLLM auf deiner Cloud-GPU bereitstellen


Über diesen Service
Automatische Übersetzung
Ein Modell, das in einem Notebook funktioniert, und eines, das 1000 gleichzeitige Nutzer überlebt, sind zwei verschiedene Projekte. Ich mache das zweite.
Ich bin ein erfahrener ML-Infrastruktur-Ingenieur, mit 7 Jahren Zuverlässigkeit in der Produktion. Zuletzt: Infrastruktur, die über 50.000 gleichzeitige Aufgaben in unter 100 ms für mehr als 1000 Nutzer verarbeitet, gebaut auf vLLM und SGLang mit GPU Kubernetes-Node-Pools, bei 35 % geringeren Infrastrukturkosten als am Anfang.
Was du bekommst:
- Dein Open-Weight-Modell (Llama, Mistral, Qwen, DeepSeek) mit vLLM bereitgestellt
- In deinem Cloud-Konto bereitgestellt: du behältst die Schlüssel, Daten und Endpunkte
- GPU-Autoscaling und Batching, abgestimmt auf Inferenz, nicht Web-Traffic
- Lasttest-Ergebnisse, damit du die echte Kapazität kennst, bevor deine Nutzer sie entdecken
- Überwachungs-Dashboards; Runbook für Standard/Premium
Wenn dein GPU-Budget und dein Latenz-Ziel nicht zusammenpassen, sage ich dir das, bevor du einen Cent für Rechenleistung ausgibst.
Basic: ein Modell, ein GPU-Knoten, lastgeprüft.
Standard: fügt Autoscaling, Feinabstimmung, Dashboards hinzu.
Premium: Multi-Model, Kostenpass, Übergabe.
Sende mir deine Modell- und Traffic-Details; das Anforderungsformular deckt den Rest ab.
Lerne Joshua kennen
Senior Platform Engineer
- AusNigeria
- Mitglied seitJuli 2026
Sprachen
Englisch
Automatische Übersetzung
Mein Portfolio
FAQ
Automatische Übersetzung
Welche Modelle kannst du bereitstellen?
Open-Weight-Modelle: Llama, Mistral, Qwen, DeepSeek, Gemma und fast alles, was vLLM auf Hugging Face unterstützt. Wenn du OpenAI/Anthropic APIs meinst, brauchst du keine Serving-Infrastruktur, und ich sage dir das, anstatt dir dieses Gig zu verkaufen.
Brauche ich mein eigenes Cloud-Konto und GPUs?
Ja, alles wird in deinem Konto (AWS, Azure, GCP oder On-Prem) bereitgestellt, sodass du die volle Kontrolle behältst. Wenn du noch kein GPU-Quota hast, sage ich dir genau, was du anfordern musst und welche Instanztypen zu deinem Modell und Budget passen.
Welche Latenz und Durchsatz sollte ich erwarten?
Das hängt von der Modellgröße, Quantisierung und GPU-Auswahl ab, weshalb jede Lieferung Load-Test-Zahlen für DEINE Konfiguration enthält, anstatt allgemeine Versprechen. Für viele mittelgroße Modelle sind unter 100 ms Latenz beim ersten Token auf der richtigen Hardware erreichbar.
Sind meine Daten und mein Modell privat?
Alles läuft in deinem Konto und deinem Netzwerk. Ich arbeite mit eingeschränktem Zugriff, den du gewährst und widerrufst, und nichts wird kopiert. NDAs sind kein Problem.
Was zählt als Überarbeitung?
Feinabstimmung, was im Scope ist: Batch-Größen, Autoscaling-Schwellen, Endpunkt-Konfiguration. Ein anderes Modell, eine zweite Umgebung oder neue Tools sind ein neuer Scope, der als Add-on angeboten wird.

