Ich werde deine LLM-Produktion mit vLLM auf deiner Cloud-GPU bereitstellen

I
ike_kolawole
I
ike_kolawole
Joshua
Einige Informationen wurden automatisch übersetzt.

Über diesen Service

Automatische Übersetzung

Ein Modell, das in einem Notebook funktioniert, und eines, das 1000 gleichzeitige Nutzer überlebt, sind zwei verschiedene Projekte. Ich mache das zweite.


Ich bin ein erfahrener ML-Infrastruktur-Ingenieur, mit 7 Jahren Zuverlässigkeit in der Produktion. Zuletzt: Infrastruktur, die über 50.000 gleichzeitige Aufgaben in unter 100 ms für mehr als 1000 Nutzer verarbeitet, gebaut auf vLLM und SGLang mit GPU Kubernetes-Node-Pools, bei 35 % geringeren Infrastrukturkosten als am Anfang.


Was du bekommst:

  • Dein Open-Weight-Modell (Llama, Mistral, Qwen, DeepSeek) mit vLLM bereitgestellt
  • In deinem Cloud-Konto bereitgestellt: du behältst die Schlüssel, Daten und Endpunkte
  • GPU-Autoscaling und Batching, abgestimmt auf Inferenz, nicht Web-Traffic
  • Lasttest-Ergebnisse, damit du die echte Kapazität kennst, bevor deine Nutzer sie entdecken
  • Überwachungs-Dashboards; Runbook für Standard/Premium

Wenn dein GPU-Budget und dein Latenz-Ziel nicht zusammenpassen, sage ich dir das, bevor du einen Cent für Rechenleistung ausgibst.


Basic: ein Modell, ein GPU-Knoten, lastgeprüft.

Standard: fügt Autoscaling, Feinabstimmung, Dashboards hinzu.

Premium: Multi-Model, Kostenpass, Übergabe.


Sende mir deine Modell- und Traffic-Details; das Anforderungsformular deckt den Rest ab.

Lerne Joshua kennen

Joshua

Senior Platform Engineer

  • AusNigeria
  • Mitglied seitJuli 2026
  • Sprachen

    Englisch
Deployments on my platforms are boring, and that's the point. Seven years of production infrastructure: multi-cloud Kubernetes (EKS/AKS), Terraform at 20+ module scale, CI/CD with automatic rollback at 99.9% deploy success. One team went from 40% failed deploys to 5% after I rebuilt their pipelines; a fintech's PCI-DSS audits returned zero critical findings. I also build ML serving infrastructure: 50,000+ concurrent tasks at sub-100ms using vLLM on GPU node pools. Hand me a breaking pipeline, an untrusted cluster, or a cloud bill that grew quietly, and get it fixed properly.

Automatische Übersetzung

Mein Portfolio