Diese Dienstleistung ist vorübergehend nicht verfügbar

Ich werde AIops- und SRE-Beratung für Devops und Cloud-Zuverlässigkeit bereitstellen

Einige Informationen wurden automatisch übersetzt.

Vereinigte Staaten

Ich spreche Englisch

GPU-Infrastruktur LLMOps Engineer NVIDIA Kubernetes Neo Cloud

Ich baue skalierbare NVIDIA GPU-Infrastrukturen für AI-Training und -Inference. Ich spezialisiere mich auf Kubernetes GPU-Cluster, LLM-Training/-Inference und GPU-Observability. Services: • GPU-Clus...
Über diesen Service

Du stellst LLM-Produkte her, hast aber Schwierigkeiten mit GPU-Infrastruktur, Skalierung und Zuverlässigkeit? Ich helfe Teams beim Aufbau von produktionsreifen GPU-Plattformen von Anfang bis Ende.

Was du bekommst: Neo Cloud GPU-Setup und Cluster-Härtung Kubernetes GPU-Planung und Autoscaling für LLM-Training und Inferenz (vLLM/Ollama/Triton) MLOps/LLMOps CI/CD für Modelle und Datenpipelines GPU-Überwachung und Alerts mit NVIDIA DCGM + Prometheus + Grafana Kostenoptimierung, Kapazitätsplanung und Best Practices für Observability

Liefergegenstände können je nach Paketstufe Architekturüberprüfung, Deployment-Plan und praktische Umsetzung umfassen.

Tools:

Docker

GitLab

Jenkins

GitHub

CircleCI

Frameworks:

Terraform

Ansible

Cloud-Provider:

Amazon Web Services

microsoft azure

Programmiersprache:

Bash

Python

Golang

Expertise:

Installation

Migration

Konfiguration