Ich richte dein GPU-Cluster und deine AI-Infrastruktur ein, validiere sie und behebe Probleme
Senior HPC- und AI-Infrastruktur-Ingenieur, GPU SLURM Linux
Über diesen Service
Du hast GPUs. Sie sollen zuverlässig als Rechenplattform funktionieren.
Ich baue und betreibe GPU- und HPC-Infrastruktur in der Produktion: Bereitstellung, Treiber- und CUDA-Stack-Validierung, Scheduling, Hochgeschwindigkeitsnetzwerke und Überwachung. Ich arbeite auf der Infrastruktur-Ebene. Ich bin kein ML-Ingenieur und werde auch keiner sein.
WAS ICH MACHE
GPU-Knoten aktivieren: NVIDIA-Treiber, CUDA-Toolkit und Runtime abstimmen, Persistenzmodus, MIG
Gesundheitsprüfung: DCGM-Diagnosen, Xid- und ECC-Fehleranalyse, Temperatur- und Stromchecks
Multi-Node-GPU-Kommunikation: nccl-tests All-Reduce-Benchmarking, NCCL-Tuning, Netzwerkpfad-Validierung
Scheduling: SLURM GPU-Partitionen und GRES, cgroups und Binden, oder Kubernetes mit dem NVIDIA-Geräte-Plugin und GPU-Operator
Überwachung: Prometheus, DCGM-Exporter, Grafana-Dashboards
Automatisierung: Ansible-Rollen, damit der Aufbau wiederholbar ist
BEVOR DU BESTELLST
Sende mir eine Nachricht mit der Anzahl der Knoten, GPU-Modell, Interconnect und was du beobachtest. Falls es etwas ist, das ich nicht wirklich beheben kann, sage ich es dir.
Du bekommst eine funktionierende Konfiguration, Benchmark-Ergebnisse, die zeigen, was sich geändert hat, und dokumentierte Anleitungen.
Server:
Datenbank-Server
Betriebssysteme:
Linux
Meine weiteren Dienstleistungen im Bereich Support & IT
FAQ
Automatische Übersetzung
Schreibst du CUDA-Kerne oder trainierst du Modelle?
Nein. Ich arbeite an der Infrastruktur darunter: Bereitstellung, Treiber, Scheduling, Netzwerke und Überwachung. Modelcode und Trainingsskripte fallen nicht in meinen Aufgabenbereich, und ich würde lieber sagen, dass ich das nicht gut kann, als Arbeit anzunehmen, die ich nicht gut mache.
Welchen Zugang benötigen Sie, um loszulegen?
SSH mit sudo auf den Knoten und Zugriff auf BMC oder IPMI, falls Hardware-Checks notwendig sind. Für die Grunddiagnose reicht in der Regel Lesezugriff aus, um zu starten.
Arbeitest du mit Cloud-GPUs oder nur vor Ort?
Beides. Bare-metal-Cluster vor Ort und AWS GPU-Instanzen.
Unsere GPUs sind kaum ausgelastet. Kannst du herausfinden warum?
In der Regel ja. Geringe Auslastung liegt meist an Scheduling, Datenladen, NUMA und Affinität oder am Interconnect. Die Basic-Diagnose ist genau für diese Frage gemacht, und du bekommst die Messwerte, die hinter der Antwort stehen.
Unterstützt du InfiniBand-Netzwerke?
Meine Erfahrung mit Hochgeschwindigkeitsnetzwerken betrifft Ethernet und RoCE, nicht InfiniBand. Falls dein Netzwerk InfiniBand ist, sage ich dir das vor deiner Bestellung, anstatt auf deinem Cluster zu lernen.
2 Bewertungen für diesen Service
| (2) | ||
| (0) | ||
| (0) | ||
| (0) | ||
| (0) |
Zusammensetzung der Bewertung
- Kommunikation
- Qualität der Lieferung
- Preis-Leistungs-Verhältnis der Lieferung
Sortieren nach:
A apreda1

Vereinigte Staaten
I hired him again he assisted me with my project very effectively. I definitely recommend him
50 $-100 $
Preis
1 Tag
Dauer
Hilfreich?A aimen39

Algerien
Best seller + communication + skills + knowledge
50 $-100 $
Preis
1 Tag
Dauer
H 
Antwort des Freelancers
Hilfreich?
2 Bewertungen für diesen Service
| (2) | ||
| (0) | ||
| (0) | ||
| (0) | ||
| (0) |
Zusammensetzung der Bewertung
- Kommunikation
- Qualität der Lieferung
- Preis-Leistungs-Verhältnis der Lieferung
Sortieren nach:
A apreda1

Vereinigte Staaten
I hired him again he assisted me with my project very effectively. I definitely recommend him
50 $-100 $
Preis
1 Tag
Dauer
Hilfreich?A aimen39

Algerien
Best seller + communication + skills + knowledge
50 $-100 $
Preis
1 Tag
Dauer
H 
Antwort des Freelancers
Hilfreich?
