Implementation
Step 1: Prepare the YAML manifest
apiVersion: v1
kind: Pod
metadata:
name: h100-rdma-test
namespace: default
spec:
runtimeClassName: nvidia
nodeSelector:
nvidia.com/gpu.product: NVIDIA-H100-80GB-HBM3
securityContext:
runAsNonRoot: true
runAsUser: 1000
containers:
- name: cuda
image: nvidia/cuda:12.4.1-base-ubuntu22.04
command: ["sh", "-c", "nvidia-smi && sleep 3600"]
securityContext:
allowPrivilegeEscalation: false
runAsNonRoot: true
runAsUser: 1000
resources:
requests:
nvidia.com/gpu: 1
rdma/ib_shared_device: 1
limits:
nvidia.com/gpu: 1
rdma/ib_shared_device: 1Step 2: Deploy the Pod
Step 3: Monitor the deployment
Step 4: Verify GPU access
Last updated
