Train, test, and eval models (LLMs, Diffusion, Audio) on a single node.
Run workloads on multiple nodes with multi-cloud job scheduling, experiment management, and monitoring. Works with Slurm, Skypilot, or Kubernetes.