dstack
dstack是一个开源的异构AI计算编排层。它为机器学习团队提供一个控制平台,用于配置GPU、调度工作负载,以及在GPU云、Kubernetes集群和本地硬件上进行开发、训练和推理。
该平台标准化了在NVIDIA、AMD、Tenstorrent和TPU加速器上运行容器化AI任务的方式。你可以在仓库中以YAML的形式定义舰队、开发环境、任务、服务和卷,然后通过命令行界面、网页界面或HTTP API应用它们,而无需直接管理Kubernetes或Slurm。
dstack适合同时管理多个云账户或裸金属集群的团队,并希望实现从本地实验到分布式训练和生产推理的单一工作流程。它还提供dstack Sky,这是一个托管的GPU市场,以及支持SSO和空气隔离部署的企业版本。
通过一个配置管理AWS、GCP、Lambda、RunPod及其他GPU云中的计算集群
通过单条命令使用VS Code、Cursor或SSH创建远程开发环境
运行单节点或分布式训练任务,支持重试、调度和竞价策略
将模型推理部署为可扩展服务,自动处理自动伸缩和入口流量
连接现有的Kubernetes集群或可通过SSH访问的裸机主机作为后端
开箱即用,支持NVIDIA、AMD、TPU和Tenstorrent加速器
开源控制平面,您可以自托管,无需许可证费用
基于单一 YAML 的工作流,跨多个 GPU 云和本地集群
为开发环境、分布式训练和推理量身打造的基本组件
支持抢占实例、重试策略和 GPU 利用率监控
针对 TRL、Axolotl、vLLM、SGLang 及主要云服务提供商的文档示例
自托管设置需要在首次使用前配置云后端和凭据
Windows上的CLI依赖于Git for Windows和通过WSL风格工具的OpenSSH
dstack Sky GPU的小时费率根据实例类型和可用性有所不同
企业定价需要通过销售对话,而非自助结账
dstack 是免费使用的吗?
是的。dstack 是开源的,可以通过 pip、uv 或 Docker 免费自托管。dstack Sky 提供按需付费的 GPU 市场访问,而企业部署则支持单点登录(SSO)和专属支持,需要联系 dstack 团队。
dstack 支持哪些云服务提供商?
dstack 集成了主要的 GPU 云服务,包括 AWS、GCP、Azure、Lambda、Nebius、Crusoe、RunPod、Verda、DigitalOcean 和 JarvisLabs。您只需提供凭证,dstack 就会在您自己的云账户中分配计算资源。
dstack 可以运行在现有的 Kubernetes 集群上吗?
可以。dstack 通过 kubeconfig 文件连接 Kubernetes 集群,调度开发环境、任务和服务。您也可以使用基于虚拟机的云后端或通过 SSH 管理的裸金属服务器集群。
dstack 与 Kubernetes 或 Slurm 有何不同?
dstack 像 Kubernetes 一样编排容器,但提供了简化的、面向机器学习的原生接口,支持开发环境、分布式任务和推理服务等原语。与 Slurm 不同,它既支持交互式开发和生产推理,也支持批量训练作业。
什么是 dstack Sky?
dstack Sky 是 dstack 管理的托管 GPU 市场,允许您无需拥有自己的云账户即可访问市场 GPU,费用按小时计,例如 L40S 大约为 0.80 美元/小时,H100 大约为 1.90 美元/小时,并且可以与您自己的云后端同时使用。
dstack 支持哪些硬件加速器?
dstack 支持 NVIDIA、AMD、TPU 和 Tenstorrent 加速器。文档中包含了 AMD、Tenstorrent 和 TPU 工作负载的示例,以及标准的 NVIDIA GPU 训练和推理示例。

