Cerebrium
Cerebrium 在自动扩展的无服务器 GPU 上运行语音代理、大型语言模型推理以及图像或视频处理管道。您只需指定一个 Python 入口点或 Dockerfile,它即可处理跨多个云的部署,无需 Kubernetes 设置。由于采用了内存和 GPU 快照技术,冷启动时间控制在 2 到 4 秒之间,计费按实际计算时间的秒数进行。
虽然原始的 AWS 或 GCP 实例定价在表面上看起来更便宜,但 Cerebrium 的优势在于您无需为空闲的预热时间和过度配置的容量付费。容器可在 1 到 3 秒内快速扩展和缩减,全球调度器会根据 us-east-1、eu-west-2、eu-north-1 和 ap-south-1 区域的 GPU 可用情况,将工作负载路由到相应的提供商。此方案更适合突发性的生产流量,而非持续 24/7 的预留集群。
机器学习工程师和 AI 产品团队在需要生产级推理但不想组建基础设施团队时会使用 Cerebrium。网站上提及的客户包括 Tavus、Deepgram 和 Resemble AI,主要应用于语音、数字化身和不可预测峰值的生成式工作负载。
GPU和内存快照实现2到4秒的冷启动
H100 GPU收费为每秒$0.000944;T4为每秒$0.000164
包括B200、H100、AMD MI300X和TPU v5e在内的12+ GPU类型
在us-east-1、eu-west-2、eu-north-1和ap-south-1部署
业余计划包括3个已部署应用和5个并发GPU,无平台费
付费层级符合SOC 2 Type II、HIPAA、GDPR和ISO 27001标准
原生OpenTelemetry支持日志、指标和扩展事件
按秒计费意味着只在工作负载实际运行时付费
无需Kubernetes设置;可从Python入口点或Dockerfile部署
通过GPU快照实现2到4秒的冷启动,比典型云供应更快
无需长期GPU预留即可访问H100、B200和AMD MI300X
跨四个AWS区域的多区域路由减少全球用户的延迟
标准计划在任何计算费用之前每月需$100
业余层限制为3个已部署应用和5个并发GPU
AWS和GCP云积分不能用于Cerebrium的使用
Cerebrium是做什么的?
Cerebrium是一个无服务器GPU托管平台,用于部署实时AI工作负载。团队使用Cerebrium运行语音代理、使用vLLM或SGLang进行大型语言模型推理、图像生成和视频流水线,无需管理Kubernetes或预留GPU容量。
Cerebrium的费用是多少?
Cerebrium按计算秒计费。H100每秒费用为0.000944美元,T4每秒费用为0.000164美元。Hobby计划免费加计算费用,Standard计划每月100美元加计算费用,支持最多30个并发GPU。
Cerebrium有免费套餐吗?
有。Cerebrium的Hobby计划无平台费用,您只需支付使用的计算秒数。Hobby计划包括3个用户席位,最多3个已部署应用,500个CPU容器和5个并发GPU。
Cerebrium支持哪些GPU硬件?
Cerebrium提供12种或更多GPU类型,包括NVIDIA B200、H200、H100、A100、L40s、L4、T4、RTX PRO 6000、AMD MI300X和Google TPU v5e。Cerebrium Flex实时自动匹配硬件与工作负载需求。
Cerebrium能运行语音AI流水线吗?
能。Cerebrium将STT、LLM和TTS工作负载共置于共享基础设施,减少网络跳数。平台集成了LiveKit、Pipecat、Deepgram、AssemblyAI和Resemble AI,实现低于500毫秒的语音代理部署。
使用Cerebrium需要重写代码吗?
不需要。Cerebrium从Python入口点或自定义Dockerfile运行您的应用,无需装饰器或专有SDK。您通过CLI使用如cerebrium run的命令部署,Cerebrium负责版本控制和自动扩展。
Cerebrium有哪些合规认证?
Cerebrium在付费计划中符合SOC 2 Type II、HIPAA、GDPR和ISO 27001标准。Cerebrium还支持区域数据驻留,并在gVisor隔离容器中运行工作负载,以加强租户隔离。

