Prime Intellect 上线 Prime Inference,提供开源模型无服务器推理
AI 基础设施公司 Prime Intellect 推出推理服务平台 Prime Inference,面向前沿开源模型提供无服务器端点和预留容量两种服务。该平台运行在其自有多数据中心 GPU 集群上,支持 OpenAI 兼容 API,并采用 NVIDIA Dynamo、vLLM、Mooncake 和 FlashInfer 等技术。Prime Intellect 表示,平台公开发布前内部已每日处理近万亿个 Token。








