AI 基础设施公司 Prime Intellect 推出推理服务平台 Prime Inference,面向前沿开源模型提供无服务器端点和预留容量服务。
Prime Intellect 表示,该平台运行在其自有的多数据中心 GPU 集群上,在公开发布前,内部每日处理近万亿个 Token。
Prime Inference 是 Prime Intellect 开放训练堆栈中的推理层,支持 OpenAI 兼容 API。其技术堆栈结合了 NVIDIA Dynamo、vLLM、Mooncake 和 FlashInfer,目标是优化智能体工作负载。
Prime Intellect 还称,其 GLM-5.3 端点在 OpenRouter 上速度领先,工具调用错误率接近零,自推出以来保持 100% 正常运行时间。
服务模式方面,平台提供两种选择:无服务器端点用于可变需求,预留容量用于持续工作负载。硬件目前采用 NVIDIA Blackwell,未来将支持 Vera Rubin。
团队级统一账单和用量跟踪功能已经上线,但具体按模型定价尚未完全公布。
该消息由 MarkTechPost 报道,Techub 进行了转载。
本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.

