Prime Intellect 上线 Prime Inference,提供开源模型无服务器推理

Prime Intellect 上线 Prime Inference,提供开源模型无服务器推理

N
News Editor
2026-10-03 05:39:45
AI 基础设施公司 Prime Intellect 推出推理服务平台 Prime Inference,面向前沿开源模型提供无服务器端点和预留容量两种服务。该平台运行在其自有多数据中心 GPU 集群上,支持 OpenAI 兼容 API,并采用 NVIDIA Dynamo、vLLM、Mooncake 和 FlashInfer 等技术。Prime Intellect 表示,平台公开发布前内部已每日处理近万亿个 Token。

AI 基础设施公司 Prime Intellect 推出推理服务平台 Prime Inference,面向前沿开源模型提供无服务器端点和预留容量服务。

Prime Intellect 表示,该平台运行在其自有的多数据中心 GPU 集群上,在公开发布前,内部每日处理近万亿个 Token。

Prime Inference 是 Prime Intellect 开放训练堆栈中的推理层,支持 OpenAI 兼容 API。其技术堆栈结合了 NVIDIA Dynamo、vLLM、Mooncake 和 FlashInfer,目标是优化智能体工作负载。

Prime Intellect 还称,其 GLM-5.3 端点在 OpenRouter 上速度领先,工具调用错误率接近零,自推出以来保持 100% 正常运行时间。

服务模式方面,平台提供两种选择:无服务器端点用于可变需求,预留容量用于持续工作负载。硬件目前采用 NVIDIA Blackwell,未来将支持 Vera Rubin。

团队级统一账单和用量跟踪功能已经上线,但具体按模型定价尚未完全公布。

该消息由 MarkTechPost 报道,Techub 进行了转载。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
200

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。