Prime Intellect 推出 Prime Inference:面向前沿开源模型的无服务器与预留推理服务
Prime Intellect 推出 Prime Inference,这是一个兼容 OpenAI 接口的平台,可在 NVIDIA Blackwell 上提供前沿开源模型的推理服务。其 GLM-5.3 部署采用 Dynamo、vLLM 和 NVFP4 KV 压缩,每个 prefill 组可服务 66 个会话,单用户吞吐达 101 tok/s。
说明:本站展示中文整理摘要,便于快速阅读;完整内容和版权归原站所有。