Cactus 是面向手机、可穿戴设备和边缘硬件的 AI 推理引擎,以自有计算图、ARM 优化内核和多语言绑定支持文本、语音、视觉及工具调用,并可按置信度转交云端。
Tag
inference
包含该标签的简调共 9 篇。
面向 Kubernetes 集群的 vLLM 生产参考实现,组合推理引擎、请求路由和可观测组件。
Microsoft BitNet.cpp 是面向 1-bit 语言模型的开源推理框架,官方仓库提供本地构建、模型运行和基准工具。
BentoML 是用于将 AI 模型封装为可部署服务的开源 Python 框架与工具链。
llama.cpp 是以 C/C++ 实现的开源 LLM 推理项目,面向本地和异构硬件上的模型推理与服务。
Ollama 是面向本地运行和调用语言模型的开源工具与服务接口。
面向 AI 训练和推理的 GPU 云与专用集群服务,核心卖点是把 NVIDIA GPU 算力以实例、集群和更大规模基础设施形式交付给模型团队。
面向开发者和企业的 AI 基础设施平台,围绕开放权重模型提供 Serverless 与专属推理、微调和训练、GPU 集群、评测及代码沙箱等能力。
面向开发者和企业的开放权重模型推理、后训练与部署平台,提供共享 API、专属 GPU 部署及客户云账户内的集群方案。