vLLM Project 下面向生成式 AI 推理的云原生开源基础设施,组合网关路由、弹性伸缩、运行时与分布式 KV cache。
Category
基础设施
该分类当前有 60 篇简调。
Google 开源的命令行工具与技能包,让编码代理能够创建、评测并部署 Google Cloud 智能体项目。
KServe 面向生成式 AI 推理的 Kubernetes 自定义资源,用统一声明描述模型、工作负载、路由、调度与并行策略。
面向大模型推理的开源 KV cache 管理层,把临时缓存变成可跨请求、会话和推理实例复用的分层基础设施。
Meta 面向开发者推出的模型接口,目前以公共预览方式提供 Muse Spark 1.1,支持智能体、多模态、搜索与兼容式 API 接入。
Moonshot AI 为 Kimi 构建并开源的 KV Cache 中心化大模型服务系统,通过预填充与解码分离提高资源利用率。
NVIDIA 基于 Thor 架构公布的两款 Jetson 边缘 AI 模组,面向机器人、视觉代理与自主机器;量产前宜用开发套件仿真验证算力、内存、功耗和软件兼容。
TPU Developer Hub 汇总 Google Cloud TPU 从架构、训练、后训练到推理、调试和安全的官方资源,适合作为上手与评审入口,而非独立算力服务。
Cloudflare 面向 Workers 推出的 Agent 开发与运行框架,以 Durable Objects 承载身份、状态、实时连接和定时任务。
Llama Stack 起源于 Meta 的标准化 AI 应用接口提案;截至 2026 年 8 月,其官方仓库已更名并转向模型无关的 OGX。
MTIA 300–500 是 Meta 面向推荐、训练和生成式 AI 推理持续迭代的自研加速器家族。
NemoClaw 把 Agent、推理服务与 OpenShell 沙箱组合成可安装、可治理的参考栈,重点解决长期运行 Agent 的权限、网络与凭据边界。
NVIDIA AI Enterprise 体系中的推理微服务,把模型、优化运行时与标准 API 封装为可在云端或数据中心部署的容器。
OpenAI 与 Broadcom 联合公布的首款 Intelligence Processor,围绕大模型推理的计算、内存移动、网络和服务模式协同设计。
Thinking Machines Lab 提供的托管后训练服务,让研究者控制数据、损失与训练循环,由平台处理分布式算力和故障恢复。
Mistral 提供的专用 GPU 云与托管基础设施,覆盖裸金属、Kubernetes、Slurm 以及训练和推理运维。
NVIDIA KVPress 汇集多种训练无关的 KV Cache 压缩方法,并提供基于 Transformers 的统一接口与长上下文评测工具。
Envoy AI Gateway 在 Kubernetes 与 Envoy Gateway 之上统一连接多种模型服务,为生成式 AI 请求提供路由、认证、策略和可观测能力。
vLLM 社区维护的昇腾硬件插件,为大语言模型在 Ascend NPU 上提供与 vLLM 对接的推理和服务路径。
Chitu(赤兔)是 thu-pacman 团队开源的大模型推理框架,重点覆盖多种硬件、从单机到集群的部署与生产服务。
Cactus 是面向手机、可穿戴设备和边缘硬件的 AI 推理引擎,以自有计算图、ARM 优化内核和多语言绑定支持文本、语音、视觉及工具调用,并可按置信度转交云端。
nano-vLLM 是一个轻量、可读的 vLLM 风格推理实现,适合教学、代码研读和受控实验,不宜未经压测直接替代成熟生产引擎。
面向 Kubernetes 集群的 vLLM 生产参考实现,组合推理引擎、请求路由和可观测组件。
vLLM Semantic Router 在模型服务前按请求语义选择模型、工具与策略,适合多模型推理平台,但需要用业务流量校准路由并保留安全回退。
Microsoft BitNet.cpp 是面向 1-bit 语言模型的开源推理框架,官方仓库提供本地构建、模型运行和基准工具。
DeepEP 为混合专家模型训练与推理提供高吞吐、低延迟的 GPU 通信内核,适合能控制并测量底层分布式环境的平台团队。
3FS 是面向 AI 训练与推理工作负载的开源分布式文件系统;应先在隔离集群验证数据加载、检查点与故障恢复。
FlashMLA 提供针对多头潜在注意力的高性能 CUDA 内核,适合有明确硬件、模型结构与基准能力的推理基础设施团队评估。
面向分布式大语言模型推理服务的开源基础设施项目。
NVIDIA 的开源分布式推理编排栈,面向多节点模型服务的部署与运行管理。
NIXL 为分布式 AI 系统提供统一的数据传输接口与插件机制,重点服务 KV 缓存等跨内存层移动,价值取决于真实拓扑下的端到端验证。
Qdrant 是面向向量相似度检索与过滤的开源数据库。
Traceloop 是用于追踪和观测 LLM 应用执行过程的工具。
Weaviate 是面向向量检索与 AI 应用数据访问的数据库平台。
Axolotl 是用于语言模型后训练与微调的开源工具。
BentoML 是用于将 AI 模型封装为可部署服务的开源 Python 框架与工具链。
Dagster 是用于数据资产与工作流编排的产品。
fal 是用于生成式媒体模型推理的产品。
LiteLLM 是将多家模型接口统一到代理与 SDK 层的开源项目。
llama.cpp 是以 C/C++ 实现的开源 LLM 推理项目,面向本地和异构硬件上的模型推理与服务。
Ollama 是面向本地运行和调用语言模型的开源工具与服务接口。
OpenRouter 提供面向多家模型的统一 API 与路由服务。
Prefect 是面向团队的 数据工作流编排 产品。
Temporal 是用于持久化工作流编排的产品或开源项目。
Unsloth 是用于本地运行和微调语言模型的开源工具项目。
Mistral 开源的生产搜索管线框架,将数据摄取、检索和评测放在统一接口下。
围绕 Ray 生态构建的 AI 计算平台,服务分布式训练、批量推理、模型服务、LLM 与生成式 AI 工作负载。
面向生产级 AI 推理的平台,围绕 Truss、Baseten Inference Stack 和 Chains 提供自定义模型部署、扩缩容、低延迟和 compound AI 工作流能力。
围绕 wafer-scale AI 芯片构建训练与推理基础设施的公司,核心卖点是用超大芯片和云服务提供低延迟、高吞吐的 AI 计算。
面向 AI 训练、推理和应用开发的专用云平台,核心优势是围绕 GPU/加速计算构建的基础设施和托管服务。
围绕自研 LPU 推理芯片和 GroqCloud 提供高速、低成本 LLM 推理服务,主打 public、private 和 co-cloud 部署形态。
面向 AI 训练和推理的 GPU 云与专用集群服务,核心卖点是把 NVIDIA GPU 算力以实例、集群和更大规模基础设施形式交付给模型团队。
面向开发者的云端模型运行平台,用户可以通过 API 运行社区模型、官方模型,或部署自己的自定义模型。
面向大语言模型和多模态模型的开源高性能推理服务框架,强调低延迟、高吞吐、OpenAI 兼容接口和从单 GPU 到分布式集群的部署。
面向开发者和企业的 AI 基础设施平台,围绕开放权重模型提供 Serverless 与专属推理、微调和训练、GPU 集群、评测及代码沙箱等能力。
面向 AI 与数据团队的代码优先 Serverless 计算平台,覆盖 GPU 推理、训练、批处理、Notebook 与 Agent Sandbox。
Ray 是面向 AI 与 Python 工作负载的开源分布式计算框架,Anyscale 是围绕 Ray 做生产化、托管化和企业化的平台公司。
面向开发者和企业的开放权重模型推理、后训练与部署平台,提供共享 API、专属 GPU 部署及客户云账户内的集群方案。
vLLM 是一个开源的大模型推理与服务引擎,核心用途是让开发者更高效地部署和服务 LLM / 多模态模型。
以开源节点式工作流核心为基础,同时提供官方 Cloud、API 与 Enterprise 服务的视觉 AI 创作与生产引擎。