| vLLM | PagedAttention + 连续批处理 + FlashInfer集成 + Micro-Agent(API内多模型协作) | 很高(生产基准强) | 高 | NVIDIA GPU(H100/B200最佳)、AMD ROCm、Intel Gaudi、部分TPU | 高并发生产服务、企业级OpenAI兼容API、多模型实验、Agent协作 | LoRA支持仍需额外配置、极致单卡不如TRT-LLM |
| SGLang | RadixAttention(前缀缓存) + 结构化输出(XGrammar) + 零开销批处理 + Agent流水线 | 极高(共享前缀场景领先) | 中等 | NVIDIA GPU(Hopper/Blackwell最佳)、AMD ROCm(良好) | 复杂Agent、多轮对话、RAG、结构化/函数调用任务 | 学习曲线较陡、早期依赖解析稍复杂、生态仍在快速迭代 |
| TensorRT-LLM | NVIDIA TensorRT深度内核优化 + MoE高效支持 + FP8/NVFP4 + NVIDIA Dynamo集成 | 最高(单卡/固定模型极致) | 中等(需编译) | 仅限NVIDIA GPU(H100/B200/L40S等最优) | 追求极致延迟与吞吐的长期生产环境(单一模型) | 仅NVIDIA、编译配置复杂、模型切换成本高 |
| LMDeploy | TurboMind(C++极致优化) + PyTorch后端 + Persistent Batch | 很高(H100基准常与SGLang并列第一) | 高 | NVIDIA GPU、华为昇腾(Ascend)、部分AMD | 国产化场景、多模态、混合硬件、量化推理 | 社区规模小于vLLM、国际模型支持略滞后 |
| Ollama | 基于llama.cpp封装 + OpenAI API兼容 + 一键管理 | 中等 | 极高(一键) | CPU(x86/ARM)、NVIDIA、AMD ROCm、Apple Silicon(Metal) | 个人开发、本地快速原型、Mac用户、本地测试 | 吞吐量不高、不适合高并发生产 |
| llama.cpp | GGUF量化 + 多后端加速(cuBLAS/rocBLAS/Metal/Vulkan/SYCL) | 中等(边缘强) | 中等 | 最广:CPU(x86/ARM)、NVIDIA、AMD、Apple Metal、Vulkan等 | 边缘设备、低端硬件、本地离线、最大兼容场景 | 吞吐量一般、分布式/高并发支持较弱 |
| XInference | 多后端集成(vLLM/Transformers/GGUF等) + 分布式 + 多模态统一管理 | 很高(分布式场景突出) | 高 | NVIDIA、AMD ROCm、华为昇腾(部分)、CPU、分布式集群 | 多模型统一管理、混合硬件集群、OpenAI兼容服务 | 近期PyPI安全事件需谨慎(用官方最新版)、单机纯吞吐不如专注框架 |
| LM Studio | 桌面 GUI + 本地服务器(llama.cpp + MLX) | 中等(依赖底层) | 极高(GUI最佳) | CPU + NVIDIA + AMD + Apple Silicon (MLX) | 个人探索、模型测试、初学者、本地聊天、快速原型 | 不适合高并发生产;GUI 开销;底层性能受 llama.cpp/MLX 限制;闭源部分较多 |
| oMLX | MLX-based inference server(带 paged SSD KV cache) | 高(Apple 单机,Agent 场景强) | 高(Mac 原生菜单栏 + API) | 仅 Apple Silicon | Mac 上复杂 Agent、长上下文编码、Coding Agent(Cursor/Claude Code 本地替代) | 仅限 Mac;社区较新;跨平台为零;高并发生产能力仍弱于 vLLM 类 |
| MLC-LLM | 统一编译 pipeline + WebGPU / mobile / edge 原生支持 | 中高(跨平台) | 中高 | 最广跨平台:浏览器、移动端(iOS/Android)、边缘设备、CPU/GPU | 移动/浏览器/跨平台部署、边缘推理、Web集成 | 单机高吞吐不如专用GPU框架;新模型支持可能滞后 |
| NVIDIA Dynamo | Disaggregated prefill/decode + KV-cache智能路由 + 多引擎统一调度(vLLM/SGLang/TRT-LLM) | 极高(多节点) | 中等 | NVIDIA GPU集群(Blackwell最优) | 大规模生产集群、异构引擎统一管理、高并发企业部署 | 主要NVIDIA生态;运维复杂度较高 |