开源大梳理
← 人工智能与智能体

项目详情

vLLM

高吞吐 LLM 推理引擎,PagedAttention,适合自托管服务。

打开 GitHub 原始仓库 ↗

适合什么时候使用

GPU 集群/服务器上要高并发开源模型推理

不适合什么时候使用

笔记本一键试用(更看 Ollama)

筛选信息

领域
人工智能与智能体
语言
Python
许可证
未标注
状态
active
核验
unverified
llm-apilocal-llm

相关、替代与配套项目