项目详情
vLLM
高吞吐 LLM 推理引擎,PagedAttention,适合自托管服务。
打开 GitHub 原始仓库 ↗适合什么时候使用
GPU 集群/服务器上要高并发开源模型推理
不适合什么时候使用
笔记本一键试用(更看 Ollama)
筛选信息
- 领域
- 人工智能与智能体
- 语言
- Python
- 许可证
- 未标注
- 状态
- active
- 核验
- unverified
项目详情
高吞吐 LLM 推理引擎,PagedAttention,适合自托管服务。
打开 GitHub 原始仓库 ↗GPU 集群/服务器上要高并发开源模型推理
笔记本一键试用(更看 Ollama)