85FreeIndexed/ ai-tools

vllm

A high-throughput and memory-efficient inference and serving engine for LLMs

92.7k stars3k contributorsupdated 26m agovllm-project/vllm

About

A high-throughput and memory-efficient inference and serving engine for LLMs

Topics: amd, blackwell, cuda, deepseek, deepseek-v3, gpt, gpt-oss, inference, kimi, llama, llm, llm-serving, model-serving, moe, openai, pytorch, qwen, qwen3, tpu, transformer

Tags

amdblackwellcudadeepseekdeepseek-v3gptgpt-ossinferencekimillamallmllm-servingmodel-servingmoeopenaipytorchqwenqwen3tputransformer

GitHub signals

Indexed
stars
92.7k
forks
22.7k
contributors
3k
last commit
26m ago
Verify on GitHub

Details

Category
AI Tools
Type
AI tool
Pricing
Open source
Visit
vllm.ai

Stack

Pythonamdblackwellcudadeepseekdeepseek-v3gptgpt-ossinferencekimillamallmllm-servingmodel-servingmoeopenaipytorchqwenqwen3tputransformer

Engagement

claps
0
views
0

Similar tools