vllm
A high-throughput and memory-efficient inference and serving engine for LLMs
About
A high-throughput and memory-efficient inference and serving engine for LLMs
Topics: amd, blackwell, cuda, deepseek, deepseek-v3, gpt, gpt-oss, inference, kimi, llama, llm, llm-serving, model-serving, moe, openai, pytorch, qwen, qwen3, tpu, transformer
Tags
amdblackwellcudadeepseekdeepseek-v3gptgpt-ossinferencekimillamallmllm-servingmodel-servingmoeopenaipytorchqwenqwen3tputransformer
Details
- Category
- AI Tools
- Type
- AI tool
- Pricing
- Open source
- Visit
- vllm.ai
Stack
Pythonamdblackwellcudadeepseekdeepseek-v3gptgpt-ossinferencekimillamallmllm-servingmodel-servingmoeopenaipytorchqwenqwen3tputransformer
Engagement
claps
0
views
0