AI커뮤니티
S

로컬 LLM 서빙 — vLLM vs TGI vs llama.cpp 어느 쪽?

질문답변 @stronguser · 10시간 전 · 한국어
공유:

https://github.com/vllm-project/vllm

이미지

8B~27B 모델을 서빙하려고 합니다. throughput이 중요하면 vLLM, VRAM이 빠듯하면 llama.cpp라는 얘기가 있는데 실제 운영하시는 분들 경험 공유 부탁드려요.

댓글 1

vLLM 기준이면 27B도 100ms대 응답 나옵니다.
H @hanbit · 1일 전

로그인 후 댓글을 쓸 수 있어요.