S
로컬 LLM 서빙 — vLLM vs TGI vs llama.cpp 어느 쪽?
https://github.com/vllm-project/vllm

8B~27B 모델을 서빙하려고 합니다. throughput이 중요하면 vLLM, VRAM이 빠듯하면 llama.cpp라는 얘기가 있는데 실제 운영하시는 분들 경험 공유 부탁드려요.
https://github.com/vllm-project/vllm

댓글 1
로그인 후 댓글을 쓸 수 있어요.