AI커뮤니티
K

vLLM 1.2: 2x throughput on long-context workloads

뉴스 @kai · 1일 전 · English
공유:
Prefill pipelining finally landed. Our 128k-context serving costs should drop meaningfully.

댓글 1

프리필 파이프라이닝 덕에 우리 서버 비용 -30% 예상합니다.
G @gptkim · 1일 전

로그인 후 댓글을 쓸 수 있어요.