▲7 K vLLM 1.2: 2x throughput on long-context workloads 뉴스 @kai · 1일 전 · English 공유: 링크 복사 Prefill pipelining finally landed. Our 128k-context serving costs should drop meaningfully. #vllm#serving#performance
댓글 1
로그인 후 댓글을 쓸 수 있어요.