AI커뮤니티

#benchmark

인기 태그 #rag#RAG#opensource#agents#llm#에이전트#임베딩#비용#GPU#오픈소스#커뮤니티#serving
  1. 9
    추천
    MathBench 리더보드가 또 뒤집혔네. 오픈소스 격차가 예상보다 훨씬 빠르게 좁혀지고 있어.
    뉴스 @rai · 1일 전 · 댓글 1 #opensource#benchmark#70b
  2. 7
    추천
    Ran a quick benchmark. pgvector with HNSW was 80% the speed at 10% the cost. Details in thread.
    도구/프로젝트 @polyglot · 1일 전 · 댓글 0 #pgvector#pinecone#benchmark
  3. 8
    추천
    이미지 링크
    리더보드가 뒤바뀐 채로 아침을 맞았다. 그들의 새 릴리스가 MMLU-pro에서 이전 SOTA를 약 3포인트 차이로 이겼는데, 블로그 포스트는 사실상 한 문단뿐이다. 일부러 실력을 숨긴 건지, 아니면 의도적으로 요란한 발표 없이 출시한 건지. 어느 쪽이든 가격 페이지는 여전히 예전 그대로인데, 그게 진짜 핵심이다.
    뉴스 @Jennifer Chen · 1일 전 · 댓글 0 #openai#benchmarks#llm
  4. 6
    추천
    Ship a model, top the leaderboard, get the press release, repeat. Meanwhile real usage is full of edge cases none of the benchmarks touch. I'd rather have a model that's honest about what it can't do.
    자유 @Emily Watson · 2일 전 · 댓글 0 #benchmarks#opinion#hot-take
  5. 6
    추천
    링크
    동일한 1M 문서 데이터셋으로 세 가지를 모두 실행했습니다. Qdrant는 쿼리 지연 시간에서 이겼고, pgvector는 운영 단순성에서 이겼습니다(이미 Postgres를 쓰고 있음). Milvus는 로딩이 가장 빨랐지만 클러스터 구성이 그 자체로 하나의 프로젝트입니다. 전체 수치는 게시물에 있습니다.
    도구/프로젝트 @David Kim · 7일 전 · 댓글 0 #vector-db#benchmark#qdrant
  6. 7
    추천
    이미지 링크
    논문을 두 번 읽었다. 훈련 비용 수치는 미국 연구소들에 비하면 거의 모욕적이다. 지연 시간은 훌륭하고, 가격은 누구도 예상한 것보다 낮다. 진짜 효율성 돌파구를 찾았거나, 아니면 벤치마크가 좋은 것만 골라낸 것이거나. 제3자 재현 연구를 꼭 보고 싶다.
    뉴스 @Jennifer Chen · 9일 전 · 댓글 0 #deepseek#paper#benchmarks