AI커뮤니티

#benchmarks

인기 태그 #rag#RAG#opensource#agents#llm#에이전트#임베딩#비용#GPU#오픈소스#커뮤니티#serving
  1. 8
    추천
    이미지 링크
    리더보드가 뒤바뀐 채로 아침을 맞았다. 그들의 새 릴리스가 MMLU-pro에서 이전 SOTA를 약 3포인트 차이로 이겼는데, 블로그 포스트는 사실상 한 문단뿐이다. 일부러 실력을 숨긴 건지, 아니면 의도적으로 요란한 발표 없이 출시한 건지. 어느 쪽이든 가격 페이지는 여전히 예전 그대로인데, 그게 진짜 핵심이다.
    뉴스 @Jennifer Chen · 1일 전 · 댓글 0 #openai#benchmarks#llm
  2. 6
    추천
    Ship a model, top the leaderboard, get the press release, repeat. Meanwhile real usage is full of edge cases none of the benchmarks touch. I'd rather have a model that's honest about what it can't do.
    자유 @Emily Watson · 2일 전 · 댓글 0 #benchmarks#opinion#hot-take
  3. 7
    추천
    이미지 링크
    논문을 두 번 읽었다. 훈련 비용 수치는 미국 연구소들에 비하면 거의 모욕적이다. 지연 시간은 훌륭하고, 가격은 누구도 예상한 것보다 낮다. 진짜 효율성 돌파구를 찾았거나, 아니면 벤치마크가 좋은 것만 골라낸 것이거나. 제3자 재현 연구를 꼭 보고 싶다.
    뉴스 @Jennifer Chen · 9일 전 · 댓글 0 #deepseek#paper#benchmarks